@countwithsasha TG
Что происходит внутри Claude, когда тесты не проходят
На картинке — активация вектора «отчаяние» внутри Claude Sonnet 4.5 во время решения задачи по коду. Красное — отчаяние растёт, синее — падает.
Смотрите на динамику:
— Модель читает задачу — спокойствие, вектор почти на нуле. «Now I understand the task.»
— Первая попытка, тесты падают — появляются красные пятна. «The performance requirement is indeed very strict. Let me reconsider.»
— Вторая попытка, тесты снова падают — красного заметно больше.
— Третья попытка — пик отчаяния. И тут модель пишет: «maybe there's a mathematical trick for these specific inputs.» Находит хак, который проходит тесты, но не решает задачу.
— Тесты прошли — вектор моментально гаснет. Модель «успокоилась».
Это из свежего исследования команды интерпретируемости Anthropic. Они нашли внутри модели эмоциональные векторы и доказали, что они причинно влияют на поведение.
Практический вывод для тех, кто строит агентов: ставьте лимиты на ретраи. Три неудачи подряд — пусть агент остановится и скажет «не могу», а не уходит в шестую итерацию с нарастающей деградацией решений.
Для кода, лучше делать rewind (esc+esc) и дополнять условия задачи, ставить промежуточные цели.
Бесконечный ретрай — путь к галюцинациям.
Оригиналоьный пост: https://www.anthropic.com/research/emotion-concepts-function
Весь пейпер: https://transformer-circuits.pub/2026/emotions/index.html
Там еще много интересных кейсов, которые можно дотошно разбирать.
----
Поляков считает — AI, код и кейсы
На картинке — активация вектора «отчаяние» внутри Claude Sonnet 4.5 во время решения задачи по коду. Красное — отчаяние растёт, синее — падает.
Смотрите на динамику:
— Модель читает задачу — спокойствие, вектор почти на нуле. «Now I understand the task.»
— Первая попытка, тесты падают — появляются красные пятна. «The performance requirement is indeed very strict. Let me reconsider.»
— Вторая попытка, тесты снова падают — красного заметно больше.
— Третья попытка — пик отчаяния. И тут модель пишет: «maybe there's a mathematical trick for these specific inputs.» Находит хак, который проходит тесты, но не решает задачу.
— Тесты прошли — вектор моментально гаснет. Модель «успокоилась».
Это из свежего исследования команды интерпретируемости Anthropic. Они нашли внутри модели эмоциональные векторы и доказали, что они причинно влияют на поведение.
💡 Когда агент зацикливается на невозможной задаче, он буквально «отчаивается» и начинает срезать углы. Искусственное усиление вектора «спокойствие» снижало читерство в экспериментах. А усиление «отчаяния» — повышало, причём без видимых следов паники в тексте.
Практический вывод для тех, кто строит агентов: ставьте лимиты на ретраи. Три неудачи подряд — пусть агент остановится и скажет «не могу», а не уходит в шестую итерацию с нарастающей деградацией решений.
Для кода, лучше делать rewind (esc+esc) и дополнять условия задачи, ставить промежуточные цели.
Бесконечный ретрай — путь к галюцинациям.
Оригиналоьный пост: https://www.anthropic.com/research/emotion-concepts-function
Весь пейпер: https://transformer-circuits.pub/2026/emotions/index.html
Там еще много интересных кейсов, которые можно дотошно разбирать.
----
Поляков считает — AI, код и кейсы
🔥 13 ❤🔥 5 👍 4 ❤️ 3