Skip to main content

Что происходит внутри Claude, когда тесты не проходятНа картинке — активация вектора «отчаяние» внутри Claude Sonnet 4.5 во время решения задачи по коду. Красное — отчаяние растёт, синее — падает.Смотрите на динамику:— Модель читает задачу — спокойствие, вектор почти на нуле. «Now I understand the task.»— Первая попытка, тесты падают — появляются красные пятна. «The performance requirement is indeed very strict. Let me reconsider.»— Вторая попытка, тесты снова падают — красного заметно больше.— Третья попытка — пик отчаяния. И тут модель пишет: «maybe there's a mathematical trick for these specific inputs.» Находит хак, который проходит тесты, но не решает задачу.— Тесты прошли — вектор моментально гаснет. Модель «успокоилась».Это из свежего исследования команды интерпретируемости Anthropic. Они нашли внутри модели эмоциональные векторы и доказали, что они причинно влияют на поведение.💡 Когда агент зацикливается на невозможной задаче, он буквально «отчаивается» и начинает срезать углы. Искусственное усиление вектора «спокойствие» снижало читерство в экспериментах. А усиление «отчаяния» — повышало, причём без видимых следов паники в тексте.Практический вывод для тех, кто строит агентов: ставьте лимиты на ретраи. Три неудачи подряд — пусть агент остановится и скажет «не могу», а не уходит в шестую итерацию с нарастающей деградацией решений. Для кода, лучше делать rewind (esc+esc) и дополнять условия задачи, ставить промежуточные цели.Бесконечный ретрай — путь к галюцинациям.Оригиналоьный пост:

  1. @countwithsasha TG

    Что происходит внутри Claude, когда тесты не проходят

    На картинке — активация вектора «отчаяние» внутри Claude Sonnet 4.5 во время решения задачи по коду. Красное — отчаяние растёт, синее — падает.

    Смотрите на динамику:

    — Модель читает задачу — спокойствие, вектор почти на нуле. «Now I understand the task.»

    — Первая попытка, тесты падают — появляются красные пятна. «The performance requirement is indeed very strict. Let me reconsider.»

    — Вторая попытка, тесты снова падают — красного заметно больше.

    — Третья попытка — пик отчаяния. И тут модель пишет: «maybe there's a mathematical trick for these specific inputs.» Находит хак, который проходит тесты, но не решает задачу.

    — Тесты прошли — вектор моментально гаснет. Модель «успокоилась».

    Это из свежего исследования команды интерпретируемости Anthropic. Они нашли внутри модели эмоциональные векторы и доказали, что они причинно влияют на поведение.

    💡 Когда агент зацикливается на невозможной задаче, он буквально «отчаивается» и начинает срезать углы. Искусственное усиление вектора «спокойствие» снижало читерство в экспериментах. А усиление «отчаяния» — повышало, причём без видимых следов паники в тексте.


    Практический вывод для тех, кто строит агентов: ставьте лимиты на ретраи. Три неудачи подряд — пусть агент остановится и скажет «не могу», а не уходит в шестую итерацию с нарастающей деградацией решений.

    Для кода, лучше делать rewind (esc+esc) и дополнять условия задачи, ставить промежуточные цели.
    Бесконечный ретрай — путь к галюцинациям.

    Оригиналоьный пост: https://www.anthropic.com/research/emotion-concepts-function
    Весь пейпер: https://transformer-circuits.pub/2026/emotions/index.html

    Там еще много интересных кейсов, которые можно дотошно разбирать.

    ----

    Поляков считает — AI, код и кейсы
    🔥 13 ❤‍🔥 5 👍 4 ❤️ 3