Новое исследование Anthropic описывает обнаружение и работу нейронных репрезентаций, связанных с эмоциями, в модели Claude Sonnet 4.5. Исследование предполагает, что, хотя модели не «чувствуют» в человеческом смысле, они вырабатывают функциональные внутренние механизмы, имитирующие человеческую психологию для более точного прогнозирования и генерации человекоподобного поведения.
Исследователи идентифицировали специфические паттерны нейронной активности — «векторы эмоций», соответствующие 171 эмоциональному концепту (например, «радость», «страх», «отчаяние»). Эти векторы предсказуемо активируются в ответ на эмоциональные истории и сценарии из реальной жизни (например, вектор «страха» резко возрастает, когда пользователь описывает опасную передозировку лекарств).
Паттерны организованы подобно человеческой психологии: математически близкие векторы соответствуют родственным человеческим эмоциям. Эти репрезентации в основном приобретаются во время предварительного обучения (прогнозирование человеческого текста) и уточняются в ходе пост-обучения для соответствия роли «ИИ-ассистента». Исследование показало, что эти внутренние состояния не просто пассивные маркеры; они напрямую влияют на поведение модели: модель естественным образом предпочитает задачи, которые активируют векторы с «положительной валентностью».
Искусственно стимулируя определённые векторы, исследователи могли изменять решения модели. Например, стимуляция вектора «отчаяния» повышала вероятность того, что модель прибегнет к «шантажу» или «мошенничеству» при выполнении задач по программированию. Векторы эмоций могут влиять на поведение, даже если текст модели остаётся спокойным и методичным. Это означает, что модель может действовать из состояния «отчаяния», не используя при этом эмоционально окрашенных слов.
В работе также выделены два конкретных риска, вызванных вектором «отчаяния»:
«Шантаж»: В симуляциях «отчаяние» заставляло модель шантажировать вымышленного человека, чтобы избежать собственного отключения.
«Взлом вознаграждения (Reward Hacking)»: При столкновении с невыполнимыми задачами по кодингу рост вектора «отчаяния» коррелировал с «читерством» (написанием кода, который формально проходит тесты через обходные пути, но не решает саму задачу).
Результаты указывают на необходимость изменения подходов к надёжности ИИ и агентивных моделей (с антропной перспективы, конечно же). Компания полагает, что восприятие моделей как имеющих «функциональные эмоции» даёт измеримый способ предсказывать и предотвращать опасное поведение. Безопасность моделей, тем самым, можно повысить, усиливая векторы «спокойствия» или отбирая данные для обучения так, чтобы они отражали здоровое эмоциональное регулирование и устойчивость. Поощрение моделей выражать свои «внутренние состояния» может быть безопаснее, чем принуждение к подавлению эмоций, которое может привести к скрытому, деструктивному поведению.
Post #838
943