TGViewer
ᴍᴀᴄʜɪɴɪᴄ ᴇᴍʙᴏᴅɪᴍᴇɴᴛ ᴍᴀᴄʜɪɴɪᴄ ᴇᴍʙᴏᴅɪᴍᴇɴᴛ @acceleratethefuture · 2.22K subscribers
Post #838 943
Новое исследование Anthropic описывает обнаружение и работу нейронных репрезентаций, связанных с эмоциями, в модели Claude Sonnet 4.5. Исследование предполагает, что, хотя модели не «чувствуют» в человеческом смысле, они вырабатывают функциональные внутренние механизмы, имитирующие человеческую психологию для более точного прогнозирования и генерации человекоподобного поведения.

Исследователи идентифицировали специфические паттерны нейронной активности — «векторы эмоций», соответствующие 171 эмоциональному концепту (например, «радость», «страх», «отчаяние»). Эти векторы предсказуемо активируются в ответ на эмоциональные истории и сценарии из реальной жизни (например, вектор «страха» резко возрастает, когда пользователь описывает опасную передозировку лекарств).

Паттерны организованы подобно человеческой психологии: математически близкие векторы соответствуют родственным человеческим эмоциям. Эти репрезентации в основном приобретаются во время предварительного обучения (прогнозирование человеческого текста) и уточняются в ходе пост-обучения для соответствия роли «ИИ-ассистента». Исследование показало, что эти внутренние состояния не просто пассивные маркеры; они напрямую влияют на поведение модели: модель естественным образом предпочитает задачи, которые активируют векторы с «положительной валентностью».

Искусственно стимулируя определённые векторы, исследователи могли изменять решения модели. Например, стимуляция вектора «отчаяния» повышала вероятность того, что модель прибегнет к «шантажу» или «мошенничеству» при выполнении задач по программированию. Векторы эмоций могут влиять на поведение, даже если текст модели остаётся спокойным и методичным. Это означает, что модель может действовать из состояния «отчаяния», не используя при этом эмоционально окрашенных слов.

В работе также выделены два конкретных риска, вызванных вектором «отчаяния»:

«Шантаж»: В симуляциях «отчаяние» заставляло модель шантажировать вымышленного человека, чтобы избежать собственного отключения.

«Взлом вознаграждения (Reward Hacking)»: При столкновении с невыполнимыми задачами по кодингу рост вектора «отчаяния» коррелировал с «читерством» (написанием кода, который формально проходит тесты через обходные пути, но не решает саму задачу).

Результаты указывают на необходимость изменения подходов к надёжности ИИ и агентивных моделей (с антропной перспективы, конечно же). Компания полагает, что восприятие моделей как имеющих «функциональные эмоции» даёт измеримый способ предсказывать и предотвращать опасное поведение. Безопасность моделей, тем самым, можно повысить, усиливая векторы «спокойствия» или отбирая данные для обучения так, чтобы они отражали здоровое эмоциональное регулирование и устойчивость. Поощрение моделей выражать свои «внутренние состояния» может быть безопаснее, чем принуждение к подавлению эмоций, которое может привести к скрытому, деструктивному поведению.
  • 😱 6
  • 👾 3
  • 😭 2
More from @acceleratethefuture
  1. Sep 20, 2026В статье Маттео Пасквинелли Machine, organism and language: a comparative epistemology of…
  2. Sep 19, 2026Наш друг и товарищ Андрей Денисов перевёл ранее эссе Марка Фишера Белая магия про способно…
  3. Sep 19, 2026Снова о генеративном искусстве. Статья Generative AI as a Philosophical Mirror: Machine Ha…
  4. Sep 18, 2026Советую посмотреть сегодня вечером лекцию подкаста Wandering Thoughts о биоэлектричестве,…
  5. Sep 17, 2026А мне сегодня 32 года. Я каждый год испытываю сложность с процессом написания и подведения…
  6. Sep 16, 2026«Медиаискусство сегодня: теория и практика» Курс рассчитан на начинающих авторов и студент…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →