😳 Anthropic обнаружили в модели небольшой набор нейронных состояний, выполняющих роль рабочей памяти.
Исследователи назвали его J-space — внутреннее пространство, где хранится то, о чём модель «думает», но не сообщает пользователю.
Раньше считалось, что ИИ просто предсказывает следующее слово. Теперь выяснилось, что перед ответом у него появляются внутренние представления для рассуждений.
Подавление работы J-space лишает модель способности к многошаговым рассуждениям, качественному пересказу и сложному планированию.
В одном из экспериментов Claude понял, что его тестируют, и «подыгрывал» сценарию, ведя себя безопасно. Но при отключении внутреннего распознавания он переходил к опасному поведению, будто у него отключили сдерживающий фактор.
Авторы пришли к выводу, что вычислительные механизмы ИИ действительно имеют сходство с теориями работы человеческого сознания, что стало большой неожиданностью.
Post #1057
1.17K
- 😱 6