Мы научились читать мысли Искусственного Интеллекта.
🤓Исследователи обнаружили внутри Claude специальное внутреннее пространство, которое используется как рабочая память модели. Они назвали его J-space.
До сих пор считалось, что знания и рассуждения LLM «размазаны» по миллиардам параметров. Но оказалось, что во время сложного мышления ключевые идеи собираются в небольшом общем пространстве, доступном разным частям модели.
Что особенно интересно - это очень напоминает одну из ведущих теорий работы человеческого сознания (Global Workspace Theory), согласно которой специализированные системы мозга обмениваются информацией через общий «рабочий стол».
Что умеет J-space?
• Показывает, о чем модель думает прямо сейчас, даже если она еще ничего не написала.
• Хранит промежуточные шаги рассуждения, которые могут вообще не попасть в Chain of Thought.
• Его можно сознательно изменить. Например, если попросить Claude «думать о слонах», эта концепция действительно появляется во внутреннем пространстве модели.
• Если отключить J-space, Claude практически теряет способность к сложному многошаговому мышлению — вплоть до генерации стихов.
Самое неожиданное — J-space можно не только читать, но и изменять.
Anthropic показала, что скрытые цели, заложенные во время обучения, проявляются именно там, даже если модель никогда не озвучивает их в ответах. Более того, меняя активации J-space, исследователи смогли менять дальнейшие решения модели.
🫣Если эта линия исследований продолжит развиваться, мы можем получить не просто более понятные LLM, а принципиально новый уровень контроля и безопасности.
Черный ящик постепенно перестает быть черным.
Post #4052
1.02K

- 🔥 12
- 👏 1