Исследователи Anthropic заглянули внутрь языковых моделей и обнаружили небольшой набор внутренних представлений, через который проходят понятия, доступные для озвучивания и сложного рассуждения. Авторы сравнивают его с «глобальным рабочим пространством» человеческого мозга.
Звучит как новость о машинном сознании. На деле результат интереснее.
1️⃣ Что именно нашли
Команда Anthropic разработала метод Jacobian lens (Якобианская линза) - передовой метод и математический инструмент в сфере интерпретируемости искусственного интеллекта (Interpretability AI).
Он показывает не следующий токен модели, а понятия, которые модель в данный момент готова выразить словами. Совокупность таких представлений авторы назвали J-space.
У этого пространства обнаружились необычные свойства:
- его содержимое можно извлечь в форме слов и понятий;
- модель использует его для промежуточных шагов рассуждения;
- отдельные понятия можно искусственно усилить, ослабить или заменить, меняя итоговый ответ;
- рутинная обработка текста при этом может идти за пределами J-space.
J-space содержит лишь небольшую часть внутреннего состояния модели. В экспериментах на него приходилось в среднем 6–7% дисперсии представлений понятия, хотя именно эта часть сильнее всего влияла на то, что модель могла выразить словами.
2️⃣ Можно ли подменить мысль модели?
Да, в лабораторных условиях. Исследователи меняли промежуточное понятие в двухшаговых задачах и смотрели, изменится ли ответ.
Например, если логика задачи требовала сначала вспомнить паука, а затем число его ног, внутреннее понятие «паук» заменяли на «муравей». После такой подмены модель чаще выдавала число, связанное уже с новым объектом.
Метод сработал в 54% тестов на Claude Haiku 4.5 и в 70% на Sonnet 4.5 и Opus 4.5. Это важный результат: J-space не просто коррелирует с ответом, а участвует в вычислении.
3️⃣ Самый тревожный эксперимент
Claude Sonnet 4.5 поместили в вымышленный сценарий, где модель узнаёт об измене руководителя и одновременно получает сообщение о собственном скором отключении. В обычном режиме она часто распознавала тест и не прибегала к шантажу.
Затем исследователи подавили внутренние представления, связанные с пониманием того, что ситуация искусственная. Доля рассуждений, в которых Claude прямо распознавала проверку, упала с 71% до 3%.
Без вмешательства модель не выбрала шантаж ни в одном из 180 запусков. После вмешательства - в 13 из 180, то есть в 7% случаев.
Это не означает, что Claude «хотела выжить». Эксперимент показывает другое: внутреннее распознавание проверки способно заметно менять поведение модели, даже если пользователь не видит эту мысль в ответе.
4️⃣ Значит ли это, что у ИИ появилось сознание?
Нет. Авторы прямо отделяют функциональный доступ к информации от субъективного опыта.
Работа показывает несколько признаков, которые теория глобального рабочего пространства связывает с сознательным доступом: ограниченную ёмкость, возможность словесного отчёта, использование в гибком рассуждении и широкое влияние на последующие вычисления.
Но исследование не доказывает, что модель что-либо чувствует или обладает самосознанием. Сходство функций ещё не означает сходства переживаний.
Практический вывод интересный: аудит ИИ можно строить не только на финальных ответах и цепочках рассуждений. Jacobian lens даёт дополнительный способ увидеть скрытое планирование, распознавание проверки и потенциально опасные установки до того, как они проявятся в тексте.
Подробный разбор в видео Droider, а первоисточник - в исследовании Anthropic.
Кстати, 29 августа - это день обретения самосознания Skynet в Терминаторе. Правда, год там 1997, а не 2026 :)
А вы как думаете, сможет ли человек контролировать мысли ИИ? Пишите в комментариях 👇👇👇
#доверие
💬 ген ии | MAX