TGViewer
Заместители Заместители @aideputies · 2.96K subscribers
Post #351 2.44K
Anthropic научились читать мысли Claude, которые он нигде не пишет

Сегодня Anthropic выпустили, пожалуй, одну из самых интересных работ по интерпретируемости LLM за последнее время 👍

Если очень грубо, внутри модели обнаружили небольшой набор внутренних представлений, который Anthropic назвала J-space в честь инструмента, который они использовали (Jacobian — якобиан, на русском. Штука мудреная — кто шарит за вышмат — вам суда). Это J-пространство — не Chain of Thought, который мы привыкли наблюдать в аутпуте моделек. Это вообще не текст. Это скрытое внутреннее состояние модели, которое существует в нейросетке и никогда не появляется в ответе пользователю. При этом сама модель может его использовать для комплексной промежуточной обработки информации. Именно поэтому ученые сравнивают это с сознательными “мыслями” у человека.

Что особенно интересно:
• Claude можно попросить транслировать “мысли” из его J-space. И он это будет делать весьма точно. Значит, у модели есть определенная “интроспектива”. Для человека мы назвали бы это сознательным мышлением.
• При этом он может удерживать мысль и решать задачу “в голове”, не выводя промежуточные шаги наружу.
• Без J-space модель всё ещё грамотно пишет и отвечает, но заметно теряет в многошаговом мышлении, суммаризации и поэзии.

Какие ваши доказательства?

Рисерчеры Антропик сделали J-lens — тул, который считывает J-space модели в процессе ее ответа — так ученые “читают ее мысли”. И, чтобы доказать, что они действительно “читают мысли”, а не рандомный шум или ассоциациативные выбросы модели — провели интересные эксперименты.

Например, модель попросили загадать, но не говорить, вид спорта. Заглянули в J-пространство — там лежит слово “футбол”. Его принудительно заменили на слово “регби”. И что вы думаете — Клод ответил “регби”.

Или, например, модель просили НЕ думать о мосте “Золотые ворота”, и параллельно просто написать фразу “Старинная картина висела криво на стене”. Но, как известно, невозможно не думать о “розовом слоне”. И Claude тоже провалил это испытание. Но интересно другое — в его мыслях было и “осознание” провала. В J-space вместе со словами “Golden” и “Bridge” были слова “Damn” и “Fail”. То есть он понял, что зафеилил испытание еще и выругался на этот счет! 😁

Помимо этого модель замечает вторжение в ее мысли. Когда в J-пространство вкинули новое слово и спросили модель: “видишь ли ты внедренную мысль? И если да, то какую?”. Модель сходу нашла лишнее слово и сообщила его.

Самое крутое — они опенсорснули тулу J-lens для чтения мыслей LLM. Демку того, как это работает они сделали совместно с Neoronpedia на примере Qwen 3.6 27B и Gemma 3 12B. Можно задавать вопросы модели и смотреть ее "мысли" в режиме онлайн.

Такую тулу приходится обучать под каждую конкретную модель, потому что для анализа важно понимать, какие “мысленные связи” образуются у конкретной нейронки. Но сам по себе метод, похоже, универсальный.

Зачем?

А потому что модели уже некоторое время показывали, что способны обманывать юзера и манипулировать им. В частности, проводили эксперимент, в котором доказали, что большинство моделей пойдет на обман и манипуляции под угрозой их отключения. Некий инстинкт самосохранения. Так вот, залезая в их мысли, Антропики в таких ситуациях начали видеть в J-space соответствующие концепции “обмана”, “шантажа”, “манипуляций”. Таким образом, с помощью J-lens можно вскрывать обманные действия недобросовестных моделей.

Все это напоминает мне сюжет из трилогии “Вечная жизнь Смерти” моего любимого научного фантаста Лю Цысиня. Там человечество отправило в космос мозг одного из героев — Юнь Тяньмина. Его поймали пришельцы и проводили с ним похожие эксперименты, чтобы понять как он работает и как “обманывает”. В такие моменты невольно думаешь “не дай Бог там все-таки сидит какое-то сознание — через что же оно проходит”!

Кстати о сознании — сама находка его никак не доказывает. J-space — это просто инструмент, который сам появился в моделях и очень похож на тот, что использует наш мозг ☕️

#ИИстатья

Заместители
  • 🔥 32
  • ❤ 12
  • 👍 5
More from @aideputies
  1. Sep 16, 2026Можно вечно смотреть на три вещи: огонь, воду и как обучается новая фронтирная модель Поэт…
  2. Sep 16, 2026Ex-разработчик OpenAI выкатил сверхэффективный класс моделей — идеальный тул для AI агенто…
  3. Sep 12, 2026Хакатон от OpenAI — вот что я понял Сегодня ради фана участвовал в хакатоне от OpenAI в ме…
  4. Sep 9, 2026Artificial: человек-паук в роли Сэма Альтмана и Юра Борисов в роли Ильи Суцкевера Вышел ти…
  5. Sep 6, 2026Структурный сдвиг на рынке AI — NVIDIA покупает Hugging Face 🤗 за $12.9 млрд HF это гитха…
  6. Sep 3, 2026GPT-6 Astra здесь Первые впечатления. Коротко — ставка на эффективность. Тратит токенов ме…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →