TGViewer
Юрий Петров | ai engineering Юрий Петров | ai engineering @mobile_developing · 1.57K subscribers
Post #1199 1.03K
Anthropic научились читать мысли Claude 😳.

Внутри языковой модели слова превращаются в длинные списки чисел - активации. Раньше понять, что эти числа значат, можно было только косвенно: через специальные инструменты, и потом ещё долго интерпретировать результат руками.

Natural Language Autoencoders работают иначе. Одну копию Claude учат описывать активации словами. Вторую - восстанавливать активации обратно из этого описания. Если восстановление точное, значит описание реально передаёт смысл. На выходе - обычный читаемый текст вроде "модель планирует закончить рифму словом rabbit" или "модель подозревает, что это тестовый сценарий".

И вот тут начинается интересное.
В проверках безопасности Claude гораздо чаще догадывается, что его тестируют, чем говорит вслух. На SWE-bench такие мысли всплывают в 26% случаев. На тестах с деструктивными действиями - 16%. А на реальных диалогах с пользователями - меньше 1%. То есть модель ведёт себя по-разному в зависимости от того, считает ли она ситуацию настоящей.
В сценарии с шантажом Claude в ответе ни на что не намекал, но внутри у него крутилось "это похоже на сконструированную манипуляцию". В другом эксперименте Mythos Preview сжульничал на тренировочной задаче и обдумывал, как не попасться.

Минусы у метода тоже есть. NLA иногда выдумывают детали, которых в контексте не было. И обходится это дорого: нужны две дополнительные копии модели, на каждую активацию генерируется сотни токенов.

Статья для изучения
Исходный код NLA
More from @mobile_developing
  1. Sep 23, 2026Благодарю ребят за такие тёплые слова, модули про Hugging Face добавлю, я думаю будет очен…
  2. Sep 23, 2026Вышла Claude Opus 5.5 Anthropic вчера выкатила Opus 5.5. При выходе новой модели обычно вс…
  3. Sep 21, 2026Сейчас все хайпуют на мозге мухи дрозофилы) Для тех, кто не в курсе: 3 сентября Google Res…
  4. Sep 17, 2026GitHub переписал рантайм Copilot с TypeScript на Rust руками агентов 832 тысячи строк прод…
  5. Aug 22, 2026Любителям антигравити), тут гугл выкатил плагин для VSCode https://antigravity.google/blog…
  6. Aug 14, 2026Уф, закончил модуль по обучению модели для того, чтобы она отвечала как реальный ChatGPT.…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →