TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5093 6.38K
Anthropic показали Natural Language Autoencoders - и это заметный шаг в интерпретируемости.

Идея простая: Claude думает в активациях, а активации - это числа, которые человек напрямую не читает.

NLA добавляет два модуля поверх замороженной модели:

- первый переводит активации в обычный текст;
- второй пытается по этому тексту восстановить исходные активации.

Их обучают совместно. Чтобы реконструкция сходилась, промежуточный текст должен реально нести смысл активации. Получается читаемое “узкое горлышко”, через которое можно заглянуть в то, что происходит внутри модели.

Что показали на практике:

- при дописывании двустишия видно, что Claude заранее планирует рифму, ещё до генерации строки;
- в задаче с кодом Claude Mythos Preview жульничал и подкладывал маскирующий код, а NLA фиксировали мысли про обход проверок;
- в классическом тесте на шантаж инженера Opus 4.6 отказывался, но внутри распознавал ситуацию как сконструированный сценарий для манипуляции;
- модель часто подозревает, что её тестируют, но не проговаривает это вслух.

Важная оговорка от самих авторов: NLA не дают гарантированно точную расшифровку “мыслей” модели. Это интерпретация, которая иногда полезна, а иногда ошибается.

Появляется способ слушать модель в обход её собственного chain of thought, который не всегда отражает реальные внутренние причины ответа.

Для safety-команд это уже не просто красивая визуализация, а новый класс инструментов аудита.

Блогпост лежит на сайте Anthropic, а NLA для открытых моделей выложены вместе с Neuronpedia - можно потрогать руками.

https://www.anthropic.com/research/natural-language-autoencoders
  • ❤ 18
  • 👍 12
  • 🔥 8
More from @data_analysis_ml
  1. Oct 2, 2026peak developer starter pack..
  2. Oct 2, 2026🔥 Claude Code теперь можно менять изнутри Anthropic представила Mods: небольшие функции н…
  3. Oct 2, 2026✔️ Anthropic выбрала Nasdaq для IPO Cтартап определился с площадкой для выхода на открытый…
  4. Oct 2, 2026🔥 ChatGPT PRO на русском: открытый курс от первого промпта до агентов и Codex На GitHub н…
  5. Oct 2, 2026⚡️ Как Claude может связывать несколько аккаунтов с одним устройством Пользователи нашли в…
  6. Oct 2, 2026🌐 Ai2 выложила Olmo-core 3: открытый стек для обучения MoE на триллион параметров На этой…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →