TGViewer
Oh my AI Oh my AI @oaiohmy · 311 subscribers
Post #445 270
Jspace - скрытый вайтборд мыслей моделек

Думаю, все уже прочитали, что Антропики обнаружили в клоде некое скрытое состояние "мыслей", эдакий глобальный воркспейс. Разберемся, как это сделано.

Якобиана - что это

Матрица Якоби ( отсюда J в J-lens/J-space) - это таблица всех частных производных. В нашем случае она показывает, как крошечное изменение внутренней активации модели влияет на вероятность каждого токена на выходе. Если взять текущий скрытый вектор и посчитать производную следующего токена по этому вектору, получится направление, в котором надо сдвинуть состояние, чтобы модель сильнее захотела сказать конкретное слово.

Что такое J-lens

J-lens (Jacobian lens) использует эту матрицу для чтения "мыслей" модели. В отличие от привычной logit lens, которая просто проецирует активации в выходное пространство, J-lens смотрит на причинно-следственные связи: не *что сейчас активировано", а "куда можно дёрнуть состояние, чтобы поменять ответ". Получается, что J-lens показывает не текущий расклад, а карту всех возможных направлений.

Что такое J-space

Наложив J-lens на подкапот работающего Claude (ага, доступ надо к слоям и головам, да), исследователи заметили небольшую группу паттернов (занимает <10% активаций на средних слоях), которая ведёт себя как общее рабочее пространство. В этом пространстве одновременно активируются несколько концептов - например, "паук", "яд*, "Австралия". Модель использует это для сложных рассуждений, и оно возникает само в процессе обучения, никто его не проектировал.

Что сделали антропики

Доказали что J-space причинно влияет на ответ. Провели интервенцию: заменили паттерн в J-space, не меняя входной промпт, и ответ изменился (футбол на регби). Отключили J-space - многошаговое рассуждение рухнуло, базовая болтовня осталась. Также показали, что J-space может хранить промежуточные шаги, даже если модель их не проговаривает вслух.

Чем это отличается от "голова Х отвечает за паттерн Y"

В старом подходе искали статическую корреляцию: "нейрон X всегда активен на слове Y". Это локальная реакция на вход, и ничего кроме факта совпадения она не даёт, потому обьяснимость является такой проблемой - все еще блекбокс. J-space - это интеграция всего входа в общий узел, и он же является причиной финального выбора. Можно менять паттерн внутри, не трогая вход, и получать другой ответ, старые методы такого не позволяли. Кроме того, в J-space живут несколько концептов сразу.

Чем это отличается от CoT

Chain-of-thought - явный текст, который модель генерирует и который мы видим. J-space - скрытые вычисления, которые могут вообще не вылезать в ответ. CoT можно выключить или попросить модель не писать рассуждения - тогда она всё равно может использовать J-space для внутреннего планирования. J-space - это блокнот/мысленная доска перед тем, как слова появились в выходе.

Почему это важно

Во-первых, это первый случай, когда в LLM нашли структуру, аналогичную глобальному рабочему пространству из когнитивной науки и она возникла без специальной архитектуры. Во-вторых, это даёт способ управлять рассуждениями модели напрямую, без модификации промпта но с доступом к слоям. В-третьих, это инструмент для объяснимости: мы можем увидеть, какие концепты модель держит в голове во время решения задачи, и проверить, не использует ли она нечестные трюки (про это уже были кстат рисерчи, ответ - использует). Это большой шаг от блекбокса в интерпретации.

Итог

Антропики создали метод, позволяющий читать внутренние "намерения" модели до того, как они превратились в токены. J-lens даёт карту причинности, а J-space это функциональный аналог внутренней памяти. ( Старые методы давали своего рода рентген нейронов, этот же даёт функциональную МРТ мыслящего кода.) Модель всё ещё предсказывает следующий токен, просто теперь мы видим, как она готовится к этому предсказанию.
Anthropic A global workspace in language models Interpretability research on Claude's internal thoughts.
  • 👍 4
  • 🔥 2
More from @oaiohmy
  1. Sep 22, 2026К слову муха в этом твите так-то должна была искать фишинг. Но она заспидранила эту жизнь…
  2. Sep 22, 2026МУХА! Муху научили проходить по цепочке атаки до финальной странички флоу фишинга - кликат…
  3. Sep 19, 2026У LLMок нашли вектор боли Что такое: Whitebox-интерпретируемость: линейное 'pain'-направле…
  4. Sep 11, 2026Вышел новый Threat Intelligence Report от Anthropic Анализ с декабрь 2025 по август 2026.…
  5. Aug 23, 2026Если задумывались насколько скиллы лучше чем запись в memory Demystifying Agent Skills - А…
  6. Aug 21, 2026Очень нравится наблюдать за тем, как по мере того, как модельки умнеют, агенты на их базе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →