Jspace - скрытый вайтборд мыслей моделек
Думаю, все уже прочитали, что Антропики обнаружили в клоде некое скрытое состояние "мыслей", эдакий глобальный воркспейс. Разберемся, как это сделано.
Якобиана - что это
Матрица Якоби ( отсюда J в J-lens/J-space) - это таблица всех частных производных. В нашем случае она показывает, как крошечное изменение внутренней активации модели влияет на вероятность каждого токена на выходе. Если взять текущий скрытый вектор и посчитать производную следующего токена по этому вектору, получится направление, в котором надо сдвинуть состояние, чтобы модель сильнее захотела сказать конкретное слово.
Что такое J-lens
J-lens (Jacobian lens) использует эту матрицу для чтения "мыслей" модели. В отличие от привычной logit lens, которая просто проецирует активации в выходное пространство, J-lens смотрит на причинно-следственные связи: не *что сейчас активировано", а "куда можно дёрнуть состояние, чтобы поменять ответ". Получается, что J-lens показывает не текущий расклад, а карту всех возможных направлений.
Что такое J-space
Наложив J-lens на подкапот работающего Claude (ага, доступ надо к слоям и головам, да), исследователи заметили небольшую группу паттернов (занимает <10% активаций на средних слоях), которая ведёт себя как общее рабочее пространство. В этом пространстве одновременно активируются несколько концептов - например, "паук", "яд*, "Австралия". Модель использует это для сложных рассуждений, и оно возникает само в процессе обучения, никто его не проектировал.
Что сделали антропики
Доказали что J-space причинно влияет на ответ. Провели интервенцию: заменили паттерн в J-space, не меняя входной промпт, и ответ изменился (футбол на регби). Отключили J-space - многошаговое рассуждение рухнуло, базовая болтовня осталась. Также показали, что J-space может хранить промежуточные шаги, даже если модель их не проговаривает вслух.
Чем это отличается от "голова Х отвечает за паттерн Y"
В старом подходе искали статическую корреляцию: "нейрон X всегда активен на слове Y". Это локальная реакция на вход, и ничего кроме факта совпадения она не даёт, потому обьяснимость является такой проблемой - все еще блекбокс. J-space - это интеграция всего входа в общий узел, и он же является причиной финального выбора. Можно менять паттерн внутри, не трогая вход, и получать другой ответ, старые методы такого не позволяли. Кроме того, в J-space живут несколько концептов сразу.
Чем это отличается от CoT
Chain-of-thought - явный текст, который модель генерирует и который мы видим. J-space - скрытые вычисления, которые могут вообще не вылезать в ответ. CoT можно выключить или попросить модель не писать рассуждения - тогда она всё равно может использовать J-space для внутреннего планирования. J-space - это блокнот/мысленная доска перед тем, как слова появились в выходе.
Почему это важно
Во-первых, это первый случай, когда в LLM нашли структуру, аналогичную глобальному рабочему пространству из когнитивной науки и она возникла без специальной архитектуры. Во-вторых, это даёт способ управлять рассуждениями модели напрямую, без модификации промпта но с доступом к слоям. В-третьих, это инструмент для объяснимости: мы можем увидеть, какие концепты модель держит в голове во время решения задачи, и проверить, не использует ли она нечестные трюки (про это уже были кстат рисерчи, ответ - использует). Это большой шаг от блекбокса в интерпретации.
Итог
Антропики создали метод, позволяющий читать внутренние "намерения" модели до того, как они превратились в токены. J-lens даёт карту причинности, а J-space это функциональный аналог внутренней памяти. ( Старые методы давали своего рода рентген нейронов, этот же даёт функциональную МРТ мыслящего кода.) Модель всё ещё предсказывает следующий токен, просто теперь мы видим, как она готовится к этому предсказанию.
Post #445
270