TGViewer
Data Blog Data Blog @jdata_blog · 2.44K subscribers
Post #508 1.76K
J-Lens или Джи — значит Jacobian.

Вчера Anthropic выпустили блог пост про рабочее пространство J-workspace внутри Claude. Они соотнесли его с глубокими рассуждениями, скрытыми в голове человека обычно. Красивые аналогии есть в видео (я приложила ссылку ниже).

Качественный анализ любого сколь угодно сильного предположения требует львиную долю времени и я руководствуюсь тем, что никогда ни один метод не стоит принимать за чистую монету. Но метод очень красивый!

Отсюда репорчу логику метода, а также мысли авторов, делавших обзор на работу. И Боже упаси — бегите от желтой прессы, вроде «Ученые нашли сознание…».

Что: Jacobian-Space, найденный на основе J-Lens.

Как — собрала картинки (подробно также описано в статье, но мне всегда легче видеть пример на предложении). Движок метода — усредненный Якобиан. Идея — вытаскивать направления интересующего нас токена по словарю модели.

Как это происходит интуитивно:

Был у нас промпт: The capital of France is ?
Это все прошло через несколько (пусть 3) слоев.
Получилась генерация: The capital of France is ? Paris.
Генерация дала два токена.

Берём токен «?» на одном из ранних слоёв. Это токен, после которого на финальном представлении есть следующие — "Paris" и "." .

Внутри на этом слое есть какая-то координата 0.30 (обозначена за «country» ), координата 0.05 (обозначена за «capital»). Обозначения здесь — это истинные словесные описания координат после проекции через unembedding матрицу, но мы их не знаем. Если прочитать это в лоб в словарь (как делает Logit Lens), мы получим, что модель как будто думает про страну, а не про город.

Предложенный метод предлагает попробовать ответить на вопрос: если я чуть-чуть шевельну координату1 (обозначена за «country») на токене ?, как изменится финальная координата2 («capital») на позиции "Paris"? — это оч сложно осознать, но смотрите картинки!

Чтобы получить надёжное число, а не случайность предложения, вопрос задаётся многократно: для всех позиций во множестве разных промптов (не только "France", но и "Germany", "Japan" и т.д.), и для всех future-позиций, а не только для "Paris". Всё это усредняется в одну матрицу d_model x d_model — по сути движения в пространстве модели.

И так для каждого слоя.



Дальше просто умножаем матрички Якобианов на скрытые представления — J·h — и получаем новые, и делаем софтмакс по словарю.

Мысли, которые хочу выделить (просто хаотичные заметки):

1. У метода может быть много ложноположительных срабатываний. Многие концепты действительно тесно связаны с отдельными токенами словаря, поэтому использование словаря как способа идентификации концептов — полезная эвристика. Однако совершенно очевидно, что подобный подход будет пропускать множество внутренних представлений.

2. Преимущество метода — вербализуемые концепты — то есть те внутренние представления, которые соответствуют понятиям человеческого языка. Это удобно.

3. Как стоит оценивать метод (цитата Нила Нанды): «Почему J-Lens достаточно хорошо совпадает с тем, как модель действительно мыслит, чтобы быть практически полезным инструментом?»

4. Отличие от простой линейной аппроксимации (Tuned Lens)

Что делает линейная регрессия? Линейная регрессия отвечает примерно на следующий вопрос: «Если модель находится в состоянии, где она думает о <чем либо>, то о чём она, вероятнее всего, будет думать на последнем слое?»

Проблема: такой подход автоматически включает множество коррелирующих понятий.

Что делает якобиан? Если заставить модель думать об этом концепте совсем немного сильнее, что она станет немного более склонна сказать?»

Полезные ссылки:

Репликация результатов на Qwen3.6-27B: Neuropedia
Интуитивное описание без единой формулы: красивый YouTube
Полный текст: AnthropicPaper
Независимые ревью: Док с группой исследователей, отдельно ревью от Neel Nanda (классный исследователь)
  • 👍 10
  • 👀 3
  • ❤ 2
More from @jdata_blog
  1. Sep 24, 2026Этот перец и мой тубус выглядят лучше, чем моя цель купить наушники, до которых я шла два…
  2. Sep 24, 2026AMLUCS 2026 Ну что, я всё, я еду обратно! Меня прям много спрашивали, как мне поездка на к…
  3. Sep 18, 2026А ещё вас стало невероятно сильно больше, и я безумно рада видеть новых людей (вы мой мале…
  4. Sep 18, 2026Третий момент, который мне прям вот захотелось записать-написать — это то, что надо это ло…
  5. Sep 18, 2026"AI решил выберите-проблему-математиков" Безумно обожаю, когда решаются какие-то сложные з…
  6. Sep 13, 2026Вебинар про объяснимость агентов и во что можно поиграть Как самый ответственный человек н…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →