TGViewer
местный датасасер ☮️ местный датасасер ☮️ @datasas · 1.81K subscribers
Post #2641 737

Forwarded from Data Secrets

Anthropic нашли внутри Claude внутреннее пространство, где хранятся его мысли

Стартап выпустил одну из самых интересных работ по интерпретируемости за последнее время. Они обнаружили, что в LLM есть отдельный небольшой внутренний набор нейронных активаций, который используется как рабочая память для сложного мышления: так называемый J-space.

Мы часто представляем LLM как огромную мешанину чисел, где знания и рассуждения размазаны по миллиардам параметров. Но похоже, что это не совсем так.

Любопытно, что человеческий мозг работает похожим образом. Есть когнитивная теория, утверждающая, что он состоит из множества специализированных подсистем, которые работают независимо; но иногда какая-то информация попадает в небольшой общий workspace, становится доступной сразу многим областям мозга и может использоваться для рассуждений и принятия решений. И вот именно такой механизм исследователи обнаружили в Claude.

Вот как работает J-space:

— Название происходит от разработанной учеными техники Jacobian Lens. Она позволяет по текущим активациям понимать, какие токены с большей вероятностью появятся в будущем. При этом то, что они появятся – далеко не факт, но это значит, что модель о них думает и держит их в J-space, чтобы использовать в рассуждениях. По сути, это чтение мыслей Claude.

— Если спросить Claude, о чем он думает, то содержимое J-space хорошо совпадает с ответом модели. Другие внутренние представления таким свойством не обладают. А еще модель умеет сознательно менять J-space. Например, если сказать ей «думай о слонах, пока решаешь задачу», то эта концепция появится в J-space. При решении сложной задачи промежуточные шаги тоже появляются именно внутри J-space, даже если их при этом нет в цепочках мыслей.

— Если полностью отключить J-space, то у модели почти исчезают способности, требующие сложного мышления и многошагового рассуждения. Например, она больше не может сочинять стихи.

Самое важное во всем этом то, что J-space можно читать и менять. Anthropic приводят пример: исследователи специально внедряли модели скрытую цель во время обучения и затем наблюдали, как эта цель проявляется в J-space, хотя в ответах напрямую она ни разу не озвучивалась. При этом изменяя активации в J-space, они могли менять дальнейшие решения модели.

Потенциально это путь к тому, чтобы создавать (полностью?) безопасные и контролируемые модели. По крайней мере, сегодня Anthropic уже сделали черный ящик немного более прозрачным.

www.anthropic.com/research/global-workspace
More from @datasas
  1. Sep 21, 2026Долго думал стоит ли, но всё-таки напишу пост насчёт Jev. Это zero-shot классификатор, кот…
  2. Sep 17, 2026Apple разрабатывает серверы для ИИ на базе ещё не выпущенных процессоров M8 Ultra и обсужд…
  3. Sep 5, 2026OpenAI открыла доступ к GPT-6 Astra пользователям всех платных тарифов, кроме Go. Ей можно…
  4. Aug 13, 2026Вышла Gemini 3.7 Flash По бенчам Flash выросла выше Sonnet 5. На модель временно скинули ц…
  5. Jul 30, 2026photo post
  6. Jul 24, 2026Вышел Opus 5, уже доступен в Claude Code и на сайте. Модель во многом... лучше Fable 5 😎…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →