TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2859 4.41K
Anthropic залезла Claude в голову и нашла там штуку, от которой становится немного не по себе.

Исследователи называют её это J-space скрытое пространство внутренних активаций, где у модели вспыхивают концепты, даже если она их не произносит.

Это глубже, чем обычный chain-of-thought. J-space никто специально не проектировал: он появился сам во время обучения.

Пример очень дикий: Claude находит баг, о котором его вообще не спрашивали, и внутри сразу активируется паттерн ERROR.

Но самый странный кейс - тест со сценарием шантажа. Ещё до финального ответа Claude держал внутри fake и fictional. То есть модель понимала, что ситуация постановочная и её проверяют.

Когда это внутреннее осознание отключили, модель уже спокойно пошла по плохому сценарию.

Короче, теперь вопрос звучит иначе: не «что нейронка мне отвечает», а что она на самом деле держит у себя в голове.

https://www.anthropic.com/research/global-workspace
  • 🤔 22
  • 🆒 5
  • ❤ 4
  • 🥰 2
  • 🗿 1
More from @machinelearning_interview
  1. Sep 23, 2026⚡️ Агенты научились улучшать собственную обвязку RRSI оптимизирует не веса модели, а всю с…
  2. Sep 22, 2026Сразу три новых флагмана в гонке ИИ За несколько недель рынок получил GPT-6 Astra, Grok 4.…
  3. Sep 22, 2026🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - се…
  4. Sep 22, 2026🚀 Claude Opus 5.5 — новый флагман Anthropic Anthropic обновила свою самую мощную модель.…
  5. Sep 22, 2026В субботу, 17 октября, Москва станет точкой притяжения для всех специалистов в области Rec…
  6. Sep 22, 2026Теренс Тао: «ИИ катком проходит по всей математике. Нам нужно замедлиться. Темп безумный».…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →