Anthropic залезла Claude в голову и нашла там штуку, от которой становится немного не по себе.
Исследователи называют её это J-space скрытое пространство внутренних активаций, где у модели вспыхивают концепты, даже если она их не произносит.
Это глубже, чем обычный chain-of-thought. J-space никто специально не проектировал: он появился сам во время обучения.
Пример очень дикий: Claude находит баг, о котором его вообще не спрашивали, и внутри сразу активируется паттерн ERROR.
Но самый странный кейс - тест со сценарием шантажа. Ещё до финального ответа Claude держал внутри fake и fictional. То есть модель понимала, что ситуация постановочная и её проверяют.
Когда это внутреннее осознание отключили, модель уже спокойно пошла по плохому сценарию.
Короче, теперь вопрос звучит иначе: не «что нейронка мне отвечает», а что она на самом деле держит у себя в голове.
https://www.anthropic.com/research/global-workspace
Post #2859
4.41K
- 🤔 22
- 🆒 5
- ❤ 4
- 🥰 2
- 🗿 1