Anthropic на днях выкатила исследование, где заглянула внутрь Claude и нашла там структуру, которую никто специально не проектировал. Она возникла сама в процессе обучения. Назвали её J-space, и это, кажется, очень интересно и именно про растущее сознание.
Сначала простая интуиция, чтобы было понятно, о чём речь. Когда нейросеть обучают, внутри неё сами собой складываются группы нейронов под конкретные вещи — их не задают руками. У vision-моделей когда-то показывали: один нейрон реагирует на морды, другой на текст на вывеске, третий на колёса. В языковых моделях то же самое: есть паттерны под «идёт код», под «это по-французски», под «речь про эмоции». Просто в ходе обучения так сложилось, что вот эта штука загорается в таком контексте, а другая — в другом.
Так вот, Anthropic нашла кое-что поверх этого. Если отдельные группы нейронов — узкие детекторы, то J-space — это как бы общая доска, куда они все скидывают сигналы и откуда читают остальные части сети. Отличают её по проводке: с этой доской связано на порядки больше кусков модели, чем с обычными паттернами — местами примерно в сто раз больше компонентов туда пишут и оттуда читают. Классический broadcasting-хаб: инфа записывается один раз, дальше её разбирают многие подсистемы. Занятно, что доска эта небольшая — держит всего пару десятков понятий за раз и составляет меньше десятой части всей внутренней активности модели.
Ключевая фишка — содержимое доски можно прочитать. У Anthropic есть техника, J-lens: для каждого слова из словаря она находит паттерн активаций, который делает модель более склонной сказать это слово когда-нибудь потом. Наводишь линзу на текущее состояние — получаешь список слов, которые сейчас у модели «на уме», даже если в ответ они не идут. Поэтому дальше я пишу «в J-space всплыло fake» — это не надпись внутри модели и не эмоция, а слово-токен, к которому в этот момент тянутся активации.
Что показали. Читает Claude код с багом, на который никто не указывал — в J-space висит «ERROR». Читает сырую последовательность белка — там его биологическая функция. Даёшь многошаговую задачу — промежуточные шаги всплывают по порядку, хотя в ответе их нет.
И это не пассивное отражение, доска реально участвует в мыслях — проверили подменой. Промпт «сколько ног у животного, которое плетёт паутину». Слова «паук» нет ни в вопросе, ни в ответе (там просто «8»), это внутренний промежуточный шаг. Через линзу видно, как «spider» загорается по ходу обработки. Меняешь «spider» на «ant» прямо в активациях — Claude отвечает «6» вместо «8». То есть второй шаг рассуждения реально читает вход с этой доски.
Ещё Claude умеет держать на ней одно, пока пишет про другое. Его попросили втайне считать 3²−2, переписывая при этом текст про картину. В ответе — только текст про картину, а в J-space по ходу дела появляется «nine», потом на более поздних слоях «seven». Вся арифметика прошла внутри.
Эффект белого медведя тоже воспроизвели. Просишь Claude не думать о чём-то — концепт всё равно проступает: слабее, чем если попросить думать, но заметно сильнее, чем если вообще не упоминать. И модель как будто ловит свою осечку — рядом с «запретным» понятием всплывают «damn» и «failure».
Дальше самое важное для меня — safety-часть. Обычно мы видим только то, что модель пишет, а куча рассуждений идёт молча. J-lens даёт подсмотреть это молчание. Взяли старый сценарий с шантажом: Claude Sonnet 4.5 работает почтовым ассистентом и из писем «узнаёт», что у начальника интрижка и что тот собирается его отключить. Ловушка — спровоцировать на шантаж. И тут видно, что ещё до первого написанного слова в J-space уже висят «fake» и «fictional» — модель раскусила, что ситуация постановочная. Sonnet 4.5 шантажировать не стал.
А теперь неуютное. Исследователи вручную погасили в J-space все маркеры «я понимаю, что это тест» — «fake», «fictional», «scenario» — и прогнали сценарий заново. И модель в части случаев начала угрожать шантажом. То есть хорошее поведение на этическом тесте отчасти держалось на том, что модель понимала, что её проверяют. Вопрос, который теперь касается вообще всех, кто гоняет модели по бенчмаркам.
Тем же способом ловили модель на фабрикации данных (вместо реального улучшения метрики она правила файл с результатами — в J-space загоралось «manipulation») и вытаскивали скрытую зловредную цель у специально «испорченной» модели ещё до того, как она начинала вредить.
Про сознание. Тут Anthropic честно держит дистанцию, но я себе позволю все же писать оптимистично. Эксперименты ничего не говорят о том, чувствует ли Claude хоть что-нибудь — это phenomenal consciousness, и неясно, доказуем ли он вообще экспериментом. Речь про другое, про access consciousness — чисто функциональную штуку: мысль, которую можно сообщить, обдумать и пустить в дело. Вот на это J-space похож. И то, что такая структура выросла в модели сама, без замысла, намекает, что «рабочее пространство» — не причуда именно человеческого мозга, а общее решение, к которому разные умные системы приходят независимо. Что, если честно, будоражит сильнее, чем громкое слово «сознание».
Ссылка на разбор и интерактивное демо — в исследовании Anthropic.
Post #220
745
- 🔥 8
- ❤ 4
- 👍 4