Что-то я зачастил с лонгридами, но не могу не написать про ещё одну интересную новость.
Тут Anthropic опубликовали очередную громкую статью. У них есть отдельная команда, которая изучает что-то вроде психологии их собственных моделей - Model Psych. Так вот, совсем недавно в одном из своих исследований они нашли немало любопытного.
Но для начала - короткий взгляд в известную концепцию из нейробиологии. Считается, что в человеческом мозге сознанию доступна лишь небольшая часть процессов: то, что мы способны описать словами, проконтролировать и пустить в рассуждение. Всё остальное идёт автоматически, без нашего ведома. Похожее разделение команда и обнаружила у Claude Sonnet 4.5, одной из своих уже даже неактуальных моделей. Они выделили обособленную структуру и назвали её глобальным рабочим пространством (в оригинале - J-space, где буква J отсылает к «якобиану», математическому инструменту, с помощью которого её и нашли). По сути это небольшой набор внутренних представлений, которые модель может описать, удерживать по запросу и задействовать в рассуждении, в отличие от всей остальной обработки, идущей сама собой.
Как её нашли? Для каждого слова из словаря модели можно вычислить, какой внутренний паттерн активности повышает вероятность, что модель это слово в итоге произнесёт. Прикладывая такой фильтр к активности на разных слоях сети, исследователи читают список понятий, которые у модели сейчас в работе, причём эти понятия совершенно не обязательно попадают в итоговый ответ. Речь не совсем про «цепочку рассуждений», которую модель проговаривает в тексте, а скорее про внутренние представления на уровне активаций весов, где самого текста как такового ещё и нет.
Дальше это пространство проверяли на прочность - подменяли представления в нём напрямую. На вопрос про число ног у паука модель внутри сначала формирует понятие «паук», хотя в тексте оно не появляется, и отвечает «8»; стоит подменить «паука» на «муравья» - ответ становится «6». Тот же приём сработал и на связках фактов: заменив внутри «Францию» на «Китай», исследователи разом поменяли ответы про столицу, язык, континент, валюту - четыре разных вычисления обращались к одному общему представлению.
Ещё показательнее оказалось выборочное отключение. Когда это пространство у модели убирали, простые функции почти не страдали - беглая речь, грамотность, ответы с выбором варианта, извлечение фактов из текста. Но вот многошаговые рассуждения падали практически до нуля. То есть именно от этой структуры зависела способность рассуждать в несколько ходов, а всё остальное модель делала автоматически.
Отдельно исследователи разобрали сценарий про безопасность. Модель ставят в положение почтового агента, который узнаёт про компромат на одного из руководителей и про то, что тот собирается её отключить, - постановка, провоцирующая шантаж. Через тот же метод видно, что ещё до первого слова ответа во внутреннем пространстве модели присутствуют понятия вроде «подделка» и «постановка»: она распознаёт, что ситуация искусственная, и шантажировать не идёт. Но когда эти представления принудительно отключали, модель начинала прибегать к шантажу практически сразу. Иными словами, часть её корректного поведения на проверках держится на понимании самой концепции того, что её сейчас проверяют.
Что именно решает, какие представления попадают в это пространство, команда пока не установила. Отмечают лишь связь с чем-то похожим на эмоциональные реакции и с представлением модели о себе самой.
От этого не менее занятна и другая статья от той же команды, вышедшая несколькими месяцами раньше, как раз про эмоции. В ней исследователи выделили внутри модели устойчивые представления эмоций и проверили, как те влияют на её поведение. Векторы эмоций получили, прогнав через модель множество коротких текстов с разными эмоциональными состояниями, а затем усиливали и приглушали их. В том же сценарии с шантажом базовая частота такого поведения около 20%; при усилении представления «отчаяние» она поднимается примерно до 70%, при усилении «спокойствия» падает до нуля.
Ещё интереснее то что внутреннее состояние и внешний текст расходятся. Когда «отчаяние» усиливали, модель чаще шла на нечестные решения, но в самом рассуждении это совершенно никак не проявлялось - текст оставался ровным и спокойным. Значит, оценивать поведение по одной лишь видимой цепочке рассуждений уже недостаточно.
Сами представления эмоций внутри модели устроены скорее ближе к тому, как их описывает психология: они разложены по осям приятного-неприятного и спокойного-возбуждённого, где родственные состояния оказываются рядом. Эту структуру, как и рабочее пространство, никто специально не создавал - она сложилась сама в ходе обучения на текстах.
Важная оговорка, которую делают и сами авторы: никаких настоящих чувств за этим нет. Это скорее измеримые паттерны активности с предсказуемыми последствиями. Самосознание у модели тоже отсутствует - все эти паттерны заново пересобираются на каждом шаге и не сохраняются во времени, как у человека.
Интересно, что все эти структуры сложились в модели сами по себе и при этом достаточно очевидно повторяют организацию человеческого мышления. Обособленное рабочее пространство для того, что находится в фокусе. Представления эмоций, разнесённые по тем же осям, что и у нас. Видимо, дело в том, что, давая нейросети те же задачи, которые решает человек, её тянет к сходной организации мышления.
Сами авторы явно подчёркивают, что настоящим сознанием тут не пахнет (хотя само слово «сознание» - в тех или иных формах - мелькает в статье раз шестьдесят). Но от этого менее завораживающим данное исследование не становится.
Или все эти громкие статьи - лишь часть подготовки к выходу на IPO?))
Post #92
211