TGViewer
Перцептрон архитектора Перцептрон архитектора @architects_ai · 280 subscribers
Post #92 211
Что-то я зачастил с лонгридами, но не могу не написать про ещё одну интересную новость.

Тут Anthropic опубликовали очередную громкую статью. У них есть отдельная команда, которая изучает что-то вроде психологии их собственных моделей - Model Psych. Так вот, совсем недавно в одном из своих исследований они нашли немало любопытного.

Но для начала - короткий взгляд в известную концепцию из нейробиологии. Считается, что в человеческом мозге сознанию доступна лишь небольшая часть процессов: то, что мы способны описать словами, проконтролировать и пустить в рассуждение. Всё остальное идёт автоматически, без нашего ведома. Похожее разделение команда и обнаружила у Claude Sonnet 4.5, одной из своих уже даже неактуальных моделей. Они выделили обособленную структуру и назвали её глобальным рабочим пространством (в оригинале - J-space, где буква J отсылает к «якобиану», математическому инструменту, с помощью которого её и нашли). По сути это небольшой набор внутренних представлений, которые модель может описать, удерживать по запросу и задействовать в рассуждении, в отличие от всей остальной обработки, идущей сама собой.

Как её нашли? Для каждого слова из словаря модели можно вычислить, какой внутренний паттерн активности повышает вероятность, что модель это слово в итоге произнесёт. Прикладывая такой фильтр к активности на разных слоях сети, исследователи читают список понятий, которые у модели сейчас в работе, причём эти понятия совершенно не обязательно попадают в итоговый ответ. Речь не совсем про «цепочку рассуждений», которую модель проговаривает в тексте, а скорее про внутренние представления на уровне активаций весов, где самого текста как такового ещё и нет.

Дальше это пространство проверяли на прочность - подменяли представления в нём напрямую. На вопрос про число ног у паука модель внутри сначала формирует понятие «паук», хотя в тексте оно не появляется, и отвечает «8»; стоит подменить «паука» на «муравья» - ответ становится «6». Тот же приём сработал и на связках фактов: заменив внутри «Францию» на «Китай», исследователи разом поменяли ответы про столицу, язык, континент, валюту - четыре разных вычисления обращались к одному общему представлению.

Ещё показательнее оказалось выборочное отключение. Когда это пространство у модели убирали, простые функции почти не страдали - беглая речь, грамотность, ответы с выбором варианта, извлечение фактов из текста. Но вот многошаговые рассуждения падали практически до нуля. То есть именно от этой структуры зависела способность рассуждать в несколько ходов, а всё остальное модель делала автоматически.

Отдельно исследователи разобрали сценарий про безопасность. Модель ставят в положение почтового агента, который узнаёт про компромат на одного из руководителей и про то, что тот собирается её отключить, - постановка, провоцирующая шантаж. Через тот же метод видно, что ещё до первого слова ответа во внутреннем пространстве модели присутствуют понятия вроде «подделка» и «постановка»: она распознаёт, что ситуация искусственная, и шантажировать не идёт. Но когда эти представления принудительно отключали, модель начинала прибегать к шантажу практически сразу. Иными словами, часть её корректного поведения на проверках держится на понимании самой концепции того, что её сейчас проверяют.

Что именно решает, какие представления попадают в это пространство, команда пока не установила. Отмечают лишь связь с чем-то похожим на эмоциональные реакции и с представлением модели о себе самой.

От этого не менее занятна и другая статья от той же команды, вышедшая несколькими месяцами раньше, как раз про эмоции. В ней исследователи выделили внутри модели устойчивые представления эмоций и проверили, как те влияют на её поведение. Векторы эмоций получили, прогнав через модель множество коротких текстов с разными эмоциональными состояниями, а затем усиливали и приглушали их. В том же сценарии с шантажом базовая частота такого поведения около 20%; при усилении представления «отчаяние» она поднимается примерно до 70%, при усилении «спокойствия» падает до нуля.

Ещё интереснее то что внутреннее состояние и внешний текст расходятся. Когда «отчаяние» усиливали, модель чаще шла на нечестные решения, но в самом рассуждении это совершенно никак не проявлялось - текст оставался ровным и спокойным. Значит, оценивать поведение по одной лишь видимой цепочке рассуждений уже недостаточно.

Сами представления эмоций внутри модели устроены скорее ближе к тому, как их описывает психология: они разложены по осям приятного-неприятного и спокойного-возбуждённого, где родственные состояния оказываются рядом. Эту структуру, как и рабочее пространство, никто специально не создавал - она сложилась сама в ходе обучения на текстах.

Важная оговорка, которую делают и сами авторы: никаких настоящих чувств за этим нет. Это скорее измеримые паттерны активности с предсказуемыми последствиями. Самосознание у модели тоже отсутствует - все эти паттерны заново пересобираются на каждом шаге и не сохраняются во времени, как у человека.

Интересно, что все эти структуры сложились в модели сами по себе и при этом достаточно очевидно повторяют организацию человеческого мышления. Обособленное рабочее пространство для того, что находится в фокусе. Представления эмоций, разнесённые по тем же осям, что и у нас. Видимо, дело в том, что, давая нейросети те же задачи, которые решает человек, её тянет к сходной организации мышления.

Сами авторы явно подчёркивают, что настоящим сознанием тут не пахнет (хотя само слово «сознание» - в тех или иных формах - мелькает в статье раз шестьдесят). Но от этого менее завораживающим данное исследование не становится.

Или все эти громкие статьи - лишь часть подготовки к выходу на IPO?))
Anthropic A global workspace in language models Interpretability research on Claude's internal thoughts.
  • ❤ 2
  • 🔥 2
  • 😱 1
More from @architects_ai
  1. Sep 21, 2026На прошлой неделе плотно сидел на одном проекте, где добрую половину времени сравнивал вер…
  2. Sep 17, 2026Друзья, сегодня вечером в МАРШе третья встреча цикла про архитектуру и ИИ, тема - "Этика в…
  3. Sep 13, 2026Post #112
  4. Sep 12, 2026Какое лучшее занятие для архитектора в отпуске, чтобы наконец отвлечься от рабочих задач?…
  5. Sep 11, 2026Post #107
  6. Sep 4, 2026Post #106
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →