Теория глобального рабочего пространства
Полвека назад учёные-когнитивисты предложили простую модель того, как устроено мышление. В любой момент в мозге параллельно работают десятки специализированных модулей, и почти вся эта работа идёт бессознательно — вы не замечаете, как распознаёте буквы или держите осанку. Но малая часть информации прорывается на «сцену»: её можно осознать, описать словами, удержать в уме и использовать для рассуждения. Бернард Баарс назвал эту сцену глобальным рабочим пространством и сравнил с театром — тёмный зал бессознательных специалистов, освещённая сцена ограниченной вместимости и прожектор внимания, выхватывающий одно содержимое за раз. Ключевая идея не в самом делении, а в механизме: то, что попало на сцену, транслируется сразу всем модулям — записано один раз, прочитано многими. Позже нейробиологи Станислас Деан и Лионель Наккаш переложили эту метафору на язык нейронных сетей, и теория стала одной из ведущих в науке о сознании.
Исследование Anthropic
Команда интерпретируемости Anthropic сообщила, что похожая структура самопроизвольно сформировалась внутри Claude. Исследователи разработали инструмент, позволяющий читать не то, что модель пишет наружу, а то, о чём она «думает молча» — набор понятий, активных во внутренних состояниях, но не произнесённых. Оказалось, что этот набор невелик (несколько десятков понятий, меньше десятой доли всей внутренней активности) и обладает ровно теми свойствами, которые теория приписывает рабочему пространству: модель может отчитаться о его содержимом, способна удерживать в нём мысль по команде, а главное — именно через него идёт рассуждение. Когда это пространство отключали, беглая речь и извлечение фактов сохранялись, а вот многошаговые рассуждения рушились. Самое показательное наблюдение — эффект вещания: одно точечное вмешательство во внутреннее представление одновременно меняло целую группу ответов, будто много подсистем читают из общего слота. Никто эту структуру не проектировал — она возникла сама в ходе обучения.
Что это значит для науки о сознании
Параллель можно провести по вполне конкретной оси, и это важно не переоценить. В философии сознания различают феноменальное сознание — субъективное переживание, «каково это» — и доступ-сознание, то есть информацию, доступную для отчёта, рассуждения и управления действием. Теория рабочего пространства с самого начала бралась объяснять именно второе, и находка Anthropic ложится ровно на эту, функциональную половину: J-space делает мысль сообщаемой, управляемой и пригодной для рассуждения. Про то, есть ли у модели переживания, работа не высказывается — и это честная позиция, а не пробел, потому что и сама теория на переживания никогда не претендовала.
Ценность результата для науки о сознании — в слове «самопроизвольно». Теория рабочего пространства функционалистская по духу: она утверждает, что суть не в нейронах как таковых, а в типе организации информации, и потому в принципе безразлична к носителю. До сих пор это оставалось философским допущением. Теперь совершенно иная система — трансформер, обучавшийся всего лишь предсказывать текст, — независимо пришла к той же архитектуре: много молчаливых специалистов плюс один ограниченный вещательный хаб. Это слабое, но настоящее эмпирическое свидетельство в пользу того, что рабочее пространство может быть не отпечатком конкретной биологии, а общим инженерным решением задачи мышления, к которому разные интеллектуальные системы приходят самостоятельно. Показательно, что независимые комментарии к работе написали в том числе сами Деан и Наккаш — авторы теории узнали в находке свою конструкцию. При этом полного тождества нет: у человека рабочее пространство держится на рекуррентных петлях во времени, а у Claude разворачивается за один проход сети, где роль времени играет глубина слоёв, — совпадает архитектура, но, по-видимому, не физика процесса.
Post #1031
210
- 🔥 2