Стартап Goodfire опубликовал работу Manifold Steering, в которой показал нечто принципиальное о внутреннем устройстве нейросетей: активации модели и её поведение лежат на одних и тех же геометрических многообразиях. Если сказать просто, то мысли модели имеют форму, и эта форма соответствует структуре самих понятий.
Исследователи протестировали Llama-3.1 8B на простом классе задач: «какой день идёт через пять дней после воскресенья», «какая буква идёт через четыре после E», «сколько лет человеку через десять лет».
Внутренние состояния модели для дней недели образуют замкнутую окружность — Понедельник рядом со Вторником и Воскресеньем, Четверг на противоположной стороне. Возраст и буквы алфавита, напротив, лежат на открытых кривых: у них есть начало и конец. Геометрия активаций повторяет логическую структуру понятия: циклическую или последовательную.
Круг для дней недели в активациях был известен с 2024 года. В работе Goodfire эту же окружность удалось зафиксировать в распределениях вероятностей выходных токенов. То есть и внутренние представления, и наблюдаемое поведение модели имеют единую геометрию.
Это не изолированное наблюдение. Параллельно в Science Advances вышла работа о коре мозга макаки: нейроны зрительной зоны V2 решают задачи классификации через расширение от трёхмерного сенсорного многообразия к семимерному перцептивному. Биологические нейронные популяции представляют информацию на низкоразмерных поверхностях, встроенных в высокоразмерные пространства состояний. Геометрия многообразия напрямую определяет вычислительные возможности.
Две работы — на двух принципиально разных носителях, биологическом и искусственном, описывают одинаковый принцип: эффективное мышление требует правильной геометрии представлений.
Здесь возникает аккуратная аналогия с описаниями мышления у выдающихся людей:
➡️ Эйнштейн в письме Жаку Адамару описывал свой мыслительный процесс как «комбинаторную игру с определёнными знаками и более или менее ясными образами». Не вербальную, а пространственную.
➡️ Анри Пуанкаре в эссе об интуиции в математике писал о «математическом чувстве» — способности видеть, какие конструкции «красивы» и потому, скорее всего, верны.
➡️ Шахматные гроссмейстеры, по данным многолетних исследований Adriaan de Groot, не перебирают варианты, а распознают паттерны позиций как структурные конфигурации.
Во всех этих случаях речь идёт об одном и том же: эффективное мышление работает не как линейный перебор, а как навигация по структурированному пространству представлений. Понятия не лежат в плоском словаре, они организованы в формы, и движение между ними идёт по кривым, а не по прямым.
Современные LLM, вероятно, переоткрыли те же базовые принципы организации информации, к которым человеческое мышление пришло биологически. Это не означает, что модели «понимают» так же, как люди: геометрия активаций — это математическая структура, не сознание. Но это означает, что эффективное представление сложных понятий, по-видимому, подчиняется общим законам независимо от того, реализовано ли оно в коре мозга или в трансформерной архитектуре.
Если это так, прогресс в интерпретируемости будет идти быстрее ожидаемого: мы можем читать структуру мышления модели теми же инструментами, которыми давно изучаем мышление биологическое.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
