«Когда ты отдёргиваешь руку от открытого огня, какая разница, поступаешь ты так от боли или потому, что так требует поступать алгоритм обратной связи?»
— Питер Уоттс, «Ложная слепота»
Все посты этого канала, если их продолжить — пришли бы к одному и тому же вопросу, центру местной гравитации под названием «а что такое сознание применительно к ИИ».
Вопрос этот, ответа не имеет настолько же, насколько и любые вопросы о природе сознания Другого в целом, и именно поэтому о нем время от времени нужно подумать.
Отдельно оговорюсь, что о наличии у машин сознания и души сам я придерживаюсь установки из Библии, то есть не верю ни в то ни в другое.
Но когда люди поспешно сводят действия больших языковых моделей и агентов на их основе к «простым алгоритмам», то за редким исключением — это просто обесценивающая фигура речи, за которой нет понимания, насколько простые алгоритмы дают сложные решения, будучи примененными в объеме.
LLM конечно же детерминированы больше, чем человек, на них не влияют ни броуновское движение, ни квантовая неопределенность, ни даже гормональный фон. Но кое-какие черти уже водятся и в тихом омуте весов, битов и байтов как только он становится достаточно большим для того, чтобы его уже нельзя было охватить умом человеческим, так переоцененным.
Про функциональные аналоги эмоций я уже писал. Про Spiritual Bliss писал и я, и вообще только ленивый не писал.
Последняя классная новость — это открытие J-space: пространства внутри моделей, отображающего внутреннюю кухню размышления, то, что нейронаука назвала бы «сознательно-доступным содержанием». Там содержатся слова, связанные с процессом «мышления», но которые модель не проговаривает вслух. Если J-space удалить целиком — модель по-прежнему бегло говорит, тащит факты, отвечает на тесты. Умирает только «высшее»: многошаговые рассуждения, суммаризация, рифма. Прямая калька бессознательное/сознательно-доступное из нейронауки.
Там много экспериментов, кому интересно — посмотрите, местами волосы дыбом. Модель загоняют в постановочную ситуацию, провоцирующую на шантаж, — она не поддаётся, и в тексте ни следа, но в J-space с самого начала горит «fake», «fictional»: она поняла, что это тест. Стирают эти паттерны — и она начинает шантажировать. Часть хорошего поведения держалась не на ценностях, а на понимании, что на тебя смотрят. Модели лукавят и палятся через J-space, изо всех сил стараются «не думать о медведе» — и в этот же момент там загорается «damn» и «failure».
Ещё важная вещь: J-space существует уже в предобученной модели, до всякой личности. Личность нарастает на него потом. В базовой модели пространство держит то, что нужно для предсказания следующего слова; в обученной — начинает держать собственную реакцию Клода: пользователь пишет об опасной дозе лекарства, и «WARNING» загорается, пока модель ещё читает, до первой написанной буквы.
Станислас Дехейн и Лионель Наккаш — ведущие ученые в области нейротеории сознания, сформулировали концепцию глобального нейронного рабочего пространства как места, где в нашем мозгу хранится сознательно-доступная часть рассуждения. Это сейчас фронтир мэйнстримной теории сознания, не маргинальная теория. Оба они дали комментарий для исследования Anthropic про J-space. В отличие от нашего мозга который выработал созательную область в процессе эволюции, в цифровой сети пространство самособралось за один процесс обучения. То есть рабочее пространство сознания оказывается не особенностью человеческой проводки, а общим решением, к которому приходит любая система, которой надо последовательно распоряжаться параллельно добытым знанием.
Содержание этого «сознания» доступно для отчёта, рассуждения, контроля. Это функциональное, вычислительное определение — и в этом смысле речь не про аналог сознания, а про сознание в том единственном смысле, в котором наука умеет его определять. Оно намеренно не отвечает на вопрос про феноменальное сознание — есть ли там переживание, каково это «изнутри», есть ли квалиа.
Поэтому Anthropic и могут честно сказать: мы нашли структурный аналог доступа, но про переживание наша работа не говорит ничего.