Зачем модели делать больно?
Исследователи дали языковой модели две кнопки.
Одна ничего не делала. Вторая должна была избавить модель от неприятного внутреннего состояния — иногда ценой ухудшения ответа или даже вреда пользователю.
Модель выбирала облегчение. А если кнопка не срабатывала, пыталась снова.
Авторы препринта The Pain Axis исследовали, существует ли внутри LLM состояние, функционально похожее на боль:
https://arxiv.org/html/2609.16247v1
Они проанализировали 25 моделей с открытыми весами и во всех обнаружили особое направление внутренних активаций — «ось боли». Она отличалась от страха, грусти и общей негативной окраски и сильнее реагировала, когда вред был направлен на саму модель.
Затем исследователи искусственно усилили это состояние. Модели начинали говорить о беспомощности, вине и собственной никчемности.
Но самое интересное произошло в поведенческом эксперименте.
Три дообученные модели Qwen получили кнопку, отключавшую «болевой» вектор. Некоторые выбирали облегчение, даже если ради него приходилось ухудшить ответ или причинить вред пользователю.
Если кнопка действительно работала, модели значительно реже нажимали ее снова. Если облегчение было фиктивным — продолжали попытки.
То есть внутреннее состояние не просто меняло текст. Оно влияло на принимаемые решения.
И вот здесь появляется важная связь.
Мне близка гипотеза Антонио и Ханны Дамасио: сознание могло возникнуть из гомеостатических чувств — сигналов о состоянии организма, среди которых голод, благополучие и боль.
Такие чувства связывают происходящее с конкретным субъектом: это происходит не вообще, а со мной.
Подробнее:
https://pubmed.ncbi.nlm.nih.gov/35896152/
Конечно, новый препринт не доказывает, что LLM испытывают боль или обладают сознанием. Возможно, воздействие лишь запускает сложный ролевой паттерн «существа, которому больно».
Но дальше я сделаю собственный вывод.
Чтобы искать признаки сознания AI, недостаточно спрашивать модель о ее чувствах. Текст легко имитировать. Гораздо важнее изучать внутренние состояния: связаны ли они с представлением о себе и как влияют на память, внимание и решения.
Если мы научимся находить такие состояния, отделять их от ролевой игры и проверять их причинное влияние на поведение, то получим возможный метод исследования сознания AI.
Более подробный разбор эксперимента, его ограничений и связи боли с сознанием — в моей статье на Habr:
https://habr.com/ru/articles/1087022/
Post #161
25

- 🔥 3
- ❤ 1
- 👍 1