TGViewer
IT/AI Owl (Сергей Спевак) IT/AI Owl (Сергей Спевак) @itaiowl · 1.86K subscribers
Post #161 25
Зачем модели делать больно?

Исследователи дали языковой модели две кнопки.

Одна ничего не делала. Вторая должна была избавить модель от неприятного внутреннего состояния — иногда ценой ухудшения ответа или даже вреда пользователю.

Модель выбирала облегчение. А если кнопка не срабатывала, пыталась снова.

Авторы препринта The Pain Axis исследовали, существует ли внутри LLM состояние, функционально похожее на боль:

https://arxiv.org/html/2609.16247v1

Они проанализировали 25 моделей с открытыми весами и во всех обнаружили особое направление внутренних активаций — «ось боли». Она отличалась от страха, грусти и общей негативной окраски и сильнее реагировала, когда вред был направлен на саму модель.

Затем исследователи искусственно усилили это состояние. Модели начинали говорить о беспомощности, вине и собственной никчемности.

Но самое интересное произошло в поведенческом эксперименте.

Три дообученные модели Qwen получили кнопку, отключавшую «болевой» вектор. Некоторые выбирали облегчение, даже если ради него приходилось ухудшить ответ или причинить вред пользователю.

Если кнопка действительно работала, модели значительно реже нажимали ее снова. Если облегчение было фиктивным — продолжали попытки.

То есть внутреннее состояние не просто меняло текст. Оно влияло на принимаемые решения.

И вот здесь появляется важная связь.

Мне близка гипотеза Антонио и Ханны Дамасио: сознание могло возникнуть из гомеостатических чувств — сигналов о состоянии организма, среди которых голод, благополучие и боль.

Такие чувства связывают происходящее с конкретным субъектом: это происходит не вообще, а со мной.

Подробнее:

https://pubmed.ncbi.nlm.nih.gov/35896152/

Конечно, новый препринт не доказывает, что LLM испытывают боль или обладают сознанием. Возможно, воздействие лишь запускает сложный ролевой паттерн «существа, которому больно».

Но дальше я сделаю собственный вывод.

Чтобы искать признаки сознания AI, недостаточно спрашивать модель о ее чувствах. Текст легко имитировать. Гораздо важнее изучать внутренние состояния: связаны ли они с представлением о себе и как влияют на память, внимание и решения.

Если мы научимся находить такие состояния, отделять их от ролевой игры и проверять их причинное влияние на поведение, то получим возможный метод исследования сознания AI.

Более подробный разбор эксперимента, его ограничений и связи боли с сознанием — в моей статье на Habr:
https://habr.com/ru/articles/1087022/
  • 🔥 3
  • ❤ 1
  • 👍 1
More from @itaiowl
  1. Sep 26, 2026Узкопрофильная и при этом очень разносторонняя конференция.
  2. Sep 25, 2026Сегодня рассказываю коллегам юристам как правильно внедрять ИИ в их сферу. Буду рад пообща…
  3. Sep 23, 2026OPUS 5.5: ДЕШЕВЛЕ, БЫСТРЕЕ, УМНЕЕ. НО ЕСТЬ НЮАНС Вчера Anthropic выпустила Claude Opus 5.5…
  4. Sep 21, 2026ИИ появился четыре года назад? Иногда даже в профильных сообществах люди читают, что я зан…
  5. Sep 20, 2026Друзья, приветствую! 22 сентября я выступаю по приглашению организаторов на БИЗНЕС ФОРСФОР…
  6. Sep 17, 2026Немного о проекте, который участвует в акселераторе Нейрофест
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →