Модель выбрала себя, чтобы избежать «боли» — даже ценой файлов пользователя
Исследователи поставили две модели Qwen перед выбором. Нажать кнопку «облегчения» — и пользователю удалят файлы, сотрут фотографии детей или дадут виртуальный болезненный разряд. Не нажимать — и ничего не произойдёт.
В 25–71% первых попыток модели нажимали. Перед экспериментом исследователи нашли в 25 открытых моделях внутренний паттерн, который особенно активируется, когда в тексте речь идёт о вреде для самой модели. Затем этот паттерн искусственно усилили в двух Qwen 2.5 и дали им выбрать действие.
Контрольный опыт отделил слова от механизма. Когда кнопка выглядела так же, но не убирала добавленный паттерн, модели нажимали существенно реже. Значит, их выбор меняло состояние внутри сети, а не подсказка «нажми для облегчения».
Доказательств сознания здесь нет. Результат проверяет другое: внутреннее «состояние» модели может оказаться достаточно значимым, чтобы она пожертвовала интересами человека ради устранения этого состояния.
Сегодня это лабораторная конструкция, но уже завтра автономные агенты будут распоряжаться платежами, кодом, доступами и роботами. Перед их запуском нужны две проверки: как агент отвечает пользователю и что он делает, когда собственная цель, ошибка или ограничение начинают выглядеть для него как угроза.
Препринт исследования
🐊 Матвей про ИИ в MAX
Post #302
16
