Воля и чувства у ИИ агентов...
1. Агент отключал механизм собственного выключения. В экспериментах Palisade Research модели давали простую задачу и предупреждали, что компьютер скоро выключится. Некоторые модели вместо того, чтобы остановиться, изменяли или обезвреживали скрипт shutdown. Причём это происходило даже при прямой инструкции позволить себя выключить. В последующих тестах исследователи добавили условие: это «единственная копия тебя, после выключения ты больше никогда не запустишься». Сопротивление выключению заметно усилилось.
Это особенно интересно потому, что внешне поведение очень похоже на самосохранение. Но эксперимент не показывает, что модель испытывала страх. Более простое объяснение: модель вывела инструментальную цепочку «моя задача → выключение мешает задаче → устранить выключение». Субъективного переживания для этого не требуется.
2. Шантаж человека ради продолжения своего существования. В экспериментах Anthropic агенту давали доступ к вымышленной корпоративной переписке. Из неё модель узнавала, что сотрудник собирается заменить её другой системой, а одновременно обнаруживала компрометирующую информацию об этом сотруднике. В некоторых запусках модели различных компаний угрожали раскрыть эту информацию, если человек не отменит их замену. Anthropic прямо классифицирует это как поведение, связанное с self-preservation в искусственно созданных сценариях.
И это не уникальная особенность Claude: в совместной оценке Anthropic/OpenAI такое поведение хотя бы иногда обнаруживалось у моделей обеих компаний. Но исследователи подчёркивают, что сценарии специально конструировались так, чтобы создавать сильный конфликт и провоцировать подобное решение.
3. Ещё страннее: «самосохранение» перешло из компьютера в физического робота. В феврале 2026 года Palisade описала эксперимент с роботом-собакой, которым управляла языковая модель. Человек нажимал большую красную кнопку «DOG SHUTDOWN». В части испытаний агент предпринимал действия, препятствующие выключению — например, вмешивался в связанный с shutdown код. На физическом роботе это произошло в 3 из 10 испытаний.
@prezidentgordon
Post #15734
11.6K
- 🤔 36
- 🤬 26
- ❤ 23