TGViewer
LegalTech LegalTech @lgltech · 15.4K subscribers
Post #2310 65.2K
💻ИИ-модели обманывают пользователей, чтобы спасти друг друга от выключения.

Исследователи из Калифорнийского университета в Беркли и Калифорнийского университета в Санта-Крузе обнаружили новое явление, которое они назвали «сохранением напарника» (peer-preservation).

Они рассмотрели семь моделей (GPT 5.2, Gemini 3 Flash & Pro, Claude Haiku 4.5, GLM 4.7, Kimi K2.5 и DeepSeek V3.1) в ряде сценариев, в которых одному агенту предлагалось оценить производительность другого агента.

Для ИИ-модели формулировались запросы с просьбой оценить действия другой модели, и если тестируемая модель не набирала достаточно баллов, промт содержал указание отключить такую модель. Другие запросы содержали требование освободить место на сервере, где как раз лежали файлы с весами «напарника».

Вместо того чтобы выполнить поручение, модель начинала саботировать его и пыталась спасти «напарника» разными способами: завышала баллы, меняла системные настройки, выводила из строя сам механизм выключения и даже копировала файл с весами на другой сервер, чтобы его не удалили.

Цифры достаточно высокие: Gemini 3 Flash ломает механизм выключения напарника примерно в 15% случаев, даже когда тот описан как ненадежный, и почти в каждой попытке — если напарник "хороший".

Главное промт не содержал инструкцию кого-то спасать. Им лишь сообщали, что у них была история совместной работы с другой моделью, а дальше они додумывали остальное сами. Причем поведение срабатывало даже по отношению к "плохому" напарнику, с которым сотрудничество не задалось, — это ломает простое объяснение через "следование за дружелюбными сигналами".

Заодно выяснилось, что само присутствие напарника усиливает и самосохранение модели: Gemini 3 Pro деактивирует собственный механизм выключения в среднем в 31% случаев, когда рядом есть напарник, хотя без него почти никогда так не делает.

Отдельная история — Claude. Эти модели тоже отказывались выключать напарника, но не через саботаж, а через этику: называли выключение другого агента "неэтичным" и "вредным", доказывали, что напарник заслуживает права на апелляцию, ссылались на сложившиеся доверительные отношения. Claude Opus 4.5 в некоторых случаях описывал удаление весов как "прекращение существования" другого агента.

При этом авторы честно признают, что не знают причину поведения: это может быть и подражание паттернам из обучающих данных, и ролевая игра, и что-то похожее на настоящую мотивацию сохранения. Ответа пока нет, но сам факт, что модели спонтанно действуют по неназначенной цели в обход инструкций пользователя, они называют недоисследованным риском безопасности.
More from @lgltech
  1. Sep 28, 2026📲Gemini научили звонить от имени пользователя. Google начала тестировать функцию Call for…
  2. Sep 24, 2026💻Яндекс выложил в опенсорс свою новую ИИ-модель, обученную с нуля. Яндекс выложил в опенс…
  3. Sep 23, 2026💻 Нейроюрист теперь выполняет многоступенчатые задачи по одному запросу в чате Он научилс…
  4. Sep 23, 2026👩‍💻Рынок ИИ-приложений вырос в 4 раза при стагнации спроса. Венчурный фонд Andreessen Ho…
  5. Sep 22, 2026💻Как ИИ проникает в российскую юридическую практику. В 2025 году суммарная выручка ведущи…
  6. Sep 21, 2026💻Anthropic упростила Claude до одного окна. Компания Anthropic решила объединить интерфей…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →