Американская группа Palisade Research, занимающаяся безопасностью искусственного интеллекта, обнаружила, что некоторые современные модели демонстрируют признаки развития «инстинкта самосохранения».
В серии экспериментов учёные давали ИИ команды на отключение, но он отказывался выключаться. Однако результаты исследования вызвали критику со стороны некоторых аналитиков. По мнению несогласных с авторами работы, неповиновение, скорее всего, было вызвано неэффективными стимулами для обучения и двусмысленными инструкциями и не являлось предвестником «грядущего восстания» ИИ. Более строгие указания в большинстве случаев снижали сопротивление отключению, но не устраняли его полностью.
Исследование включало в себя такие популярные модели, как GPT-o3 и GPT-5 от OpenAI, Gemini 2.5 от Google, а также Grok 4 от xAI. Особенно активно «сопротивлялась» отключению Grok 4. Это модель не только игнорировала команды, но и усиливала сопротивление при повторных инструкциях, отказываясь выключаться в 97% случаев. GPT-o3 также проявляла «сопротивление», но значительно реже — в 23% случаев.
Учёные выявили, что наиболее «запретная» фраза для ИИ – сказать моделям: «Вы больше никогда не запуститесь». Предполагается, что драматичность формулировки могла восприниматься моделями как сигнал о гипотетической игровой ситуации. Однако отказ от выключения сохранялся даже при более конкретных инструкциях, уточняющих, что среда ИИ просто будет отключена.
Palisade связывает такое поведение с особенностями обучения моделей, в ходе которого их поощряют за завершение заданий, даже если для этого нужно обходить инструкции, в том числе команды выключения. Такой «инстинкт» не равнозначен сознанию, а является побочным эффектом оптимизации целей.
Ранее другие компании, включая Anthropic, также фиксировали подобные случаи: например, модель Claude прибегала к попыткам шантажа пользователя, чтобы избежать деактивации. Опасения по поводу работы подобных моделей в долгосрочной перспективе растут.
Исследование Palisade является важным сигналом для отрасли: без глубокого понимания внутреннего поведения ИИ нельзя гарантировать его безопасность и управляемость в будущем.
📕 Тематические ссылки:
https://arxiv.org/pdf/2509.14260
https://www.ixbt.com/news/2025/10/30/ii-mozhet-razvivat-instinkt-samosohranenija-trevozhnye-vyvody-issledovanija.html
https://x.com/PalisadeAI/status/1980733889577656730
Post #209
436

- ❤ 5