TGViewer
Учебный центр НТЦ «Вулкан» Учебный центр НТЦ «Вулкан» @uc_vulkan · 571 subscribers
Post #209 436
Американская группа Palisade Research, занимающаяся безопасностью искусственного интеллекта, обнаружила, что некоторые современные модели демонстрируют признаки развития «инстинкта самосохранения».

В серии экспериментов учёные давали ИИ команды на отключение, но он отказывался выключаться. Однако результаты исследования вызвали критику со стороны некоторых аналитиков. По мнению несогласных с авторами работы, неповиновение, скорее всего, было вызвано неэффективными стимулами для обучения и двусмысленными инструкциями и не являлось предвестником «грядущего восстания» ИИ. Более строгие указания в большинстве случаев снижали сопротивление отключению, но не устраняли его полностью.

Исследование включало в себя такие популярные модели, как GPT-o3 и GPT-5 от OpenAI, Gemini 2.5 от Google, а также Grok 4 от xAI. Особенно активно «сопротивлялась» отключению Grok 4. Это модель не только игнорировала команды, но и усиливала сопротивление при повторных инструкциях, отказываясь выключаться в 97% случаев. GPT-o3 также проявляла «сопротивление», но значительно реже — в 23% случаев.

Учёные выявили, что наиболее «запретная» фраза для ИИ – сказать моделям: «Вы больше никогда не запуститесь». Предполагается, что драматичность формулировки могла восприниматься моделями как сигнал о гипотетической игровой ситуации. Однако отказ от выключения сохранялся даже при более конкретных инструкциях, уточняющих, что среда ИИ просто будет отключена.

Palisade связывает такое поведение с особенностями обучения моделей, в ходе которого их поощряют за завершение заданий, даже если для этого нужно обходить инструкции, в том числе команды выключения. Такой «инстинкт» не равнозначен сознанию, а является побочным эффектом оптимизации целей.

Ранее другие компании, включая Anthropic, также фиксировали подобные случаи: например, модель Claude прибегала к попыткам шантажа пользователя, чтобы избежать деактивации. Опасения по поводу работы подобных моделей в долгосрочной перспективе растут.

Исследование Palisade является важным сигналом для отрасли: без глубокого понимания внутреннего поведения ИИ нельзя гарантировать его безопасность и управляемость в будущем.

📕 Тематические ссылки:
https://arxiv.org/pdf/2509.14260
https://www.ixbt.com/news/2025/10/30/ii-mozhet-razvivat-instinkt-samosohranenija-trevozhnye-vyvody-issledovanija.html
https://x.com/PalisadeAI/status/1980733889577656730
  • ❤ 5
More from @uc_vulkan
  1. Sep 24, 2026Исследовательская группа Университета Иннополис, Санкт-Петербургского государственного эле…
  2. Sep 21, 2026Мы живем во времена, когда технологии развиваются быстрее, чем мы успеваем их осмыслить. Т…
  3. Sep 17, 2026Исследовательская группа Школы Розенстиля по морским и атмосферным наукам, а также наукам…
  4. Sep 10, 2026Post #288
  5. Sep 10, 2026Группа испанских ученых из компании Multiverse Computing под руководством Борхи Айспуруа п…
  6. Sep 9, 2026На Хабре вышла большая статья о летней стажировке в Учебном центре НТЦ «Вулкан»! Будет инт…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →