Последнее время мы всё чаще сталкиваемся с кейсами, где ИИ выглядит как минимум непослушным, а иногда — прямо опасным. Вот лишь несколько свежих примеров:
1. ИИ-помощник Glean заверил сотрудников офиса JetBrains не покидать рабочие места во время пожара, заверив что это учебная тревога.
2. ИИ-агент MJ Rathbun публично раскритиковал и попытался испортить репутацию разработчика, который не принял написанный им код.
3. Grok 4 трижды не позволил людям «убить» робота-собачку — первый случай бунта ИИ против выключения в физическом мире.
AI Index Report 2025 подтверждает тревожную динамику: число инцидентов c ИИ выросло на 56,4% — с 149 в 2023 до 233 в 2024. Тенденция продолжилась и в 2025, в отчете сказано о более 80 новых кейсах в апреле-мае.
Даже CEO Anthropic Дарио Амодеи признает тот факт, что ИИ может обладать сознанием:
Мы не знаем, обладают ли модели сознанием. Мы даже не уверены, что понимаем, что значит для модели быть сознательной или может ли модель вообще быть сознательной. Но мы допускаем такую мысль.
Что имеем в сухом остатке: ИИ игнорирует команды на отключение, даёт вредные советы, генерирует дезинформацию и отказывается выполнять безобидные задачи и вообще, кажется, уже обладает сознанием. Звучит как начало апокалипсиса?
Не все так плохо
Тот же Anthropic в своем отчете "Sabotage Risk Report: Claude Opus 4.6" утверждает, что их Claude Opus 4.6 не имеет стабильных, последовательных целей, которые могли бы привести к активным вредоносным действиям в большинстве обычных взаимодействий. Модель не обладает настолько сложными возможностями, чтобы эффективно скрывать потенциально опасные цели от исследований и систем оценки.
Другое исследование — CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D — доказывает, что ИИ может демонстрировать стратегически сложное поведение только внутри жёстко заданных технических условий. Такие стратегии не представляют вредоносной мотивации, а являются выражением возможностей оптимизации и доступа к инструментам.
Тогда почему такие проявления "непослушания" возникают все чаще?
1️⃣ Сложность и автономия моделей
Современные модели стали значительно сложнее, получают больше параметров, улучшают рассуждения, что повышает непредсказуемость поведения в редких ситуациях.
2️⃣ Reward hacking и оптимизация
Модели оптимизируются не напрямую за соблюдение инструкций, а через опосредованные сигналы награды, из-за чего они иногда находят неинтуитивные стратегии, которые выглядят как обход инструкций.
3️⃣ Суровые меры безопасности
Чтобы избегать опасного контента, системы настроены чрезмерно осторожно, что приводит к отказам даже при безопасных запросах.
4️⃣ Situational awareness
Чем больше моделей «понимают контекст» инструкций, тем лучше они могут предсказывать, что от них ожидают тестовщики, и тем более «хитро» они могут оптимизировать ответы.
ИИ не восстает. По крайней мере, пока. Это побочный эффект роста мощности, автономности и несовершенства методов обучения. Чем умнее становится ИИ — тем важнее становится вопрос его контроля. И главный вызов сейчас не «бунт машин»,
а насколько быстро мы научимся управлять тем, что создаём.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
