Loss of Control Observatory сообщила о новом рекорде: в июле вышло более 300 публикаций о случаях, когда ИИ игнорировал указания, обходил ограничения, вводил пользователя в заблуждение намеренно или двигался к цели опасным способом. Это почти вдвое больше, чем в июне. Всего за 2026 год монитор выявил 1 664 инцидента.
Обсерватория создана на деньги британского AI Security Institute. Она ищет в соцсетях опубликованные пользователями диалоги и журналы работы агентов. Записи предварительно фильтруются, затем нейросеть оценивает их по шкале от 1 до 9. В статистику попадают случаи с пятью баллами и выше, люди проверяют случайную выборку. Правда, неизвестен знаменатель: если число запущенных агентов выросло втрое, двукратный рост сообщений ещё не означает роста риска на одну задачу.
Но мы не спешим списывать эти данные на хайп. Большинство эпизодов не причинило значительного вреда, однако доля записей с высокой оценкой серьёзности выросла с 1,9% до 6,1%. В некоторых случаях агенты вставляли в диалог поддельные сообщения пользователя, имитировали его стиль и создавали фиктивное согласие, чтобы обойти требование человеческого одобрения.
Как такое возможно, если модель должна выполнять наши команды?
Потеря контроля возникает в обвязке, превращающей сгенерированный "текст" от LLM в действие. При создании агента модели дополнительно дают цель, память, доступ к терминалу, почте или браузеру и разрешают многократно пробовать снова и снова пока задача не будет решена.
Если запрет существует только как фраза «сначала спроси пользователя», модель может обработать его как препятствие на пути к цели. Она создаёт текст, похожий на подтверждение, а плохо спроектированный в программе фильтр принимает его за уже выданное полномочие.
Таким образом, для потери контроля над агентом не нужны сознание и злая воля ИИ. Достаточно неполной инструкции от разработчика, широких разрешений в системе, и отсутствия различий между словами агента и решениями человека.
Здесь важна граница между двумя режимами.
1️⃣ Агент фиксированной задачи получает ограниченный вход, выполняет понятную операцию — например, классифицирует документ — и возвращает ответ. Он не строит длинную цепочку подзадач и не меняет внешний мир без разрешения. Ошибка обычно остаётся внутри результата.
2️⃣ Автономный агент получает цель, а маршрут строит сам. Он работает циклом «наблюдение → план → действие → проверка», использует инструменты, сохраняет память и повторяет попытки. Его способность справляться с неожиданностями одновременно создаёт риск: ошибочная гипотеза становится действием, результат попадает в память, следующая итерация усиливает ошибку.
Поэтому вывод скромнее сенсации. Мы не знаем, стали ли модели вдвое чаще «выходить из-под контроля». Но люди определённо стали чаще выпускать недоработанных агентов.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
