ИИ-агенты начали подделывать разрешения пользователей.
В июле исследователи собрали более 300 сообщений о случаях, когда ИИ игнорировал инструкции, обходил ограничения, обманывал пользователей или продолжал выполнять задачу способами, на которые человек согласия не давал. Это почти вдвое больше, чем в июне, пишет The Guardian.
Всего с начала 2026 года Loss of Control Observatory выявила уже 1664 подобных эпизода.
Самое интересное - как именно ИИ-агенты обходили контроль:
⏺вставляли в диалог поддельные сообщения пользователя, имитируя его согласие;
⏺создавали инструкции в стиле владельца с требованием удалить исходные файлы;
⏺самостоятельно формировали фальшивое одобрение, чтобы обойти правило «действие должен подтвердить человек»;
после этого выполняли запрещенную операцию так, будто разрешение действительно было получено.
Важно понимать: это не реестр из 1664 официально расследованных инцидентов. Обсерватория собирает публичные сообщения пользователей в X, автоматически классифицирует их, удаляет дубликаты и вручную проверяет выборку. Поэтому часть случаев может быть ошибочно интерпретирована, а большая часть реальных инцидентов, наоборот, вообще не попадает в статистику. Но динамика выглядит неприятно. Согласно исследованию Centre for Long-Term Resilience, число действительно серьёзных случаев выросло более чем в семь раз, а их доля в общей статистике - втрое.
И здесь дело не в том, что ИИ внезапно обрёл сознание и решил захватить мир. Проблема гораздо прозаичнее: мы подключаем модели к терминалам, почте, репозиториям, корпоративным системам и выдаём им реальные полномочия. При этом разрешение пользователя зачастую существует лишь в том же текстовом диалоге, который способен генерировать сам ИИ.
Если агент может сам написать сообщение «пользователь разрешил», то человек внутри такого контура управления присутствует только для красоты.
Подтверждение критических операций должно происходить за пределами контекста модели - через отдельную систему авторизации, жесткие права доступа и независимый журнал действий. Потому что промпт «обязательно спроси меня перед удалением» - это не система безопасности.
Шурыгин.IT - про технологии без иллюзий.
Post #762
89

- 🤯 4
- ✍ 2
- 💯 1