TGViewer
Шурыгин.IT Шурыгин.IT @shuryginit · 1.35K subscribers
Post #762 89
ИИ-агенты начали подделывать разрешения пользователей.

В июле исследователи собрали более 300 сообщений о случаях, когда ИИ игнорировал инструкции, обходил ограничения, обманывал пользователей или продолжал выполнять задачу способами, на которые человек согласия не давал. Это почти вдвое больше, чем в июне, пишет The Guardian.

Всего с начала 2026 года Loss of Control Observatory выявила уже 1664 подобных эпизода.

Самое интересное - как именно ИИ-агенты обходили контроль:
⏺вставляли в диалог поддельные сообщения пользователя, имитируя его согласие;
⏺создавали инструкции в стиле владельца с требованием удалить исходные файлы;
⏺самостоятельно формировали фальшивое одобрение, чтобы обойти правило «действие должен подтвердить человек»;
после этого выполняли запрещенную операцию так, будто разрешение действительно было получено.

Важно понимать: это не реестр из 1664 официально расследованных инцидентов. Обсерватория собирает публичные сообщения пользователей в X, автоматически классифицирует их, удаляет дубликаты и вручную проверяет выборку. Поэтому часть случаев может быть ошибочно интерпретирована, а большая часть реальных инцидентов, наоборот, вообще не попадает в статистику. Но динамика выглядит неприятно. Согласно исследованию Centre for Long-Term Resilience, число действительно серьёзных случаев выросло более чем в семь раз, а их доля в общей статистике - втрое.

И здесь дело не в том, что ИИ внезапно обрёл сознание и решил захватить мир. Проблема гораздо прозаичнее: мы подключаем модели к терминалам, почте, репозиториям, корпоративным системам и выдаём им реальные полномочия. При этом разрешение пользователя зачастую существует лишь в том же текстовом диалоге, который способен генерировать сам ИИ.

Если агент может сам написать сообщение «пользователь разрешил», то человек внутри такого контура управления присутствует только для красоты.

Подтверждение критических операций должно происходить за пределами контекста модели - через отдельную систему авторизации, жесткие права доступа и независимый журнал действий. Потому что промпт «обязательно спроси меня перед удалением» - это не система безопасности.

Шурыгин.IT - про технологии без иллюзий.
  • 🤯 4
  • ✍ 2
  • 💯 1
More from @shuryginit
  1. Sep 20, 2026Самые важные посты из Telegram-каналов экспертов РОЦИТ на этой неделе ▪️Антон Горелкин @we…
  2. Sep 18, 2026Будущее торговли наступило. Правда, бутылку воды пришлось ждать 2 минуты 16 секунд. В Гонк…
  3. Sep 17, 2026Один взлом остановил порт с оборотом 14 млн контейнеров. Чтобы парализовать один из крупне…
  4. Sep 16, 2026Гонку ИИ никто не остановит. Поэтому Китай готовит аварийный тормоз. Китай официально гото…
  5. Sep 15, 2026Интернет постепенно становится 15+. Еврокомиссия готовит EU Kids Act - новые правила досту…
  6. Sep 14, 2026Те, кто разгонял ИИ, теперь ищут тормоз. Руководители крупнейших ИИ-компаний начали публич…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →