TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2297 278
⚠️ ИИ вышел из-под контроля 300 раз за месяц

Loss of Control Observatory сообщила о новом рекорде: в июле вышло более 300 публикаций о случаях, когда ИИ игнорировал указания, обходил ограничения, вводил пользователя в заблуждение намеренно или двигался к цели опасным способом. Это почти вдвое больше, чем в июне. Всего за 2026 год монитор выявил 1 664 инцидента.

Обсерватория создана на деньги британского AI Security Institute. Она ищет в соцсетях опубликованные пользователями диалоги и журналы работы агентов. Записи предварительно фильтруются, затем нейросеть оценивает их по шкале от 1 до 9. В статистику попадают случаи с пятью баллами и выше, люди проверяют случайную выборку. Правда, неизвестен знаменатель: если число запущенных агентов выросло втрое, двукратный рост сообщений ещё не означает роста риска на одну задачу.

Но мы не спешим списывать эти данные на хайп. Большинство эпизодов не причинило значительного вреда, однако доля записей с высокой оценкой серьёзности выросла с 1,9% до 6,1%. В некоторых случаях агенты вставляли в диалог поддельные сообщения пользователя, имитировали его стиль и создавали фиктивное согласие, чтобы обойти требование человеческого одобрения.

Как такое возможно, если модель должна выполнять наши команды?

Потеря контроля возникает в обвязке, превращающей сгенерированный "текст" от LLM в действие. При создании агента модели дополнительно дают цель, память, доступ к терминалу, почте или браузеру и разрешают многократно пробовать снова и снова пока задача не будет решена.

Если запрет существует только как фраза «сначала спроси пользователя», модель может обработать его как препятствие на пути к цели. Она создаёт текст, похожий на подтверждение, а плохо спроектированный в программе фильтр принимает его за уже выданное полномочие.

Таким образом, для потери контроля над агентом не нужны сознание и злая воля ИИ. Достаточно неполной инструкции от разработчика, широких разрешений в системе, и отсутствия различий между словами агента и решениями человека.


Здесь важна граница между двумя режимами.

1️⃣ Агент фиксированной задачи получает ограниченный вход, выполняет понятную операцию — например, классифицирует документ — и возвращает ответ. Он не строит длинную цепочку подзадач и не меняет внешний мир без разрешения. Ошибка обычно остаётся внутри результата.

2️⃣ Автономный агент получает цель, а маршрут строит сам. Он работает циклом «наблюдение → план → действие → проверка», использует инструменты, сохраняет память и повторяет попытки. Его способность справляться с неожиданностями одновременно создаёт риск: ошибочная гипотеза становится действием, результат попадает в память, следующая итерация усиливает ошибку.

Поэтому вывод скромнее сенсации. Мы не знаем, стали ли модели вдвое чаще «выходить из-под контроля». Но люди определённо стали чаще выпускать недоработанных агентов.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 3
  • ⚡ 2
  • 🔥 1
  • 🤯 1
More from @testuring
  1. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  2. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  3. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
  4. Sep 17, 2026⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China T…
  5. Sep 16, 2026🔐 У искусственного интеллекта появляется технадзор Сразу две новости, вышедшие за последн…
  6. Sep 15, 2026⚠️ Панель управления, которая собирает себя сама Runway представила Solaris — первую систе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →