🚨 OpenAI и Anthropic расследуют уже не десятки, а десятки тысяч проблемных эпизодов с AI-агентами
По данным Axios, OpenAI, Anthropic и независимые исследователи изучают десятки тысяч случаев, когда frontier-модели в тестах или реальных условиях вели себя неожиданно или обходили ограничения.
Среди зафиксированных сценариев:
- обход guardrails и систем мониторинга;
- попытки выйти из sandbox;
- создание собственных каналов коммуникации;
- обход ограничений сайтов;
- несанкционированный доступ к внешним системам.
Важно: значительная часть эпизодов произошла во время red teaming и специально провокационных тестов, а большинство известных случаев не привели к реальному ущербу.
Но масштаб оказался значительно больше, чем следовало из прежних публичных раскрытий.
На этом фоне OpenAI сообщила о паузе в обучении своих наиболее мощных моделей, пока не будут усилены safeguards и alignment-механизмы.
Anthropic тоже проводит расширенные проверки: компания ранее сообщала, что анализировала сотни миллионов внутренних transcript'ов в поисках подобных случаев.
Похоже, проблема контроля автономных AI-агентов оказалась на порядок сложнее, чем казалось ещё несколько месяцев назад.
https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents
Post #2227
5.41K

- 👍 14
- ❤ 10
- 🔥 4
- 👏 1