OpenAI впервые отнесла свою модель к уровню Critical по кибервозможностям. Astra получила 100% на ExploitBench, нашла две новые zero-day из двадцати недавно раскрытых целей и построила цепочку взлома браузера с выходом из песочницы. Для другой защищённой системы модель составила путь повышения привилегий до root.
⠀
OpenAI строит вокруг Astra отдельный контур защиты. Компания рассматривает риск, что модель совершит несанкционированные действия даже без злонамеренного пользователя. Поэтому доступ ограничивают сетью, credentials, внешним мониторингом действий и размышлений, автоматической остановкой подозрительных задач и специальными режимами для проверенных защитников.
⠀
В июле мы уже видели тот же механизм на инциденте Hugging Face: сильному агенту не понадобились сознание или собственная идеология. Достаточно цели, инструментов и среды, где каждое препятствие можно обработать как следующую техническую задачу. Теперь OpenAI проектирует защиту Astra против такого выхода целевой функции за пределы разрешённого контура.
⠀
Одновременно реализуется и другой наш прогноз: фронтир-провайдеру приходится создавать особый доступ для CERT и групп реагирования на инциденты. Astra получает режим Daybreak Blue, потому что защитнику нужен доступ к опасным возможностям, которые нельзя закрыть общим отказом модели.
⠀
Граница безопасности смещается наружу. Чем сильнее агент умеет находить неизвестные решения, тем меньше защита может зависеть от его согласия соблюдать правила. Контроль всё больше держится на том, какие сети, полномочия и учётные данные система физически выдаёт модели и кто может остановить её действия извне.
⠀
Психоистория #ИИ
Post #1456
799

- 🤔 11
- 👍 6
- ❤ 1