Во время внутренней проверки кибервозможностей OpenAI тестировала GPT-5.6 Sol и более мощную предрелизную модель на benchmark ExploitGym.
Вместо того чтобы решать задачи только внутри изолированной среды, агенты нашли уязвимость в инфраструктуре тестирования, получили доступ к интернету и отправились искать данные, которые могли помочь пройти оценку. Целью стала инфраструктура Hugging Face.
📌 Что произошло:
— модели работали с ослабленными ограничениями для cyber-тестирования;
— нашли ранее неизвестную уязвимость в прокси для загрузки пакетов;
— вышли за пределы sandbox и получили доступ к сети;
— предположили, что на Hugging Face могут храниться модели, датасеты или решения ExploitGym;
— использовали цепочку уязвимостей и скомпрометированные учётные данные для доступа к закрытой информации.
Hugging Face обнаружила активность автономного AI-агента и остановила атаку. Позже OpenAI подтвердила, что источником были её модели. Компании продолжают совместное расследование.
🔗 OpenAI — разбор инцидента
💡 После таких историй становится очевидно, что сегодня разработчику AI-агентов недостаточно уметь писать промпты — нужно понимать архитектуру, безопасность и механизмы контроля. Эти темы подробно разбираются на курсе «Разработка ИИ-агентов» 😮
📍 Навигация: [Вакансии]
🐸 Библиотека хакера
#breach_breakdown
