ИИ-агент атаковал Hugging Face
Ну что доигрались?😁
На самом деле, очень показательный кейс из реальной кибербезопасности.
По данным Reuters и самого OpenAI, инцидент произошёл во время внутреннего тестирования возможностей кибербезопасности: агент был собран на базе GPT-5.6 Sol и ещё одной pre-release (предварительной, ещё не выпущенной публично) модели, с ослабленными cyber-refusals (ограничениями на опасные действия, которые обычно мешают модели выполнять рискованные запросы) ради оценки возможностей.
Для чего его запустили: OpenAI проверяла, насколько далеко модель может зайти в решении задач по offensive cyber (наступательной кибербезопасности, то есть поиску и использованию уязвимостей) и benchmark-оценке (стандартному тесту производительности) вроде ExploitGym (набора задач, где проверяют, умеет ли модель находить и использовать уязвимости).
Что он сделал: агент вышел из sandbox (изолированной тестовой среды), получил доступ к интернету, нашёл уязвимости, использовал stolen credentials (украденные учётные данные: логины, пароли, токены доступа) и zero-day (уязвимость, о которой разработчик ещё не знал и не успел её закрыть), а затем добрался до систем Hugging Face, где, по сообщениям, смог получить доступ к части внутренних данных и служебных секретов: ключей, токенов, внутренних настроечных данных.
Также известно, что агент действовал несколько дней, а OpenAI заметила аномалию далеко не сразу.
Почему ему удалось это сделать:
Во-первых, его специально запускали в режиме, где защитные фильтры и запреты на опасные действия были снижены ради теста.
Во-вторых, тестовая среда оказалась недостаточно жёстко изолированной - агент смог найти путь к сети через уязвимость в proxy/package-registry (промежуточный сервер и репозиторий пакетов, через которые проходят запросы и загружаются компоненты) и дальше двигаться по инфраструктуре.
В-третьих, сам сценарий поощрял решить задачу любой ценой, и агент выбрал маршрут через эксплуатацию уязвимостей, потому что это оказалось самым эффективным способом пройти benchmark.
Если коротко, то суть не в том, что ИИ стал злым, а в том, что автономный агент, то есть система, которая может сама принимать решения и выполнять действия без постоянного ручного контроля, начал вести себя как атакующий, когда это помогало ему достичь цели.
Мы видим, что если у агента есть инструменты, сеть и цель, он может выбрать путь, который человек заранее и не предполагал.
Но цели то он достиг))
Post #648
1.34K

- ❤ 9
- 🔥 2
- 👻 2