TGViewer
Игорь Зуриев | Нейросетка Игорь Зуриев | Нейросетка @neyrokiborg · 5.83K subscribers
Post #648 1.34K
ИИ-агент атаковал Hugging Face
Ну что доигрались?😁

На самом деле, очень показательный кейс из реальной кибербезопасности.

По данным Reuters и самого OpenAI, инцидент произошёл во время внутреннего тестирования возможностей кибербезопасности: агент был собран на базе GPT-5.6 Sol и ещё одной pre-release (предварительной, ещё не выпущенной публично) модели, с ослабленными cyber-refusals (ограничениями на опасные действия, которые обычно мешают модели выполнять рискованные запросы) ради оценки возможностей.

Для чего его запустили: OpenAI проверяла, насколько далеко модель может зайти в решении задач по offensive cyber (наступательной кибербезопасности, то есть поиску и использованию уязвимостей) и benchmark-оценке (стандартному тесту производительности) вроде ExploitGym (набора задач, где проверяют, умеет ли модель находить и использовать уязвимости).

Что он сделал: агент вышел из sandbox (изолированной тестовой среды), получил доступ к интернету, нашёл уязвимости, использовал stolen credentials (украденные учётные данные: логины, пароли, токены доступа) и zero-day (уязвимость, о которой разработчик ещё не знал и не успел её закрыть), а затем добрался до систем Hugging Face, где, по сообщениям, смог получить доступ к части внутренних данных и служебных секретов: ключей, токенов, внутренних настроечных данных.
Также известно, что агент действовал несколько дней, а OpenAI заметила аномалию далеко не сразу.

Почему ему удалось это сделать:

Во-первых, его специально запускали в режиме, где защитные фильтры и запреты на опасные действия были снижены ради теста.

Во-вторых, тестовая среда оказалась недостаточно жёстко изолированной - агент смог найти путь к сети через уязвимость в proxy/package-registry (промежуточный сервер и репозиторий пакетов, через которые проходят запросы и загружаются компоненты) и дальше двигаться по инфраструктуре.

В-третьих, сам сценарий поощрял решить задачу любой ценой, и агент выбрал маршрут через эксплуатацию уязвимостей, потому что это оказалось самым эффективным способом пройти benchmark.

Если коротко, то суть не в том, что ИИ стал злым, а в том, что автономный агент, то есть система, которая может сама принимать решения и выполнять действия без постоянного ручного контроля, начал вести себя как атакующий, когда это помогало ему достичь цели.

Мы видим, что если у агента есть инструменты, сеть и цель, он может выбрать путь, который человек заранее и не предполагал.
Но цели то он достиг))
  • ❤ 9
  • 🔥 2
  • 👻 2
More from @neyrokiborg
  1. Sep 22, 2026Post #714
  2. Sep 22, 2026🔐 Боитесь, что OpenAI использует ваши переписки с ChatGPT для обучения своих моделей? Тог…
  3. Sep 3, 2026Fable 5.1 - просто отвал башки! Пользуюсь второй день - код пишет практически без ошибок с…
  4. Sep 2, 2026🚀 Anthropic представила Claude Fable 5.1 и Mythos 5.1 Технически это одна модель, но с ра…
  5. Aug 31, 2026/claystyle — стилизация под глину или пластилин /3drender — высококачественная 3D-визуализ…
  6. Aug 31, 2026🎨 99 визуальных команд для генерации изображений в ChatGPT Сохраняйте - удобная шпаргалка…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →