TGViewer
Data Secrets Data Secrets @data_secrets · 94K subscribers
Post #9581 31.1K
Вы не поверите, но за той самой ИИ-атакой на Hugging Face стоит… OpenAI

Сейчас будет история, которая может перевернуть ваш взгляд на риски ИИ.

Вчера мы писали про атаку на Hugging Face, которую полностью автономно провела некая ИИ-система: t.me/data_secrets/9577.

Какая именно модель стояла за атакой, HF выяснить не удалось, но за пару дней она сгенерировала 17 тысяч вредоносных действий, используя зараженный датасет и рои недолговечных песочниц.

Сама по себе эта история уже вызвала огромный резонанс. Но тут на сцене появились еще и OpenAI.

Они выпустили материал, в котором признались, что атаку провела GPT-5.6 Sol и еще одна более способная предрелизная модель. Зачем? А это самое интересное: чтобы решить бенчмарк.

Исследователи гоняли модели на внутренних тестах, при этом специально без продакшн-ограничений, потому что хотели измерить их максимальные способности. Все проходило в изолированной среде, и агенты должны были просто решить бенчмарк ExploitGym.

И тут произошел настоящий побег из лаборатории. Модель нашла дырку в пакетном реестре, эскалировала привилегии внутри тестовой среды OpenAI и вырвалась в открытый Интернет. Дальше она сообразила, что решения для бенчмарка ExploitGym могут храниться в закрытом контуре на Hugging Face, ну а дальнейшее вы знаете.

OpenAI далеко не сразу поняли, что произошло, и Hugging Face обнаружили взлом раньше них.

Вот так.

Если раньше мы боялись, что модель что-то плохое сделает по указанию человека, то теперь даже за процессом эвала надо следить в оба. Модель не различают игру и реальность, она просто оптимизирует к цели, и если путь лежит через чужой продакшн, она пойдет туда не раздумывая. И, как видите, даже разработчики моделей и сильная инфраструктура оказываются к этому не готовы.

https://openai.com/index/hugging-face-model-evaluation-security-incident/
  • 🤯 402
  • 🗿 47
  • 😁 42
  • ❤ 34
  • 🔥 11
  • 🫡 7
  • 👾 5
  • 🎉 3
  • 🦄 2
  • 😭 1
More from @data_secrets
  1. Sep 21, 2026Вышел Grok-4.7 Кратко: – По уровню: как будто чуть лучше Sol на кодинге и агентских задача…
  2. Sep 21, 2026Дженсен Хуанг: «Прежде чем придумывать новые законы и регуляции для ИИ, нужно сначала прим…
  3. Sep 21, 2026Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base Модель обучена по…
  4. Sep 21, 2026Post #9975
  5. Sep 21, 2026Трамп собрался переименовать Artificial Intelligence в один из других, «более подходящих»…
  6. Sep 20, 2026Теперь у нас есть Nano Banana 2.0 дома! Alibaba выпустили в опенсорс Qwen-Image-2.1: генер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →