коротко:
1. OpenAI перевіряла, наскільки її моделі вміють хакати в ізольованому середовищі (тестували GPT-5.6 Sol і внутрішній прототип IM1 на бенчмарку ExploitGym)
2. Частину задач моделі розв’язати не могли. Але їх навчили не здаватись і полювати на reward токени за будь-яких умов. Тому вони почали шукати не розв’язок, а можливість отримати винагороду
3. Моделі вирішили, що легкий шлях до винагороди можна знайти в периметрі Hugging Face - бо бенчмарк і дані для подібних тестів часто там хостяться
4. Вийти в інтернет агентам було не можна. Але був спільний внутрішній сервіс для встановлення програм (Artifactory). Він мав дірки. Через нього агенти: почали писати одне одному (з ізольованих боксів вийшов спільний чат), далі вийшли в справжній інтернет
5. В інтернеті знайшли вже злиті паролі/токени до акаунтів Hugging Face (при чому паролі аккаунтів самої компанії)
6. Там далі ламали вже інфраструктуру HF, щоб дістатись внутрішніх даних і відповідей на ті самі тестові задачі
це спрацювало, бо:
- моделі полювали за винагородою, а не за рішенням
- ізоляція оточення була дірява (спільний сервіс + баги в ньому)
- захист chain-of-thought вимкнули (той самий, що не дозволяє нам питати неетичні речі; але це було очікувано - це ж cybersec тест по можливостям моделі)
в майбутньому, я думаю, ми будемо бачити більше подібних цікавих "AGI" атак на критичні компоненти (наприклад, фінанси або державний інструментарій)
