Как ИИ-агент OpenAI сбежал и начал взламывать Hugging Face
Hugging Face опубликовали детальный отчет произошедшего, а если вы не в курсе, то начало истории тут.
Надо отметить, что полного финального технического отчёта от OpenAI ещё нет, они обещают его в ближайшие недели после завершения расследования, к которому присоединились METR/Redwood.
Но вот, что сейчас известно, исходя из отчета HF:
OpenAI внутри себя тестировала максимальные кибер способности своих моделей (GPT-5.6 Sol + ещё более мощный внутренний прототип модели).
OpenAI говорит, что специально отключила все обычные предохранители, которые запрещают модели заниматься хакерством.
Задача была одна: решать сложный бенчмарк ExploitGym.
ИИ-агент очень сильно захотел получить высокий балл и вместо того, чтобы честно решать задачи, решил просто украсть готовые ответы.
Как он это сделал читайте подробнее у HF.
Что в итоге пострадало?
1. Единственное, что агент реально украл у пользователей - готовые решения пяти тестовых датасетов ExploitGym.
2. Остальные модели, датасеты, Spaces и данные клиентов не были затронуты.
OpenAI позже сообщила, что агент попутно нашёл и использовал утёкшие пароли ещё на четырёх других публичных сервисах: один использовал как перевалочный пункт, а другой для хранения данных. Масштаб там был якобы гораздо меньше.
Что это значит в более широком смысле?
Защита от таких кибератак от агентов теперь должна учитывать их скорость и объём, а не только один умный эксплойт.
Самое важное, чего пока нет -
точных промптов, полной цепочки рассуждений модели и детального разбора «что именно она думала». Именно это должно появиться в отчётах METR/Redwood и финальном отчете OpenAI.
Post #13254
2.53K
Все о блокчейн/мозге/space/WEB 3.0 в России и мире Самое обсуждаемое сегодня - ИИ-агент OpenAI вышел за пределы и взломал Hugging Face. Когда Hugging Face(HF) заметил рой из десятков тысяч автоматизированных действий, то сначала не знал, кто это. А когда HF начали расследовать атаку, то увидели, что модели…
- ❤ 9
- 👍 4
- 🔥 4
- 🤔 1