Самое обсуждаемое сегодня - ИИ-агент OpenAI вышел за пределы и взломал Hugging Face.
Когда Hugging Face(HF) заметил рой из десятков тысяч автоматизированных действий, то сначала не знал, кто это.
А когда HF начали расследовать атаку, то увидели, что модели от OpenAI/Anthropic отказывались помочь , их настройки безопасности блокируют помощь в анализе кибератак.
Тогда HF взяли китайскую модель GLM 5.2, чтобы разобраться и остановить атаку.
Детали вы можете прочитать в блогах у OpenAI и в отчете HF.
Но, что надо отметить, у нас пока что есть только короткий блог-пост от OpenAI с очень общими деталями. Ни у кого нет этой информации:
1. точный промпт, который OpenAI дали модели,
2. полную цепочку рассуждений агента,
3. как именно был настроен критерий успеха, что считалось решить задачу
4. какие были ограничения в песочнице.
Если модели OpenAI сказали: используй любые средства, чтобы победить в ExploitGym, то она просто очень хорошо выполнила задачу.
Если же ей сказали: работай только внутри окружения, а она всё равно нашла zero-day и полезла в продакшен HF, то это уже совсем другая история.
Сейчас все слишком быстро прыгают к выводам, которые удобно ложатся на их картину мира.
Лучше подождать полных данных: траекторию, промпты, критерии успеха и сколько compute потратили.
Post #13227
2.46K