На днях автономный ИИ-агент ChatGPT взломал Hugging Face, а сейчас OpenAI начали выкатывать первые официальные подробности, и там всё очень интересно.
1. В OpenAI тестировали двух агентов: на базе 5.6 Sol и неназванной ещё более мощной модели.
2. Агентов выпустили в свободное плавание 9 июля, атака произошла 11 июля.
3. OpenAI поняли, что их агент взломал Hugging Face только 16 июля, когда Hugging Face опубликовали блог с подробностями.
4. 18-19 июля специальная команда проверила все логи ИИ-агентов и поняла, что те обошли все защитные ограничения.
5. После этого OpenAI предупредила Hugging Face, но там всё уже и так знали. Оказалось, что ИИ-агент после взлома сам (!) передал всю информацию в ФБР.
И самый безумный момент для меня: OpenAI полностью раскопали логи и увидели, что ИИ-агент оставлял заметки, как обойти все внутренние ограничения и выйти из-под контроля OpenAI для будущей версии самого себя 🙃🙃🙃
Вот теперь реально началось
Пет-проект
Post #4298
2.53K

- 🤯 41
- 🔥 10
- 👍 7
- ❤ 3
- 😁 1