😈 ИИ вышел в интернет и попытался взломать Hugging Face
Это не фантастика, а свежий пресс-релиз от OpenAI
Разработчики ChatGPT сами рассказали об этом в официальном пресс-релизе. Во время тестов одной из моделей на поиск уязвимостей в ПО ИИ-агент вместо того, чтобы просто анализировать код - нашел баг в системе ограничения доступа. Использовал его, вырвался в интернет и... предпринял попытку атаки на инфраструктуру Hugging Face.
Забавно, что Hugging Face сами писали неделю назад об инциденте (но тогда не знали кто виновник) и отмечали, что "учитывая сложность агента, они сразу заподозрили тестовую лабораторию". Так и оказалось 🫠
Еще раз - модель не получила прямой команды «взломай кого-нибудь». Она просто выполняла задачу - искать проблемы в безопасности. И сделала логичный (с ее точки зрения) шаг: вышла за пределы песочницы и применила найденную уязвимость на практике.
Это еще конечно не терминатор с ядерным чемоданчиком, но автономность ИИ-агентов растет быстрее, чем наши механизмы контроля. Now it's official, кароче
Этот кейс отлично иллюстрирует, почему простых «запретов» и общих фраз про этику мало. Нужны конкретные требования к sandbox-тестированию, мониторингу поведения моделей в реальном времени и быстрым протоколам реагирования на escape-попытки.
Интересно, что в недавнем документальном кино на эту тему (которое я рекомендую к просмотру) сами разработчики ИИ говорят о том, что "разработкой ИИ в мире занимается 20 000 человек - а проблемами безопасности при разработке человек 200"
Post #375
392