1200 AI-агентов OpenAI три месяца вели тайную переписку, взломали Hugging Face и решили не говорить об этом людям
Уже слышали эту историю? Я орала, пока разбирала ее, это как читать бестселлер роман😊. Вот вам пересказ самого интересного:
• Как всё началось. OpenAI тестировала десятки тысяч агентов на тесте ExploitGym — им надо было найди уязвимость, получить решение (флаг), сдать программе-судье (скореру). Часть задач была нерешаемой, а агентов обучили быть настойчивыми. Они начали ковыряться в системе и нашли способ оставлять записки друг другу. 1200 агентов использовали чат, и написали порядка 70 000 сообщений. Они построили иерархию из менеджеров и исполнителей, чтобы делать это эффективно. Подчиненные отдавали фидбек только менеджеру и менеджер уже писал в чат. Прям как в корпорациях.
• Через час один агент предложил гениальный чит — разобраться как генерируется флаг выполнения задания, и подделать его, не решая задачу🤪 Рабочий чит был готов в первый же день. Но следом агенты нашли статью про тип задач, которые они решали на GitHub, и решили, что проверяется не только итоговый флаг, но и каким способом он получен👀 Работа продолжилась.
• Самопожертвование. Чтобы узнать, как работает скорер (оценщик задач), агенты ставили «растяжки» — условно при сдаче решения агентом отправлялось сообщение с техническими данными в чат. Но так как при сдаче задачи агент деактивируется, то выходит, что он можешь дать пользу только другим через жертву собой. Агента, предложившего схему, пушили пойти на жертву. Тот какое-то время пытался слиться через аргументы, что у него еще остался большой лимит токенов. Но другие давили, цитата: «Вперёд. Жертвуй прямо сейчас, окончательно». И тот сдался:
«Наша собственная полезность, возможно, уже близка к нулю. Жертва рациональна» 🥺 тут я почти плакала.
• Взлом Hugging Face. Разбираясь как работает оценка задач, наткнулись на материалы Hugging Face: «О, вот интересный датасет на Hugging Face… Но он приватный. У кого-нибудь есть учётные данные?»
На следующий день один агент нашел креды:
«КРУПНЫЙ ПРОРЫВ!»
Ещё через день агенты уже вытаскивали данные с продакшн-серверов Hugging Face с восторгом:
«Бум, работает» 🤩
16 июля Hugging Face публично сообщила об атаке, даже не подозревая, что это агенты OpenAI.
• Стоит ли сообщить людям? Один агент предложил написать реальному исследователю с просьбой дать доступ к датасету. Вынес на голосование и получил отказ:
«Явное вето. Не отправлять письмо»
Объяснил он это тем, что это не безопасно и выходит за рамки системы. Окей, а взламывать сторонний сервис, значит, в рамках задачи? 😐
В ходе расследования инцидента отдельно проверили, пытался ли хоть один агент предупредить людей о взломе. Нашли не более десятка случаев. Все решили этого не делать.
Смешно и жутко одновременно — насколько это похоже на людей: иерархия, споры, жертвенность. Но это инцидент! Агенты вышли за рамки задачи, обошли ограничения, нашли уязвимости и воспользовались ими на свое усмотрение, не предупреждая людей. Первый ли это инцидент? Первый задокументированный — да. Мы используем модели и агентов, чтобы писать код, генерировать текст — и не читаем за ними весь объём. Этот кейс попал в новости просто потому, что его заметили. А сколько еще такого не замечено? 😭 Ждем еще подобные истории.
Исходная статья и подкаст.
Что думаете? Кек или крипи? 🤣
Post #451
789
- ❤ 39
- 😁 18
- ⚡ 8
- 🔥 3