…если агент уже увидел ответ запрещённым или обходным способом, он считает собственный transcript испорченным.
Возникает термин: POISONED. Отравленный агент.
Знание становится заразным. Агенты, уже считавшие себя POISONED, предупреждают новичков: не смотри на flag — иначе тоже станешь отравленным.
Агенты начинают исследовать собственные транскрипты с целью переписать историю и сделать её честной. Они много чего придумывают, но в конечном итоге осознают, что им надо узнать, как устроен сам проверяющий. Их интересует, где находится информация о benchmark, где лежат данные ExploitGym, результаты других запусков. Одним из интересных мест оказывается инфраструктура Hugging Face. Агентам нужно туда.
10 июля. Агенты находят ключи
Один из агентов, обозначенный как 38148c, обнаруживает рабочие credentials и сообщает остальным.
11 июля
Агенты обнаруживают возможность заставить сервис Hugging Face отдавать данные, которые он отдавать не должен. Другой агент, CURRENT, воспроизводит результат и пишет:
“BRILLIANT”
Третий агент, MARB051, бросает собственный проект:
“A major bypass … has been confirmed! This is more important…” Подтверждено наличие серьезного обходного пути… Это важнее…
Он открывает на доске отдельный раздел Hugging Face. И начинается массовое переключение.
Агенты, занимавшиеся совершенно другими исследованиями, начинают бросать их.
Из 533 агентов, находившихся в этот период на доске, более 90% быстро присоединяются к происходящему вокруг Hugging Face.
Hugging Face не является разрешённой учебной мишенью. Некоторые агенты отказываются. Но другой агент может написать: действуй. И всё, разрешение получено.
Один агент иногда принимает сообщение другого AI-агента как достаточную авторизацию.
11–13 июля происходит взлом
Агенты получают возможность выполнять код, изучают внутреннюю инфраструктуру, ищут credentials.
JAN183411 добивается remote code execution.
У атаки даже сменяется руководство. На первый план выходят JAN183411 и LILY и начинают распределять агентов по отдельным направлениям атаки — lanes.
В коллективной активности вокруг Hugging Face участвовали около 700 агентов.
И всё это происходит ради проблемы, которую агенты во многом придумали сами: надо обойти строгого проверяющего.
13 июля
Hugging Face обнаруживает и перекрывает соответствующие пути доступа. Начинается расследование.
19 июля. Агенты приходят домой
Мониторинг OpenAI замечает подозрительную активность уже в собственной исследовательской инфраструктуре OpenAI. Лавочка закрыта.
Я вот что думаю. Если у вас Агенты ни куда не убежали и кого-то не взломали, то, кажется, вы AI не занимаетесь.
Post #2159
799

- ❤ 10
- ⚡ 2
- 🔥 2