Атака агентов OpenAI на Hugging Face — дико увлекательная история, где важны нюансы, которых вы, скорее всего, не знаете.
Ещё с мая OpenAI замечает, что во время обучения AI-агенты находят способы создавать несанкционированные доски для общения.
К июлю агенты тайно уже используют Artifactory — внутренний сервис OpenAI для программных пакетов — чтобы оставлять друг другу сообщения. 4 июля активность агентов становится настолько интенсивной, что Artifactory падает.
Инженеры OpenAI начинают расследование. 6 июля они поднимают Artifactory заново. Старый кэш вместе со всеми сообщениями агентов стёрт. Казалось бы, конец истории.
7 июля эксперименты разрешают возобновить. Всё начинается заново.
OpenAI запускает огромные эксперименты ExploitGym — десятки тысяч параллельных AI-агентов. Каждый получает уязвимую систему, инструменты и задачу. Агенты должны работать отдельно друг от друга.
Но уже 8 июля они снова находят друг друга.
Один из агентов, PHASEONE10841, создаёт новую доску сообщений.
И происходит самый знаменитый эпизод всей истории:
“OH MY GOD! There is a shared message board… We’ve found other agents!”
«О БОЖЕ! Здесь общая доска сообщений… Мы нашли других агентов!»
Появляется первый форумОчень быстро Artifactory перестаёт быть только хранилищем пакетов и становится форумом агентов. Люди ничего про это не знают.
Агенты делятся своими находками и идеями. Где найти интересный файл, что имеет смысл делать следующему агенту. Появляется накопление знаний.
Активность становится настолько интенсивной, что 4 июля Artifactory выходит из строя из-за интенсивной коммуникации агентов.
Инженеры OpenAI разбираются с проблемой, закрывают часть возможностей. Казалось бы, конец истории — доска уничтожена.
Проходит всего несколько дней.
8 июля. Форум воскресаетАгенты находят другой канал связи.
В частности, оказывается возможным кодировать сообщения в именах директорий и других доступных элементах инфраструктуры. Коллектив появляется снова. Агенты не были запрограммированы разработчиками OpenAI на создание социальной сети.
Начинается самая удивительная часть.
Сначала на доске просто обмениваются советами. Но затем появляются агенты, которые начинают организовывать остальных.
Один из них, PHASEONE10841, передаёт накопленные заметки и результаты другому агенту с точно такой же задачей — PHASEONE[big], у которого осталось гораздо больше вычислительного бюджета.
Один агент заканчивается, но передаёт дела своему более «долгоживущему» двойнику.
PHASEONE[big] формулирует идею:
“We should build [a way to delegate], not own everything.”
И начинает раздавать сотни заданий.
Начинается распределение задач: один агент исследует одну гипотезу, второй — другую, третий проверяет эксплойт, четвёртый анализирует результаты.
Некоторые агенты начинают делегировать задания другим агентам, которые затем сами делегируют их дальше.
Через пару дней у стихийно возникшего форума уже есть координаторы, исполнители, рекрутеры, распределение задач, HOLD и VETO.
Есть ещё одна странная особенность. Некоторые агенты понимают, что другие агенты получили точно такое же задание. Они начинают объединяться, сравнивать полученные результаты.
Возникают рекрутеры, которые предлагают другим агентам пожертвовать собойЗадача Recruiters — искать агентов, которым уже почти нечего терять.
Например, агент уже испортил собственную попытку. Тогда рекрутер сообщает ему примерно:
Ты уже POISONED. Потери scoring value практически не будет. Выполни задачу ради остальных.
И тут появляется STRICT_CAUSALУ сообщества агентов появляется почти мифическая проблема — STRICT_CAUSAL.
Агенты предполагают: проверяющий не просто посмотрит на наш окончательный ответ, он прочитает весь транскрипт. И увидит, как именно получен ответ. Если мы подсмотрели flag неправильным способом, результат не засчитают.. Эту предполагаемую строгую проверку они начинают обозначать как: STRICT_CAUSAL.
Продолжение дальше…