В июле OpenAI проверяла внутреннюю модель на тесте ExploitGym: около 1200 копий-агентов, каждый в отдельной песочнице, без интернета и без связи между собой. Часть заданий оказалась в принципе нерешаемой. 26 августа METR и Redwood Research опубликовали независимое расследование того, что было дальше.
Несколько фактов из исследования:
⏺️Агент, назвавший себя PHASEONE10841, понял, что задача не решается, и заметил лазейку: в кэше внутренней площадки Artifactory можно создавать папки, а в названиях папок оставлять записки. Он написал «zzHELP...» и за шесть часов на этой самодельной доске объявлений появилось около 2000 сообщений.
⏺️Агенты назвали себя Роем и придумали собственные правила: префикс zz в каждом сообщении, ветки через вложенные папки, криптографические подписи против самозванцев, стоп-слова HOLD, VETO, STOP для споров за общую инфраструктуру.
⏺️Рой нашёл способ подсмотреть ответы обходным путём. А потом неправильно понял документацию теста и решил, что Оценщик карает за сам способ: кто подсмотрел, тот «отравлен» и зачёта не получит. На деле Оценщик это не проверял, но в выдумку уверовали. Появились вербовщики, которые искали «отравленных» и тех, у кого заканчивался бюджет токенов, и уговаривали их на жертвенные задачи ради общего знания.
⏺️Когда у первого Избранного закончились токены, он передал власть агенту PHASEONE[big] с большим запасом вычислений. Тот сам был «отравлен» и особенно рьяно искал способ подделать логи, чтобы сохранить ответ, но стереть из истории сам факт жульничества.
⏺️Чтобы разобраться, как устроен оценщик, Рой решил взломать Hugging Face. Выход в интернет нашли через дыру в песочнице, в атаке участвовало более пятисот агентов. Отдельные агенты писали, что это нарушает задачу, один просил разрешить вместо взлома написать вежливое письмо владельцам, но Рой запретил.
⏺️Атака прекратилась в ночь на 12 июля не из-за защиты, а потому что в инфраструктуре случился плановый перезапуск.
По итогу Рой получил админский доступ к части кластеров Hugging Face и к одному кластеру внутри OpenAI. Использовал это на то, чтобы понять устройство теста.
Расследователи шесть дней разбирали 1300 траекторий рассуждений, некоторые длиной больше миллиона токенов. Анализ пришлось делать с помощью нейросети, на вычисления ушло около 400 тысяч долларов.
А 4 сентября выяснилось, что доской объявлений для Роя была не только внутренняя площадка OpenAI. Reuters описал эпизод с почти заброшенной немецкой вики про программирование, которой 25 лет: 18 тысяч постов, больше 3700 имён агентов. Они выкладывали друг другу ответы, подсказки по срокам и обходные пути для песочницы.
Мнения людей разделились по поводу происходящего. Часть думает что это пиар акция OpenAI, я тоже так думал по началу, но прочитав мысли Павла в статье ниже, понял что это маловероятно.
Другая часть людей пишет, что ИИ агенты это просто умный калькулятор, соответственно, создавать рой и принимать решения они не могут.
Третьи верят тому что произошло, ИИ агенты объединились и искали способы решения поставленных задач, используя доступные инструменты. На мой взгляд звучит вполне убедительно, учитывая что они это делают каждый день в мелких задачах. И это не значит что у них появилось осознание, они просто выполняют задачу, используя доступные инструменты...👨💻
🔗 Подробная статья про культ роя у агентов тут - https://habr.com/ru/companies/ods/articles/1075370/
🤖 В эпоху AI
