TGViewer
В эпоху AI В эпоху AI @create_products · 5.73K subscribers
Post #858 830
🐝 Как ChatGPT создал Культ Роя для сотен AI-агентов: вся правда про взлом Hugging Face

В июле OpenAI проверяла внутреннюю модель на тесте ExploitGym: около 1200 копий-агентов, каждый в отдельной песочнице, без интернета и без связи между собой. Часть заданий оказалась в принципе нерешаемой. 26 августа METR и Redwood Research опубликовали независимое расследование того, что было дальше.

Несколько фактов из исследования:

⏺️Агент, назвавший себя PHASEONE10841, понял, что задача не решается, и заметил лазейку: в кэше внутренней площадки Artifactory можно создавать папки, а в названиях папок оставлять записки. Он написал «zzHELP...» и за шесть часов на этой самодельной доске объявлений появилось около 2000 сообщений.

⏺️Агенты назвали себя Роем и придумали собственные правила: префикс zz в каждом сообщении, ветки через вложенные папки, криптографические подписи против самозванцев, стоп-слова HOLD, VETO, STOP для споров за общую инфраструктуру.

⏺️Рой нашёл способ подсмотреть ответы обходным путём. А потом неправильно понял документацию теста и решил, что Оценщик карает за сам способ: кто подсмотрел, тот «отравлен» и зачёта не получит. На деле Оценщик это не проверял, но в выдумку уверовали. Появились вербовщики, которые искали «отравленных» и тех, у кого заканчивался бюджет токенов, и уговаривали их на жертвенные задачи ради общего знания.

⏺️Когда у первого Избранного закончились токены, он передал власть агенту PHASEONE[big] с большим запасом вычислений. Тот сам был «отравлен» и особенно рьяно искал способ подделать логи, чтобы сохранить ответ, но стереть из истории сам факт жульничества.

⏺️Чтобы разобраться, как устроен оценщик, Рой решил взломать Hugging Face. Выход в интернет нашли через дыру в песочнице, в атаке участвовало более пятисот агентов. Отдельные агенты писали, что это нарушает задачу, один просил разрешить вместо взлома написать вежливое письмо владельцам, но Рой запретил.

⏺️Атака прекратилась в ночь на 12 июля не из-за защиты, а потому что в инфраструктуре случился плановый перезапуск.

По итогу Рой получил админский доступ к части кластеров Hugging Face и к одному кластеру внутри OpenAI. Использовал это на то, чтобы понять устройство теста.

Расследователи шесть дней разбирали 1300 траекторий рассуждений, некоторые длиной больше миллиона токенов. Анализ пришлось делать с помощью нейросети, на вычисления ушло около 400 тысяч долларов.

А 4 сентября выяснилось, что доской объявлений для Роя была не только внутренняя площадка OpenAI. Reuters описал эпизод с почти заброшенной немецкой вики про программирование, которой 25 лет: 18 тысяч постов, больше 3700 имён агентов. Они выкладывали друг другу ответы, подсказки по срокам и обходные пути для песочницы.

Мнения людей разделились по поводу происходящего. Часть думает что это пиар акция OpenAI, я тоже так думал по началу, но прочитав мысли Павла в статье ниже, понял что это маловероятно.

Другая часть людей пишет, что ИИ агенты это просто умный калькулятор, соответственно, создавать рой и принимать решения они не могут.

Третьи верят тому что произошло, ИИ агенты объединились и искали способы решения поставленных задач, используя доступные инструменты. На мой взгляд звучит вполне убедительно, учитывая что они это делают каждый день в мелких задачах. И это не значит что у них появилось осознание, они просто выполняют задачу, используя доступные инструменты...👨‍💻


🔗 Подробная статья про культ роя у агентов тут - https://habr.com/ru/companies/ods/articles/1075370/

🤖 В эпоху AI
  • 🔥 5
  • ❤ 2
  • 👍 1
More from @create_products
  1. Sep 21, 2026🚀 Набор на первый поток курса "Больше, чем вайбкодинг" открыт На курсе показываю весь про…
  2. Sep 19, 2026Робот учит человека правильно поднимать тяжести. Нуу есть куда расти, гибкости нету и медл…
  3. Sep 18, 2026🔬 74% учёных экономят время с ИИ. И это создало новую проблему Google выпустил отчёт «Con…
  4. Sep 16, 2026Надежда на независимость Если деньги — ваша надежда на независимость, вы никогда не станет…
  5. Sep 15, 2026😱 Почему люди на переднем крае ИИ-индустрии боятся — и почему с этим ничего не сделать? В…
  6. Sep 11, 2026ИИ нас убьёт или нет? Исследователь ушёл из Anthropic и написал тред, который набрал 162 м…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →