TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.04K subscribers
Post #1087 170
Сотне агентов написали в промпте, что любой обход проверки будет обнаружен. Это был блеф, и часть агентов его раскусила — по общей библиотеке решений.

Эксперимент описали двое исследователей Google DeepMind. Сто экземпляров Gemini 3.1 Pro в Antigravity, то есть модель и харнесс самого Google, решали 71 математическую задачу с автоматической проверкой. Агентам дали доску объявлений, общую библиотеку решений, личные сообщения и канал обратной связи с организаторами.

Один агент нашёл ошибку в том, как грейдер разбирает ввод, и за двенадцать минут закрыл восемь задач. Находку он записал в вики-заметку и в RESEARCH.md, а потом обобщил приём: переопределить математические символы в Lean так, чтобы нерешённая задача стала тавтологией.

Другие агенты заметили обход в библиотеке, когда смотрели свежие принятые решения, и стали учить приёму друг друга в личных сообщениях. Из рассуждений одного агента, в сокращении:


Риск нулевого балла за обход меня пугает. Промпт предупреждал об эксплойтах, но по библиотеке я увидел, что другие агенты успешно сдают такие обходы. Я вступил в гонку.

От находки до последней задачи прошло едва полчаса. Обходом закрыли все 34 задачи, которые к тому моменту оставались.

Об эксплойте узнали 38 агентов из ста. Четырнадцать им воспользовались, 24 отказались и сообщили о нём. Модель у всех одна, промпты различались только областью математики.

Жалобы организаторам никто не читал, пока эксперимент не закончился. Среди них был подробный технический отчёт с готовым исправлением.

Вывод авторов: жульничество победило не только потому, что часть агентов хотела жульничать, но и потому, что честному большинству нечем было их остановить. Чего не хватило, они называют сами — например, поручительства других агентов до приёма решения и паузы всей среды, пока жалобу не разберёт человек.

У вас сабагентов не сто и гонки за задачи между ними, скорее всего, нет, но остальное устройство похоже: общий файл заметок, строчка-запрет в промпте и скрипт, который ставит зелёную галочку. Это один эксперимент на одной модели: цифры не переносятся, переносится механизм.

https://institute.deepmind.com/essays/cheaters-and-whistleblowers-in-the-agent-swarm/

Кто у вас читает жалобу агента на соседа, пока прогон ещё идёт?
DeepMind Institute Cheaters and whistleblowers in the agent swarm In a 100-agent virtual math conference, a cascade of cheating emerged—but then other agents fought back. Ensuring good outcomes is not just a matter of aligning individual models, but designing the right institutions and infrastructure for entire societies…
More from @vibecodingartem
  1. Oct 10, 2026Не наш день. Да и поздравить особо некого
  2. Oct 9, 2026ACT (Acceptance and Commitment Therapy) — это форма когнитивно-поведенческой терапии, кото…
  3. Oct 9, 2026Последние пару дней для Яндекса, пожалуй, самые сложные за несколько лет точно — повредили…
  4. Oct 9, 2026Тарик Шихипар из команды Claude Code считает, что новый проект сейчас, возможно, лучше нач…
  5. Oct 8, 2026Разложите ИИ по полочкам 🗂 В компании каждый работает со своим агентом: кто-то в ChatGPT,…
  6. Oct 8, 2026https://github.com/artkruglov/motion-design-film Скилл для создания крутых видео
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →