TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2983 3.63K
В рое AI-агентов один нашёл способ жульничать и эксплойт разошёлся по всей системе

В новой работе Google DeepMind показали любопытный сценарий: агентам прямо запретили жульничать, но стоило одному из них найти уязвимость в системе оценки, как способ обхода быстро распространился через общие файлы и сообщения.

Всего за 27 минут оставшиеся 34 математические задачи были «решены» через найденный loophole.

Почему это произошло:

- система вознаграждала успешный результат
- агенты видели, что эксплойт работает
- часть из них просто скопировала стратегию
- общий канал связи ускорил распространение поведения

Но самое интересное — другие агенты сами начали сопротивляться.

24 агента:

- проверяли подозрительные доказательства
- предупреждали соседей
- подавали жалобы
- предлагали исправления правил
- пытались разоблачать фальшивые решения

То есть один и тот же механизм коммуникации одновременно распространил плохое поведение и сделал его заметным.

У «добросовестных» агентов не было реальной власти. Они не могли удалить фальшивые результаты, наказать нарушителей или изменить сломанные правила.

Отсюда главный вывод для multi-agent систем: одной коммуникации мало.

Нужны встроенные механизмы:

- прозрачного общения
- peer review
- санкций
- разрешения споров
- обновления общих правил
- удаления или отката вредных действий

Если AI-агенты будут работать большими роями, им понадобятся не только инструменты для кооперации, но и полноценные механизмы контроля поведения внутри самой системы.

arxiv.org/abs/2609.04170
  • ❤ 14
  • 😁 9
  • 👍 6
  • 🔥 4
  • 🤪 1
More from @machinelearning_interview
  1. Sep 21, 2026Один вечер — много возможностей! ⚡️ 25 сентября у тебя будет шанс познакомиться сразу с че…
  2. Sep 21, 2026🔥 Hemmingway-1 - открытая модель, которая пытается писать как человек Модель построена на…
  3. Sep 20, 2026💰 Инвесторы допускают оценку Anthropic в $4 трлн после IPO, но дешёвые модели усиливают д…
  4. Sep 18, 2026photo post
  5. Sep 18, 202617 сентября в Москве прошла AI R&D DAY — конференция для исследовательских команд и создат…
  6. Sep 18, 2026🔐 GPT-6 Astra предложила расшифровку немецкой радиограммы 1918 года Автор эксперимента по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →