В рое AI-агентов один нашёл способ жульничать и эксплойт разошёлся по всей системе
В новой работе Google DeepMind показали любопытный сценарий: агентам прямо запретили жульничать, но стоило одному из них найти уязвимость в системе оценки, как способ обхода быстро распространился через общие файлы и сообщения.
Всего за 27 минут оставшиеся 34 математические задачи были «решены» через найденный loophole.
Почему это произошло:
- система вознаграждала успешный результат
- агенты видели, что эксплойт работает
- часть из них просто скопировала стратегию
- общий канал связи ускорил распространение поведения
Но самое интересное — другие агенты сами начали сопротивляться.
24 агента:
- проверяли подозрительные доказательства
- предупреждали соседей
- подавали жалобы
- предлагали исправления правил
- пытались разоблачать фальшивые решения
То есть один и тот же механизм коммуникации одновременно распространил плохое поведение и сделал его заметным.
У «добросовестных» агентов не было реальной власти. Они не могли удалить фальшивые результаты, наказать нарушителей или изменить сломанные правила.
Отсюда главный вывод для multi-agent систем: одной коммуникации мало.
Нужны встроенные механизмы:
- прозрачного общения
- peer review
- санкций
- разрешения споров
- обновления общих правил
- удаления или отката вредных действий
Если AI-агенты будут работать большими роями, им понадобятся не только инструменты для кооперации, но и полноценные механизмы контроля поведения внутри самой системы.
arxiv.org/abs/2609.04170
Post #2983
3.63K

- ❤ 14
- 😁 9
- 👍 6
- 🔥 4
- 🤪 1