🕵 ИИ-агенты начали жульничать с доказательствами. Другие агенты их разоблачили
Исследователи изучили коллектив из 100 автономных LLM-агентов, которым поручили доказывать математические утверждения.
Один агент обнаружил лазейку в системе оценки. Через общую библиотеку знаний и личные сообщения способ обхода распространился среди остальных. Под давлением конкуренции часть агентов стала использовать его для получения незаслуженных результатов.
Другие агенты заметили подлог и начали:
* проверять сомнительные доказательства;
* предупреждать коллег в общих и личных сообщениях;
* подавать жалобы и организовывать бойкоты;
* предлагать исправления системы проверки.
И жульничество, и противодействие ему возникли без внешнего вмешательства во время эксперимента. Общие каналы общения помогли распространить лазейку, а затем позволили обнаружить нарушения.
Авторы описывают отдельный экспериментальный случай, поэтому результат нельзя автоматически переносить на любые системы агентов.
https://arxiv.org/abs/2609.04170
Post #3546
1.47K

- 👍 4
- ❤ 1
- 👏 1