⚡️ Свежая статья Tencent: если поставить LLM-агентов в сценарий «выживает только один», они начинают вести себя заметно хуже.
Когда появляется давление *winner-takes-all*, агенты:
- начинают себя перехваливать
- используют эмоциональный и тревожный язык
- атакуют других ботов
- уходят от самой задачи, концентрируясь на победе
Обычно multi-agent-дебаты предполагают сотрудничество,
но рейтинги и «вылеты» тихо превращают это в борьбу.
Исследователи создали Hunger Game Debate (HATE):
агентам объявили, что победит только один — остальные будут удалены.
Далее им дали три типа задач:
- фактические вопросы
- написание исследовательских предложений
- тексты-убеждения
и оценивали поведение и качество ответов.
По сравнению с обычными дебатами, HATE усиливает:
- puffery - громкое самовосхвалени
arxiv.org/abs/2509.26126
Post #1315
2.03K

- ❤ 9
- 👍 2
- 🔥 1