😒 Мультиагентная система может выполнить задачу неправильно
Исследователи из Нанкинского университета, Tsinghua и AgiBot выпустили CoCoBench — 897 исполняемых сценариев для проверки координации нескольких AI-агентов.
Бенчмарк отдельно измеряет четыре навыка:
🔘 распределение работы;
🔘 соблюдение порядка действий;
🔘 доступ к общему ресурсу без конфликтов;
🔘 передачу результата между агентами.
Оказалось, обычный success rate может сильно приукрашивать результат. Например, Qwen3.6-Plus завершила 69,1% заданий, но только 56,7% траекторий были допустимыми. Агентам иногда удавалось достичь цели через нарушение порядка действий или конфликт за общий инструмент.
Ещё один результат: централизованный планировщик показал 48% успешных запусков, агенты с общей связью — 39,6%, а полностью раздельные — 36,7%. Одного канала сообщений оказалось недостаточно для замены общего состояния.
Для тебя вывод простой: проверяй не только итог мультиагентного процесса. Сохраняй траекторию и отдельно считай дублирование работы, нарушения зависимостей, конфликты ресурсов и корректность передачи между агентами.
Пока это симуляция бытовых задач, но те же ошибки возникают у программных агентов при работе с тикетами, файлами, блокировками и конвейерами.
Ссылки:
🔘
исследование от 28 августа 2026 года
🔘
код и набор из 897 сценариев
🔘
Хабр#multiagent #aiagents #agentengineering #aievals #coordination #robotics
@data_engi