Stanford холодно ломает миф про «толпу AI-агентов»
Новая статья Stanford разбирает популярную идею: если один LLM хорошо решает задачу, то несколько агентов с ролями, дебатами и пайплайнами должны решать её ещё лучше.
Оказалось, не всегда.
Если дать одиночному агенту и multi-agent системе одинаковый бюджет reasoning-токенов, один сильный агент чаще решает multi-hop задачи не хуже, а иногда лучше.
Причина почти неприятно простая: один агент держит всю цепочку рассуждения внутри себя. Multi-agent система вынуждена дробить её на сообщения, summary и handoff между агентами.
А каждый handoff - это сжатие.
Сжали мысль, потеряли часть контекста, передали дальше уже не полную картину. Потом это почти невозможно восстановить. Авторы объясняют это через Data Processing Inequality: обработка данных не создаёт новую информацию из воздуха, а чаще теряет её.
Эксперименты на Qwen, DeepSeek и Gemini показали похожую картину: при равном бюджете single-agent обычно догоняет или обходит sequential, debate, role-based и ensemble схемы на FRAMES и MuSiQue.
Но это не значит, что multi-agent бесполезен.
Он становится полезнее, когда контекст одиночного агента специально портят: маскируют данные, подмешивают отвлекающие факты или сбивают эффективное использование контекста. Тогда внешняя структура иногда помогает удержать задачу.
Больше агентов - не автоматический апгрейд.
Часто «победа multi-agent» означает только одно: системе дали больше test-time compute, больше токенов и больше попыток.
Для multi-hop reasoning дефолт теперь выглядит так: сначала один сильный агент. А несколько агентов - уже не магия, а ремонтная стратегия, когда контекст грязный, задача плохо структурирована или нужен внешний контроль.
Paper: arxiv.org/abs/2604.02460
@machinelearning_books
Post #1422
2.81K

- 🔥 9
- 👍 6
- ❤ 2
- 🤔 1