https://arxiv.org/abs/2512.08296Google Research + MIT выкатили paper на 180 экспериментов, где методично разобрали, когда мультиагентные системы работают, а когда всё становится хуже.
ТЛДР: “More agents is all you need” — не работает.
Разброс от +80.9% до −70% в зависимости от задачи и архитектуры.
Три семейства моделей (OpenAI, Google, Anthropic), четыре бенчмарка, пять архитектур. Controlled evaluation — одинаковые промпты, тулы, бюджеты токенов. Меняется только координация.
Пять архитектур:
Single-agent — одна модель, один цикл рассуждения.
Independent — несколько агентов работают параллельно без общения, результаты склеиваются в конце.
Decentralized — агенты общаются друг с другом напрямую, приходят к консенсусу через раунды дебатов.
Centralized — есть оркестратор, который раздаёт подзадачи сабагентам и собирает результат.
Hybrid — оркестратор + агенты ещё и между собой общаются.
Где мультиагенты тащат. Finance Agent — задачи с параллельной декомпозицией. Один агент копает SEC filings, другой — новости, третий — операционный анализ. Centralized MAS даёт +80.8% к single-agent. Задача сама напрашивается на разделение.
Где всё ломается. PlanCraft — последовательное планирование в Minecraft. Каждое действие зависит от предыдущего состояния. Любая мультиагентная архитектура деградирует: от −39% (Hybrid) до −70% (Independent). Координация жрёт токены, которые нужны на рассуждение. Агенты начинают делить задачу, которую делить нельзя — один «исследует рецепт», другой «проверяет инвентарь», третий крафтит. Три шага вместо одного, плюс overhead на общение между ними.
Scaling law дала три закономерности. Чем больше тулов у задачи, тем сильнее мультиагентный overhead бьёт по перформансу. В Workbench, где задачи используют по 16 тулов, эффективность Hybrid проседает в 6 раз относительно single-agent. Дальше — потолок отдачи. Если single-agent уже даёт выше ~45%, добавление агентов даёт отрицательный возврат. Координация стоит дороже, чем потенциальный прирост. И усиление ошибок зависит от топологии. Independent агенты усиливают ошибки в 17.2× — нет механизма коррекции, каждый варится в своём контексте. Centralized сдерживает до 4.4× за счёт оркестратора-валидатора.
Про деньги. Single-agent — 67.7 success/1K tokens. Centralized — 21.5. Hybrid — 13.6. Расход токенов в пять раз выше, а результат тот же или хуже.
Авторы вывели формулу, которая по количеству тулов, базовой точности и декомпозируемости задачи предсказывает оптимальную архитектуру с точностью 87% на новых конфигурациях. Валидировали на GPT-5.2, который вышел после исследования — четыре из пяти принципов подтвердились.
Если задача последовательная и single-agent уже даёт >45% — мультиагенты скорее всего сделают хуже. Если параллелизуема и baseline низкий — Centralized или Decentralized дадут прирост. Decentralized лучше для exploration (web navigation: +9.2%), Centralized — для structured reasoning (finance: +80.8%).
Ещё интересное: в decentralized архитектурах команды из слабых и сильных моделей работают на уровне или лучше однородных из сильных. У Anthropic в centralized архитектуре слабый оркестратор + сильные сабагенты даёт +31% относительно полностью сильной команды.