TGViewer
Max Syabro and a Slop Driven Development Max Syabro and a Slop Driven Development @syabro_notes · 954 subscribers
Post #678 417
https://arxiv.org/abs/2512.08296

Google Research + MIT выкатили paper на 180 экспериментов, где методично разобрали, когда мультиагентные системы работают, а когда всё становится хуже.

ТЛДР: “More agents is all you need” — не работает.
Разброс от +80.9% до −70% в зависимости от задачи и архитектуры.

Три семейства моделей (OpenAI, Google, Anthropic), четыре бенчмарка, пять архитектур. Controlled evaluation — одинаковые промпты, тулы, бюджеты токенов. Меняется только координация.

Пять архитектур: Single-agent — одна модель, один цикл рассуждения. Independent — несколько агентов работают параллельно без общения, результаты склеиваются в конце. Decentralized — агенты общаются друг с другом напрямую, приходят к консенсусу через раунды дебатов. Centralized — есть оркестратор, который раздаёт подзадачи сабагентам и собирает результат. Hybrid — оркестратор + агенты ещё и между собой общаются.

Где мультиагенты тащат. Finance Agent — задачи с параллельной декомпозицией. Один агент копает SEC filings, другой — новости, третий — операционный анализ. Centralized MAS даёт +80.8% к single-agent. Задача сама напрашивается на разделение.

Где всё ломается. PlanCraft — последовательное планирование в Minecraft. Каждое действие зависит от предыдущего состояния. Любая мультиагентная архитектура деградирует: от −39% (Hybrid) до −70% (Independent). Координация жрёт токены, которые нужны на рассуждение. Агенты начинают делить задачу, которую делить нельзя — один «исследует рецепт», другой «проверяет инвентарь», третий крафтит. Три шага вместо одного, плюс overhead на общение между ними.

Scaling law дала три закономерности. Чем больше тулов у задачи, тем сильнее мультиагентный overhead бьёт по перформансу. В Workbench, где задачи используют по 16 тулов, эффективность Hybrid проседает в 6 раз относительно single-agent. Дальше — потолок отдачи. Если single-agent уже даёт выше ~45%, добавление агентов даёт отрицательный возврат. Координация стоит дороже, чем потенциальный прирост. И усиление ошибок зависит от топологии. Independent агенты усиливают ошибки в 17.2× — нет механизма коррекции, каждый варится в своём контексте. Centralized сдерживает до 4.4× за счёт оркестратора-валидатора.
Про деньги. Single-agent — 67.7 success/1K tokens. Centralized — 21.5. Hybrid — 13.6. Расход токенов в пять раз выше, а результат тот же или хуже.

Авторы вывели формулу, которая по количеству тулов, базовой точности и декомпозируемости задачи предсказывает оптимальную архитектуру с точностью 87% на новых конфигурациях. Валидировали на GPT-5.2, который вышел после исследования — четыре из пяти принципов подтвердились.

Если задача последовательная и single-agent уже даёт >45% — мультиагенты скорее всего сделают хуже. Если параллелизуема и baseline низкий — Centralized или Decentralized дадут прирост. Decentralized лучше для exploration (web navigation: +9.2%), Centralized — для structured reasoning (finance: +80.8%).

Ещё интересное: в decentralized архитектурах команды из слабых и сильных моделей работают на уровне или лучше однородных из сильных. У Anthropic в centralized архитектуре слабый оркестратор + сильные сабагенты даёт +31% относительно полностью сильной команды.
arXiv.org Towards a Science of Scaling Agent Systems Agents, language model-based systems capable of reasoning, planning, and acting are widely adopted in real-world tasks, yet how their performance changes as these systems scale across key...
  • 👍 8
More from @syabro_notes
  1. Sep 25, 2026TLDR AX (Agent eXecutor) - оркестратор песочниц для агентов на базе Kubernetes. Для тех кт…
  2. Sep 25, 2026tldr В Codex добавили общую доску сообщений для сабагентов. 21 сентября смерджили PR #4701…
  3. Sep 22, 2026photo post
  4. Sep 17, 2026типичный AGENTS.md
  5. Sep 17, 2026Если вам говорят что SWE2 заебись - не верьте. Тупое убожество. Сделало 2 разных вариант д…
  6. Sep 14, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →