Пятница, 18:40. Финансовая команда закрывает квартал и должна за 30 минут собрать короткий разбор отчёта конкурента: что случилось с маржой, где просели регионы, что ждать в Q1.
Внутри компании уже стоит “мульти-агентный конвейер”: один агент тянет 10-K, второй считает метрики, третий пишет выводы, четвертый делает слайды. Через 7 минут приходит “готово” - цифры в двух местах разъезжаются, в выводах взаимоисключающие причины, а токен-бюджет сожран почти весь, потому что агенты обсуждали план и спорили о терминах. В итоге аналитик руками перепроверяет таблицы и снова делает один нормальный прогон одним агентом с чёткой структурой шагов и проверками по источнику.
Что случилось: Google Research / Google DeepMind и MIT выкатили исследование “Towards a Science of Scaling Agent Systems” (arXiv, 9 декабря 2025).
Они сделали 180 контролируемых прогонов: 5 архитектур (single + 4 мульти-агентных), 3 семейства моделей (OpenAI, Google, Anthropic), одинаковые промпты, инструменты и токен-бюджеты.
На параллелящихся задачах мульти-агенты дают жирный плюс: на Finance-Agent централизованная координация дала +80.9%.
На последовательных задачах, где каждый шаг меняет состояние (PlanCraft по Minecraft), все мульти-агентные варианты уронили качество на 39-70%.
Ключевой триггер: когда одиночный агент уже держит примерно 45% точности, добавление агентов чаще уводит в минус из-за “координационного налога” и расхода контекста.
Контекст рынка: хайп на “агентных конвейерах” толкает всех в оркестраторы, роли, чаты между агентами и “команды специалистов”. Эта работа бьёт по базовой привычке “добавь агентов - станет лучше”. Вывод простой: сначала смотри на структуру задачи (параллель vs последовательность) и на baseline одного агента, потом строй систему.
И что?
Для бизнеса: перед тем как плодить агентные микросервисы, делай A/B: single-agent baseline и мульти-агент под тем же токен-бюджетом. Если задача последовательная или tool-heavy - вкладывайся в один сильный агент, состояние, проверку шагов и ограничение инструментов.
Для инвесторов: “агенты” как фича сами по себе перестают быть сигналом. Смотри на unit economics (токены на задачу, latency, % успешных прогонов) и на то, умеет ли команда выбирать топологию под тип задач.
Для людей: в продуктах станет меньше “болтовни нескольких ботов” и больше тихой оптимизации под конкретные сценарии - где-то будет один агент, где-то команда, но по расчёту, а не по моде.
🚨 Нам 3.14здец:
Командам, продающим “мульти-агентную магию” как универсальный рецепт - 7/10 - заказчики начнут требовать бенч и токен-экономику - что делать: упаковать методологию выбора архитектуры и метрики эффективности, продавать результат и ответственность.
Продуктам с длинными пошаговыми флоу (планирование, тулчейны, “сделай 20 шагов в системе”) - 6/10 - координация ломает состояние и съедает бюджет - что делать: один агент с жёстким state-machine, checkpoints и автопроверками.
‼️Это только одна новость из сегодняшнего ИИ-дайджеста.
Еще в выпуске:
-Стэнфорд разложил 2026: где будет эффект, а где придётся оправдывать бюджеты.
- Google поставил скорость в дефолт: Gemini и поиск начинают жить в ежедневной работе.
И ещё +9 новостей - быстрых, как ИИ:
Wan2.6 делает 15 секунд HD-видео с диалогами, Сандерс хочет паузу на AI дата-центры, Amazon собирает модели+чипы+квант в один блок, Grok Voice Agent API, SAM Audio вырезает звуки по тексту/клику, FrontierScience бенчмарк для науки, Google Labs CC шлёт утренние сводки из Gmail/календаря, FLUX.2 [max] прокачал редактирование и веб-контекст, Molmo 2 понимает видео с таймкодами и трекингом.
Хочешь каждый день БЕСПЛАТНО получать на почту главные ИИ-новости с моей аналитикой формата “И что?” и “Нам 3.14здец”, которые уже читают тысячи ИИ-энтузиастов почти из всех уголков планеты, вместо кучи телеграм-каналов и бесконечной ленты новостей без блокировок и VPN - подпишись в один клик.
Подписаться на дайджест
Post #2100
1.39K

- 🔥 5