TGViewer
Грин еще не робот 🤖 Грин еще не робот 🤖 @robotless · 5.14K subscribers
Post #2100 1.39K
Пятница, 18:40. Финансовая команда закрывает квартал и должна за 30 минут собрать короткий разбор отчёта конкурента: что случилось с маржой, где просели регионы, что ждать в Q1.

Внутри компании уже стоит “мульти-агентный конвейер”: один агент тянет 10-K, второй считает метрики, третий пишет выводы, четвертый делает слайды. Через 7 минут приходит “готово” - цифры в двух местах разъезжаются, в выводах взаимоисключающие причины, а токен-бюджет сожран почти весь, потому что агенты обсуждали план и спорили о терминах. В итоге аналитик руками перепроверяет таблицы и снова делает один нормальный прогон одним агентом с чёткой структурой шагов и проверками по источнику.

Что случилось: Google Research / Google DeepMind и MIT выкатили исследование “Towards a Science of Scaling Agent Systems” (arXiv, 9 декабря 2025).

Они сделали 180 контролируемых прогонов: 5 архитектур (single + 4 мульти-агентных), 3 семейства моделей (OpenAI, Google, Anthropic), одинаковые промпты, инструменты и токен-бюджеты.

На параллелящихся задачах мульти-агенты дают жирный плюс: на Finance-Agent централизованная координация дала +80.9%.

На последовательных задачах, где каждый шаг меняет состояние (PlanCraft по Minecraft), все мульти-агентные варианты уронили качество на 39-70%.

Ключевой триггер: когда одиночный агент уже держит примерно 45% точности, добавление агентов чаще уводит в минус из-за “координационного налога” и расхода контекста.

Контекст рынка: хайп на “агентных конвейерах” толкает всех в оркестраторы, роли, чаты между агентами и “команды специалистов”. Эта работа бьёт по базовой привычке “добавь агентов - станет лучше”. Вывод простой: сначала смотри на структуру задачи (параллель vs последовательность) и на baseline одного агента, потом строй систему.

И что?

Для бизнеса: перед тем как плодить агентные микросервисы, делай A/B: single-agent baseline и мульти-агент под тем же токен-бюджетом. Если задача последовательная или tool-heavy - вкладывайся в один сильный агент, состояние, проверку шагов и ограничение инструментов.

Для инвесторов: “агенты” как фича сами по себе перестают быть сигналом. Смотри на unit economics (токены на задачу, latency, % успешных прогонов) и на то, умеет ли команда выбирать топологию под тип задач.

Для людей: в продуктах станет меньше “болтовни нескольких ботов” и больше тихой оптимизации под конкретные сценарии - где-то будет один агент, где-то команда, но по расчёту, а не по моде.


🚨 Нам 3.14здец:

Командам, продающим “мульти-агентную магию” как универсальный рецепт - 7/10 - заказчики начнут требовать бенч и токен-экономику - что делать: упаковать методологию выбора архитектуры и метрики эффективности, продавать результат и ответственность.

Продуктам с длинными пошаговыми флоу (планирование, тулчейны, “сделай 20 шагов в системе”) - 6/10 - координация ломает состояние и съедает бюджет - что делать: один агент с жёстким state-machine, checkpoints и автопроверками.


‼️Это только одна новость из сегодняшнего ИИ-дайджеста.
Еще в выпуске:


-Стэнфорд разложил 2026: где будет эффект, а где придётся оправдывать бюджеты.


- Google поставил скорость в дефолт: Gemini и поиск начинают жить в ежедневной работе.

И ещё +9 новостей - быстрых, как ИИ:
Wan2.6 делает 15 секунд HD-видео с диалогами, Сандерс хочет паузу на AI дата-центры, Amazon собирает модели+чипы+квант в один блок, Grok Voice Agent API, SAM Audio вырезает звуки по тексту/клику, FrontierScience бенчмарк для науки, Google Labs CC шлёт утренние сводки из Gmail/календаря, FLUX.2 [max] прокачал редактирование и веб-контекст, Molmo 2 понимает видео с таймкодами и трекингом.


Хочешь каждый день БЕСПЛАТНО получать на почту главные ИИ-новости с моей аналитикой формата “И что?” и “Нам 3.14здец”, которые уже читают тысячи ИИ-энтузиастов почти из всех уголков планеты, вместо кучи телеграм-каналов и бесконечной ленты новостей без блокировок и VPN - подпишись в один клик.

Подписаться на дайджест
  • 🔥 5
More from @robotless
  1. Oct 2, 2026Ты ставишь галочку «Разрешать всегда». Читать мелкий шрифт некогда, думать не хочется ведь…
  2. Oct 2, 2026Государство пошло за агентами, 11 млн человек меняют профессию, а ИИ раздаёт чужие адреса…
  3. Oct 1, 2026$500 в месяц. Столько вчера OpenAI попросила за личного агента, который работает за тебя 2…
  4. Sep 29, 2026Принято считать, что новые компании, особенно стартапы, создают молодые. До 30 нужно уже ч…
  5. Sep 28, 2026SpaceX впервые вывела Starship на орбиту Земли Запуск был произведен с космодрома Starbase…
  6. Sep 28, 202623 сентября. Совбез ООН. Час доклада. Ноль решений. Сэм Альтман лично, Дарио Амодеи по вид…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →