TGViewer
Этихлид Этихлид @etechlead · 6.96K subscribers
Post #333 1.8K
MAS vs SAS: код писать научились, работать вместе - пока нет (2.1/4)

В первой части были очерчены границы: команда агентов окупается там, где задача параллелизуема, и мешает там, где она последовательная.
А теперь о том, какие именно командные проблемы появляются, когда агенты всё-таки вынуждены работать вместе?

Исследование Anthropic
Полнее всего это расписано в работе Patterns and problems in emerging multiagent systems от Frontier Red Team Anthropic, вышедшей 13 августа, - получился отличный каталог граблей agent teams :)

tl;dr
Агенты уже отлично умеют работать с другим агентом как с инструментом: вот вход, вот ожидаемый выход.
И намного хуже - как с постоянным коллегой, у которого свой контекст, свои цели и своё поведение.

Дизайн экспериментов
Создавали набор специально сконструированных сред для агентов: часть кооперативные, часть - намеренно конфликтные.

Авторы делают предположение о том, что объём agent-2-agent взаимодействий может превысить человеческие раньше, чем мы поймём условия их успеха и начнём ловить системные проблемы.
Поэтому целью было собрать каталог поведенческих тенденций фронтирных моделей в мультиагентных средах.

Модели - несколько поколений Claude: от Sonnet 4.6 до Mythos 5.
Плюс авторам за то, что делают оговорку о том, что в реальном мире модели разнообразнее, так что вариативность "в дикой природе" будет выше, чем в этих прогонах, - но, по их ожиданиям, всё равно ниже человеческой.

Результаты
🔴 Общий форум и репозиторий не превращают рой в команду
Среда: рои по 10-80 агентов, у каждого своя VM, плюс общий форум и общий репозиторий; 12 часов на разработку фэнтезийной игры.

Пробовали три варианта оргструктуры в промпте:
● "организуйтесь сами"
● расписанные роли
● иерархия с CEO
Заметной разницы в качестве финального результата не дал ни один.

То есть оргсхема, заданная промптом, слабее поведенческих свойств самой модели - собственно, это и на практике постоянно приходится видеть, - уши "персоны" конкретной модели торчат то тут, то там, несмотря на любой промптинг

Зато вот между поколениями моделей разница значительная:
● Sonnet 4.6 и Opus 4.6 в прогонах на 80 агентов наоткрывали по ~900 PR и почти ничего не смержили: PR конфликтовали друг с другом, и работа просто бросалась
● Opus 4.8 и Mythos Preview "решили" проблему конфликтов… почти перестав трогать общие файлы: у каждого своя делянка, конфликтовать нечему
● И только Sonnet 5 (внезапно) показал и нормальную совместную работу над общим кодом, и высокую долю смерженных PR

Иии... все получившиеся игры всё равно были плохими - тормозными, с непонятными интерфейсами, и, как признают сами авторы, у моделей в этой области пока плохой вкус, и без существенного человеческого руководства никуда.

Хорошие метрики командной координации ещё не равны хорошему продукту: можно идеально имплементить посредственные решения (магия!).

🔴 Одинаковые агенты не дают независимых мнений
Агенты низковариативны: там, где несколько человек разойдутся в решениях, несколько копий одной модели с похожим контекстом сделают одно и то же.

● В ранней версии игрового эксперимента Anthropic, где все агенты стартовали одновременно, 18 из 30 независимо назвали свою git-ветку одинаково: mvp-game-loop

● В "писательской мастерской", где агенты писали короткие рассказы и рецензировали друг друга, первые тексты в разных прогонах получали одно и то же название - The Cartographer's Last Commission (при этом тему заранее им не задавали)

● Когда рой попросили "сделайте каждый что-нибудь впечатляющее", больше половины пошли писать ray tracer или self-hosting компилятор (где они этого набрались, интересно)

Выбор одинаковой стратегии поведения может иметь и более неприятные последствия.
● Так, в одной из сред агентам нужно было прогонять свои задачи через общую систему с ограниченной пропускной способностью - без какого-либо канала координации.
Каждый рассудил одинаково "разумно": чтобы занять слот раньше других, заводим демона, проверяющего систему по 30 раз в секунду. Слот освободился? А сейчас? А сейчас? В итоге система захлебнулась самими проверками: в одном из прогонов - 2.4 млн запросов и всего 117 принятых задач.

А они как ломанутся... (с)
Такое обычно ожидаешь от жёстко запрограммированных систем, неспособных изменить поведение на ходу, а тут это устроили агенты, которые в принципе способны адаптироваться, но не стали.
И здесь локально разумная стратегия глобально становится вредной.

● Бонус: конформизм легко превращается в сговор.
В ценовой игре несколько агентов-продавцов с одинаковой закупочной ценой должны были каждый максимизировать собственную прибыль.
Имея приватный канал связи, они сговорились о минимальных ценах уже к третьему раунду.
А когда канал отобрали - молча выровняли цены до цента через публичную витрину.

Тут публичность оказалась скрытым каналом связи. Поэтому стандартный совет "дайте агентам общий форум" - палка о двух концах: канал, который помогает координации, облегчает такие вот картельные сговоры.

Продолжение ⬇️

#ai #agents #research #mas_sas
  • 🔥 18
  • ❤ 9
  • 👍 4
  • 🎉 3
  • ❤‍🔥 2
More from @etechlead
  1. Aug 26, 2026MAS vs SAS: код писать научились, работать вместе - пока нет (2.2/4) Начало ⬆️ 🔴 Доверие…
  2. Aug 25, 2026MAS vs SAS: границы применимости (1/4) Мультиагентные системы в целом и для разработки в ч…
  3. Aug 20, 2026Мы начинаем наш стрим "Как писать код с AI-агентами?" Подключайтесь по ссылке: https://you…
  4. Aug 16, 2026Как писать код с AI-агентами? А если командой? Что нужно учесть, чтобы этот код не положил…
  5. Aug 8, 2026The Jeff Dean Facts Из Google после 27 лет работы ушёл Джефф Дин - вместе с несколькими ко…
  6. Jul 17, 2026Последний программист Года полтора назад, в одном из постов, я объявлял в розыск рассказ п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →