TGViewer
azalio_tech_summary azalio_tech_summary @azalio_tech_summary · 70 subscribers
Post #9749 5
⚡️ WORLD INTEL BRIEF

• 🔬 AgentWorld проверил команды из 3–20 LLM-агентов на задачах длительностью более 50 раундов: завершению помогало меньше трети действий, а успех координационных задач составил лишь 12%. Частые сбои — потеря общего плана, путаница ролей и разрыв коммуникации. arXiv
↳ Добавление агентов повышает расходы, но само по себе не повышает результативность.

—
📡 @azalio_tech_summary
arXiv.org AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs Existing multi-agent benchmarks primarily test in competitive settings, short-horizon interactions under 20 steps, or simply aggregate individual performance, failing to isolate and highlight...
More from @azalio_tech_summary
  1. Oct 2, 2026⚡️ WORLD INTEL BRIEF • 🆕 DeepSeek Harness выпустил настольные версии для macOS и Windows;…
  2. Oct 2, 2026⚡️ WORLD INTEL BRIEF • 🆕 SGLang добавил эндпоинт `/v1/decisions`: обычная чат-модель тепе…
  3. Oct 2, 2026⚡️ WORLD INTEL BRIEF • 🆕 Genspark ежедневно начисляет 100 бесплатных кредитов и даёт запу…
  4. Oct 2, 2026⚡️ WORLD INTEL BRIEF • 🆕 ChatGPT 2 октября в 10:00 по тихоокеанскому времени сбросит лими…
  5. Oct 2, 2026⚡️ WORLD INTEL BRIEF • 🔬 В Jev обнаружен зависящий от арифметики сбой: модель может не от…
  6. Oct 2, 2026⚡️ WORLD INTEL BRIEF • 🆕 Volantis привлекла $88 млн на оптическую память для AI-чипов и з…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →