TGViewer
Нейроканал Нейроканал @neuro_channel · 11.7K subscribers
Post #2844 2.36K
Artificial Analysis обновила свой индекс до v4.3: Terminal-Bench поднят с 2.1 до 4.0 (агент теперь гоняется через mini-SWE-agent, задачи стали сложнее), а банковский τ³-Banking заменён на AutomationBench от Zapier: 657 рабочих сценариев в симуляциях Gmail, Slack, Salesforce и Jira с закрытым набором задач. Доля закрытых тестов в индексе выросла до 45%.

Вверху делят первое место Claude Fable 5.1 и GPT-6 Astra, следом Opus 5 и Fable 5. Среди открытых моделей лидируют GLM-5.3 и Kimi K3 вровень, GLM-5.3-Flash третья, Qwen3.8 и DeepSeek V4 Pro дальше. По цене за задачу большую часть фронта держит OpenAI: все пять уровней рассуждения Astra самые дешёвые на своём уровне, а из остальных на фронте только Fable 5.1, GLM-5.3-Flash и MiMo-V2.5-Pro.

@neuro_channel
  • ✍ 2
  • 👍 2
  • 🌚 1
More from @neuro_channel
  1. Sep 20, 2026Tencent выложила WeVisDoc, модели на 2 и 4 млрд параметров, которые превращают снимок стра…
  2. Sep 19, 2026StepFun выпустила Step 5 Preview, и Artificial Analysis уже её замерили: 44 балла в индекс…
  3. Sep 19, 2026На следующей неделе ожидается сразу несколько крупных релизов. Расскажу про самые интересн…
  4. Sep 18, 2026Qwen выложила Qwen3.8-Omni-Flash: на вход текст, картинки, звук и видео, контекст 1M токен…
  5. Sep 18, 2026PrismML выпустила Ternary Bonsai 2 27B: тернарное сжатие теперь сделано поверх Qwen3.8 27B…
  6. Sep 17, 2026Стелс-модель Union Alpha раскрылась: это Pareto 26.9 от компании The Unbiased Company. Вче…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →