Artificial Analysis обновила свой индекс до v4.3: Terminal-Bench поднят с 2.1 до 4.0 (агент теперь гоняется через mini-SWE-agent, задачи стали сложнее), а банковский τ³-Banking заменён на AutomationBench от Zapier: 657 рабочих сценариев в симуляциях Gmail, Slack, Salesforce и Jira с закрытым набором задач. Доля закрытых тестов в индексе выросла до 45%.
Вверху делят первое место Claude Fable 5.1 и GPT-6 Astra, следом Opus 5 и Fable 5. Среди открытых моделей лидируют GLM-5.3 и Kimi K3 вровень, GLM-5.3-Flash третья, Qwen3.8 и DeepSeek V4 Pro дальше. По цене за задачу большую часть фронта держит OpenAI: все пять уровней рассуждения Astra самые дешёвые на своём уровне, а из остальных на фронте только Fable 5.1, GLM-5.3-Flash и MiMo-V2.5-Pro.
@neuro_channel
Post #2844
2.36K

- ✍ 2
- 👍 2
- 🌚 1