Одна и та же модель ИИ может стоить в 30 раз дороже и работать в 7 раз медленнее.
Все зависит от того, в какую агентную оболочку ее обернули. Это главный итог нового Coding Agent Index от Artificial Analysis. Команда впервые системно замерила не сами LLM, а их связки с оболочками вроде Claude Code, Cursor CLI, Codex и Gemini CLI. Логика проста: при работе с ИИ-агентом разработчик фактически выбирает не модель, а пару. Индекс сводит три бенчмарка: SWE-Bench-Pro-Hard-AA от Scale AI (150 сложных задач разработки), Terminal-Bench v2 от Laude Institute (84 терминальные задачи) и SWE-Atlas-QnA (124 вопроса о поведении кода).
По качеству впереди ожидаемая верхушка. Opus 4.7 в Cursor CLI набирает 61 балл, GPT-5.5 в Codex и Opus 4.7 в Claude Code идут вровень с 60, GPT-5.5 в Cursor CLI замыкает четверку с 58. Open weights подбираются, но пока не догнали: лучший результат у GLM-5.1 в Claude Code (53), за ним Kimi K2.6 и DeepSeek V4 Pro в той же оболочке по 50.
Самое интересное начинается, когда к баллам приставляют экономику. Цена задачи разнится более чем тридцатикратно: GPT-5.5 в Codex обходится в $2.21, GLM-5.1 в Claude Code в $2.26 (у последней на цену работает срыв модели в циклы на отдельных задачах). На другом полюсе Composer 2 в Cursor CLI всего за $0.07. По времени картина похожая: Opus 4.7 в Claude Code справляется с задачей примерно за шесть минут, Kimi K2.6 в той же оболочке тратит около сорока.
Заметнее всех тут отличилась Cursor. Их собственная Composer 2, по заявлению команды построенная на базе Kimi K2.5, набирает 48 баллов почти на уровне лучших open weights и остается самой дешевой связкой индекса. Редкая иллюстрация того, что прицельный пост-тренинг под конкретную оболочку дает измеримый выигрыш. Обратный случай у Google: Gemini 3.1 Pro в Gemini CLI получает лишь 43 балла, заметно ниже позиций самой модели в общем Intelligence Index. Узкое место не в модели, а именно в оболочке.
Post #502
2.45K

- 🔥 10
- 👍 8