TGViewer
AI Product | Igor Akimov AI Product | Igor Akimov @ai_product · 8.21K subscribers
Post #2415 2.4K
Свежие бенчмарки моделей на кодинге (для очередных дискуссий, Claude vs Codex)

Specific Labs выпустили бенчмарк, где модели чинят не задачки с GitHub, а настоящий код реальных компаний – лицензировали приватные репозитории (клон Partiful на 200K+ юзеров, финтех со 100K+ банковскими выписками, enterprise sales-платформы) и взяли оттуда живые задачи: налоги в инвойсах, миграции биллинга, метеринг токенов. Код в интернете не лежит, модели на нём не учились. Результат отрезвляет.

– Лидер – Fable 5.1 в Claude Code, 38.8% решённых задач
– GPT-6 Astra в Codex – 33.8%, Grok -32.5% (вау), Gemini 3.8 Flash – 31.2%
– GLM 5.3 – 28.8%, Muse Spark 1.3 – по 23.8%, Kimi K3 – 18.8%
– GPT-5.6 Sol – 16.2%
– 6 из 10 задач решаются реже чем в 15% случаев, одну (analytics stream reducer) не решил никто ни разу
– Медианное решение трогает 11 файлов – против 6 в FrontierCode и DeepSWE
– Цена одного прогона: Gemini Flash $2.50, GPT-6 Astra $4.67, Fable 5.1 $6.96

Интересно, как модели проваливаются. Главная причина – пропущенные требования из ТЗ (у Grok – 67% всех фейлов). Вторая – «не проверил, придумал» – так падает 43% неудачных прогонов GPT-5.6. Третья – правильная идея, криво встроенная в систему (Gemini – 49%). Причём короткие прогоны до 10 минут фейлятся с той же частотой, что и длинные – проблема не во времени, а в том, что агент не понял, как устроена компания и её код.

Короче, разработчика могут заменить пока только в трети случаях. Но тут надо сказать, что описание компании и кодовых принципов в claude.md/agents.md никто не писал, это такой чисто "вайбкодинг-стайл" тест. Должно быть сильно лучше при правильном подходе.

https://withspecific.com/benchmarks/real-swe
  • 👍 7
  • 🔥 5
  • ❤ 2
More from @ai_product
  1. Sep 25, 2026Ну вот, подходящий конкурент Jev - GLiNER-2.5 Как уже писал выше их NER в GLiNER-2 я выбра…
  2. Sep 24, 2026В блогосфере только и разговоров, что о Jev. Который в 193 раза быстрее и в 444 раза дешев…
  3. Sep 23, 2026Google выкатил Gemini 3.8 TTS. Видимо все силы кинул в голос ) Моделей две: – Gemini 3.8 F…
  4. Sep 22, 2026Opus 5.5 vs GPT-6 Sol и Luna – в один день! Сегодня прям дуэль. Anthropic выкатила Claude…
  5. Sep 21, 2026Grok 4.7: фронтир по цене Grok 4.6 SpaceXAI наконец выкатили Grok 4.7 – после трёх перенос…
  6. Sep 21, 2026Mac Studio на M5 Ultra – машина мечты для локальной разработки О, наконец-то результаты те…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →