Cognition, выкатили FrontierCode - новый бенч для кодинг-агентов. Я не в силах тестить все топтир и фритир модельки, да и не в финансах, поэтому ориентируюсь как раз на такие замеры
Фокус этого бенча не на написал ли код, а на том, можно ли этот PR реально смерджить: тесты, стиль репозитория, комментарии, отсутствие хаков и нормальное качество кода. Кароч все то, что определяет энтерпрайзный проект от моего пет проекта
По результатам: Opus 4.8 xHigh сильно впереди, GPT-5.5-medium чуть выше Opus 4.7, open-source пока не всплывает
За какими еще следим:
👉 FrontierCode
👉 SWE-rebench База, как мне кажется. сюда в первую очередь
👉 Android bench Тут гугл манипулирует данными как может, но хоть какая то статистика
👉 Terminal-Bench Тут много агентов которые тюнятся на прохождение, надо аккуратнее
👉 SWE Marathon и DeepSWE меряют на сколько долго задачки может решать
Post #156
483

- 🔥 2