Paweł Huryn обновил свой бенчмарк BugHunt. Поскольку Sonnet 5.5 показал отвратительные результаты по стоимости и длительности фиксов, он повторил для него тесты два раза для надёжности — они показали примерно одинаковый результат.
Хотя формально Sonnet 5.5 смог выбить лучший результат — 57 задач из 105, цена несуразная: Sonnet 5.5 в ТРИ (!) раза дороже Opus 5.5 и где-то в ЧЕТЫРЕ (!) раза медленнее как агент из-за перерасхода токенов. Paweł Huryn изучил, почему так произошло, анализом сессии Sonnet 5.5 и обнаружил причину. Для фактической накрутки бенчмарков Дарио обучил LLM совершенно несуразному объёму генерации и проведения очень дорогих «мутационных тестов». Если даже вам такое надо, то это разумно запускать только по вашем указанию агенту, а не по дефолту как делает Sonnet 5.5
На самом деле тут надо понимать, что на тестах провалился и GPT-5.6 Sol как «багфиксер», который аналогично ставит на стратегию перерасхода токенов на тестирование. GPT-5.6 Sol и Sonnet 5.5 — самые отвратительные модели по скорости работы агентов на фиксах. Причём их формальный высокий бенчмарк тут overkill и более-менее адекватен для legacy-лапши-кода. Если разработку ведёт профессионал с агентами, то у него обычно код уже пронизан огромным логированием и уже большой пакет тестов, их писать не нужно агентам заново. В таком случае скорость и цена модели становятся более высоким весом, а такое тестирование, как у GPT-5.6 Sol и Sonnet 5.5, — чистый overkill.
Аналогично на тестах виден провал GPT-5.6 Luna как worker-агента, что объясняет её проигрыш DeepSeek V4.1 на OpenRouter, где пользователи «голосуют кошельками», а «бенчмарк кошельков» пожалуй самый объективный. GPT-5.6 Luna на деле почти в 4 раза медленнее DeepSeek V4.1, ситуация получше у GPT-6 Luna, но она всё равно медленнее и один из самых глупых фиксеров багов.
Самые лучшие фиксеры сложных багов за разумное цену и время — это Opus 5.5 и GPT-6 Astra.
Строго говоря, по рейтингу видно, что для worker-агентов в AI Friendly разработках американцы продолжают проигрывать китайцам. Однако чтобы работать на том же DeepSeek V4.1 с такой же эффективностью, как на Opus 5.5 в фиксах, вам нужно иметь очень хорошо продуманную систему диагностики приложения и в первую очередь развитые AI Friendly логи. Сами автотесты даже тут вторичны, т.к. при более-менее сложных проблемах их роль — наполнить логи. Правда, такие условия будут, если вы сильно вложились в логирование, как я в своей методике GRACE.
https://bughunt.productcompass.pm/?preset=featured&sort=cost_usd&dir=asc
Post #8692
1.48K
