TGViewer
Технозаметки Малышева Технозаметки Малышева @tsingular · 12.9K subscribers
Post #8692 1.48K

Forwarded from AI Projects (Vladimir Ivanov)

Paweł Huryn обновил свой бенчмарк BugHunt. Поскольку Sonnet 5.5 показал отвратительные результаты по стоимости и длительности фиксов, он повторил для него тесты два раза для надёжности — они показали примерно одинаковый результат.

Хотя формально Sonnet 5.5 смог выбить лучший результат — 57 задач из 105, цена несуразная: Sonnet 5.5 в ТРИ (!) раза дороже Opus 5.5 и где-то в ЧЕТЫРЕ (!) раза медленнее как агент из-за перерасхода токенов. Paweł Huryn изучил, почему так произошло, анализом сессии Sonnet 5.5 и обнаружил причину. Для фактической накрутки бенчмарков Дарио обучил LLM совершенно несуразному объёму генерации и проведения очень дорогих «мутационных тестов». Если даже вам такое надо, то это разумно запускать только по вашем указанию агенту, а не по дефолту как делает Sonnet 5.5

На самом деле тут надо понимать, что на тестах провалился и GPT-5.6 Sol как «багфиксер», который аналогично ставит на стратегию перерасхода токенов на тестирование. GPT-5.6 Sol и Sonnet 5.5 — самые отвратительные модели по скорости работы агентов на фиксах. Причём их формальный высокий бенчмарк тут overkill и более-менее адекватен для legacy-лапши-кода. Если разработку ведёт профессионал с агентами, то у него обычно код уже пронизан огромным логированием и уже большой пакет тестов, их писать не нужно агентам заново. В таком случае скорость и цена модели становятся более высоким весом, а такое тестирование, как у GPT-5.6 Sol и Sonnet 5.5, — чистый overkill.

Аналогично на тестах виден провал GPT-5.6 Luna как worker-агента, что объясняет её проигрыш DeepSeek V4.1 на OpenRouter, где пользователи «голосуют кошельками», а «бенчмарк кошельков» пожалуй самый объективный. GPT-5.6 Luna на деле почти в 4 раза медленнее DeepSeek V4.1, ситуация получше у GPT-6 Luna, но она всё равно медленнее и один из самых глупых фиксеров багов.

Самые лучшие фиксеры сложных багов за разумное цену и время — это Opus 5.5 и GPT-6 Astra.

Строго говоря, по рейтингу видно, что для worker-агентов в AI Friendly разработках американцы продолжают проигрывать китайцам. Однако чтобы работать на том же DeepSeek V4.1 с такой же эффективностью, как на Opus 5.5 в фиксах, вам нужно иметь очень хорошо продуманную систему диагностики приложения и в первую очередь развитые AI Friendly логи. Сами автотесты даже тут вторичны, т.к. при более-менее сложных проблемах их роль — наполнить логи. Правда, такие условия будут, если вы сильно вложились в логирование, как я в своей методике GRACE.
https://bughunt.productcompass.pm/?preset=featured&sort=cost_usd&dir=asc
  • ❤ 9
  • ✍ 1
More from @tsingular
  1. Sep 29, 2026✔️ Китай ограничил зарубежные поездки для семей ИИ-разработчиков Власти КНР обязали семьи…
  2. Sep 29, 2026#юмор ——— @tsingular
  3. Sep 29, 2026Ты абсолютно прав, внесём финальные правки #юмор ------ @tsingular
  4. Sep 29, 2026Решил тут с Opus 5.5 на пару наколдовать бенч для ИИ-агентов. Хотелось сделать что то реал…
  5. Sep 29, 2026Читая старую фантастику 😂 Прям про наш ИИ мир #юмор ------ @tsingular
  6. Sep 29, 2026🌟 OpenScience: персональный учёный с режимом автономных экспериментов Стартап Synthetic S…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →