SWE-bench: как выбирать агента, когда рейтинг не различает лидеров (Рубрика #AI4SDLC)
У одного агента 79,2%, у другого 78,8%. Можно покупать победителя? На 500 задачах разница — всего два дополнительных решения. Мне здесь интересен момент, когда точные цифры начинают обещать больше, чем мы действительно измерили.
В "Coding Agents Have Converged" Fengshuo Liu из Imperial College London и соавторы разобрали 254 опубликованных результата SWE-bench. Статья вышла 15 сентября 2026 года (версия v1 статьи); авторы открыли код анализа. Новых агентов они не запускали: проверяли, какие выводы позволяют сделать уже собранные данные с агентами из 2023 - 2025 годов. SWE-bench Verified — 500 задач из GitHub: агент готовит исправление, проверочная система запускает тесты. У первой десятки в изученной выборке 285 общих успехов и 51 общий провал. Различаются результаты только на 164 задачах.
Представьте двух кандидатов, которым дали одинаковую контрольную. Оба решили по 396 заданий: 378 общих, ещё по 18 каждый решил самостоятельно. Это реальные числа двух лидеров. Общий балл одинаковый, но на конкретной задаче они могут помочь по-разному.
Чтобы сравнить кандидатов, нужно посмотреть на их взаимные победы. На задачах, где справился только один, кто выигрывает чаще? Достаточно ли убедителен перевес? Примерно это проверяет парный тест Макнемара, которым пользуются авторы. Ни одна из 29 соседних пар в первой тридцатке не показала статистически значимого различия. Это ещё не делает всю тридцатку одинаковой: между некоторыми далёкими друг от друга участниками различия обнаруживаются. Но порядковые номера создают слишком уверенную картину, которая не особо обоснована.
Дальше важна обвязка агента: как он ищет контекст, вызывает инструменты, проверяет себя и повторяет попытки. У одной модели в разных обвязках наблюдался разброс до 29,8 процентного пункта. Но команды, версии и условия запусков различались. Это аргумент проверять всю связку, а обещать такой прирост от замены обвязки было бы перебором. И заголовок про «агенты сошлись» я бы читал осторожно. В работе — результаты 2023–2025 годов, по одному запуску на опубликованный результат и одно семейство бенчмарков. Для соседей по рейтингу не хватило доказательств превосходства. Равенство способностей от этого доказанным не стало.
С авторами есть о чём поспорить. Они считают взаимодополняемость небольшой: два лидера вместе покрывают 414 задач вместо 396. Но дополнительные 18 — это примерно 17% провалов первого! Для дорогих задач вполне интересно. Правда, надо уметь выбрать правильный патч и сравнить второй агент с ещё одной попыткой первого. Само объединение ответов этого не решает.
Как тогда выбирать? Я бы использовал такую процедуру, которая не описана в самой статье, но выглядит практично
- Взять 2–3 кандидата, подходящих по доступам, интеграциям и бюджету. Зафиксировать модели, версии обвязки, лимиты времени и попыток.
- Дать им одинаковые реальные задачи: баги, изменения API, тесты, работу с незнакомым кодом. Начать с нескольких десятков для пилота. Такой объём поможет увидеть крупные различия, но не обещает доказать преимущество в пару процентов.
- Проверять патчи собственными тестами и ревью. Повторить хотя бы часть запусков: одна удачная попытка ещё не означает надёжность.
- Считать стоимость принятого решения: вызовы модели, время ожидания, минуты человека на проверку и переделки. Отдельно учитывать регрессии. Смотреть по типам задач — среднее может спрятать полезную специализацию.
Если преимущество по качеству пока неясно, можно выбрать более дешёвого и удобного кандидата, сохранив неопределённость в оценке. А второму дать отдельную роль: проверить, сколько провалов первого он исправляет за сопоставимый бюджет. Это уже проверяемое основание держать двух агентов в работе.
#AI4SDLC #Agents #Research #Evals #Engineering
Post #4984
1.14K
Annotated-Coding-Agents-Have-Converged.pdf5 MB
- ❤ 3
- 👍 1
- 🔥 1