Как вы знаете, я с большим интересом слежу за SWE-bench (тык, тык, тык, тык, тык...), бенчмарком построенном на исправлении GitHub issues (т.е. багрепортов).
Первый график построен нашим студентом специально для вас: распаршен лог лидерборда и построена статистика первых 5 мест с момента старта бенчмарка в октябре 2023 года.
Мысли по поводу:
* График построен 4 дня назад и уже устарел. Свежий Claude Sonnet 4.5, вышедший позавчера, декларирует 77,2% и 82% в прыжке (несколько параллельных попыток).
* За 2 года пройден путь от единиц % закрытых багов до 82%. Напомню, там большая часть issues требуют менее 1 часа работы человека. Фактически сейчас идет борьба за наиболее сложные баги, требующие согласованных правок в нескольких файлах и нескольких часов работы человека.
* Видно, что большинство успешных сабмитов, двигавших топ-5 бенчмарка, кучно пошли в последние полгода. Т.е. конкуренция выросла.
Например, недавняя GPT-5 Codex всего 2 недели побыла лучшей моделью для кодинга и была смещена 3 дня назад Claude Sonnet 4.5! 😲🙂
* Также заметим, что крупные игроки (OpenAI, Google, Microsoft) не спешат регулярно постить новые результаты в SWE-bench (им это не надо), хотя внутри точно тестируют даже более серьезно.
Большой проблемой SWE-bench является контаминация. Бенчмарк построен на открытых данных и это загрязняет результат. Прямое следствие — появление альтернатив, например, SWEE/SWA-bench (релиз 10.03.25), RefactorBench (релиз 10.03.25), SWE-rebench (релиз 14.05.25), российский SWE-MERA (релиз 18.09.25), очень перспективный свежий SWE-Bench Pro (релиз 20.09.25). В общем умирание SWE-bench обещает стать праздником из серии "Король умер, да здравствует король(и)!" (см. таблицу выше)
И в качестве интересного примера приведу опенсорсный Aider — инструмент для кодинга с использованием внешних моделей, созданный Полом Готье (Paul Gauthier — до сих пор львиная доля коммитов в проект). Выше график релизов Aider. Проект долго развивался руками, но с какого-то момента количество и процент AI кода сильно выросли! (запредельно прикольный кейс, когда AI пишет инструмент для удобного использования AI))). 😲😁
Ну и специально для любителей темы "Вайбкодинг — это новый г*внокодинг" деликатно напомню, что 25 апреля Google заявил, что у них 30% нового кода пишет ИИ, а 29 апреля такое же заявление сделал Microsoft. Т.е. Microsoft и Google у нас главные апологеты вайб кодинга, на секундочку. Уверяю вас, качество кода их волнует.
В примере прошлого поста 50% опытных разрабов компании все еще хейтят ИИ в условиях, когда ИХ коллеги демонстрируют ускорение с Курсором в 8-10 раз. Полтора года назад (когда хейтящих LLM в кодинге было 95%) на OpenTalks-2024 я был впечатлен прогнозом специалиста в увольнении 80% программистов через 5 лет и спорил с ним. Но процесс явно идет в этом направлении!
Мне интересно, о чем думают те, кто фигачат прод сегодня? Ведь выживут в первую очередь senior (и то не все), а область сильно поменяется.
Вспоминается народная мудрость полувековой давности: Лошадь в колхозе работала больше всех, но председателем так и не стала. 🐴😉 Она не стала даже трактористом 🚜😉
Сеточки аналогичные GPT-4o с момента ее выхода за полтора года подешевели примерно в 500 раз (!).
На что надеются современные лошади в свете перспективы появления тракторов на 500 лошадиных сил? 🤔 У нашего
Да, я в курсе рекламы колхозов:
* Ароматнейший клок сена каждому жеребцу на бэдж бесплатно КАЖДЫЙ ДЕНЬ! 😂
* Кто не в колхозе
* Только тот жеребец, который полил потом каждый клочок поля, может стать трактористом!
А старые мерины по вечерам в конюшне рассказывают горькую правду, как смердят трактора и воняет бензин!
Пишите в комментах, о чем думают жеребцы! Оч интересно! 😉
#SWE_benchmarking #speed_of_progress @vgcourse


