ИИ-агентов оценивают на бенчмарках вроде SWE-bench: сотня настоящих багов из открытых проектов вроде Django, агенту дают репозиторий до фикса и issue, после патча гоняют тесты. Зелёные — задача решена.
Но эти репозитории годами лежат на GitHub вместе с обсуждениями и готовыми коммитами, и модель почти наверняка видела их на обучении. Высокий resolve rate может означать не «умеет чинить код», а «помнит решебник».
Чтобы это проверить, авторы работы прогнали репозитории через автозамену: переименовали идентификаторы, переставили ветки условий, переписали циклы, добавили мёртвый код. Семантика прежняя, баг на месте и чинится тем же патчем: незнакомым стал только вид кода, около 7% строк.
Дальше агента гоняют дважды, на исходном репозитории и на изменённом. Если он разбирается в коде, оценки совпадут. А получается, что, например, Claude Opus 4.5 под mini-SWE на SWE-bench Pro решает 90,2 из ста на исходном коде и 83,5 на причёсанном.
Другие модели сами смотрите на картинке. Самых топовых тут нет, но по идее эксперимент можно повторить и сделать новый бенч, который бы давал более честные результаты тех же SWE-bench.
@neuro_channel
Post #2744
1.62K

- ⚡ 7