Всем привет!
Автор статьи работает в Greptile, которая занимается разработкой агента для AI Code Review.
В процессе работы ему стало интересно, влияет ли используемая модель на то, сколько недостатков находится?
Или, если проще, насколько хороши модели в анализе кода, который написан ими же?
Для этого он подготовил данные и методологию:
🍭 Собрал данные из 500 PR, которые были написаны с использованием Claude Code и Codex
🍭 «Авторство» модели определялось через данные, получаемые из commit, названий PR и/или веток
🍭 Подготовил перечень дефектов, которые были в этих 500 PR
🍭 Запустил Codex и Claude Code в
/review 3 раза🍭 «Почистил» результаты от комментариев, которые относились к «стилистике» и не являлись дефектами
Что получилось? Оказалось, что модели лучше ищут ошибки в коде, который написан другими моделями.
Разрыв не очень большой, но всё же присутствует.
Ещё одним интересным наблюдением оказалось то, что модель скорее всего допустит ошибку при разработке, которую она скорее всего пропустит в review.
Помимо этого, в статье есть ещё много интересного. Включая дефекты, которые находились при «рассуждениях», но пропадали из «финального вердикта».