GitHub и Microsoft открыли предварительную версию ReviewBench для оценки ИИ-ревью кода
ReviewBench позволяет командам, разрабатывающим ИИ-агентов проверки кода, оценивать их до экспериментов с пользователями. Исследовательская предварительная версия включает 219 запросов на слияние кода из 187 публичных репозиториев на 19 языках.
Замечания ИИ проверяет тоже ИИ: Claude Sonnet 5 оценивает их по опубликованным правилам. GitHub сообщает, что результаты совпадали по направлению с последующими A/B-тестами Copilot code review, но окончательную оценку пользы дают эксперименты в продакшене.
Датасет и методика доступны публично. В статье — как отправить своего агента на проверку и почему результаты остаются приватными до одобрения.
#ии #новости
Post #10811
271
