Перепрогнал тест своей системы AI-ревью кода на свежих китайских моделях.
Лучшее качество у kimi-k3, но она в 4 раза дороже glm-5.3 и в 27 раз дороже deepseek-v4.1-flash.
Баллы из 36 в двух прогонах:
модель 1-й 2-й шум $/ревью $/балл
kimi-k3 29 34 16 0.42 0.22
glm-5.3 25 30 25 0.11 0.07
deepseek-v4.1-flash 26 26 15 0.016 0.010
Цены по каталогу OpenRouter.
Тест другой, чем в январе. Там был один большой дифф, здесь 18 маленьких репозиториев на Go и Python, в каждом одна регрессия.
Go-кейсы срисованы с реальных ревью наших k8s-операторов. Например, финализатор читает соседей из кэша информера, и при одновременном удалении IAM-привязка остаётся висеть. Или секреты генерируются заново на каждом reconcile.
За кейс до 2 баллов. Находки размечены вручную и сверены с кодом. Полный балл - только если находка точная и автор PR её увидит.
У kimi за 36 ревью ни одного своего сбоя.
GLM вторая, но самая шумная: 25 ложных и лишних находок, а на одном кейсе выдумала код, которого нет. И самая болтливая - 42-50 тысяч токенов на ревью. В январе, на другом тесте, GLM-4.5 не нашла почти ничего.
Дипсик набрал 26 в обоих прогонах. Один раз вернул пустой ответ, один раз не нашёл вообще ничего.
Qwen3.8-max в первой версии теста был последним (16 из 32), во второй я его уже не гонял.
Что ещё видно по прогонам:
У дипсика сумма в обоих прогонах одинаковая, а оценки поменялись в 8 кейсах из 18. По одному прогону я бы выводов не делал.
Между прогонами я чинил свой пайплайн, и kimi с glm получили по 5 баллов сверху. Дипсику это не помогло.
Все три иногда находят баг, но ставят ему LOW, и система его прячет. Автор PR такую находку не увидит.
Если тестируете своё AI-ревью, гоняйте хотя бы дважды и считайте только те находки, которые увидит автор PR (я скрываю LOW находки на ревью).
Отдельно проверил, нужен ли в ревью ансамбль из этих трёх моделей. Не нужен - подробности в следующем посте.
—
@azalio_tech