Проверил, нужен ли в моём AI-ревью ансамбль из трёх моделей. Не нужен: одна kimi-k3 находит столько же и обходится в 2.3 раза дешевле. Ансамбль в проде выключил.
Сравнивал на Martian Code Review Bench - это открытый набор реальных PR с эталонными замечаниями. Взял 10 PR от Grafana, потому что они похожи на то что у меня в проде.
режим нашёл $/PR
ансамбль 15/25 1.46
kimi-k3 14/25 0.62
Ансамбль - это kimi-k3, glm-5.3 и deepseek-v4.1-flash. Да, находок чуть больше, но не кардинально больше.
Подумываю о втором ревьювере по подписке (в комментах спросили про астру и она внезапно хуже kimi с моей обвязкой, но нашла то что не нашел kimi).
Ещё сравнил себя с коммерческими ревьюерами на тех же 10 PR.
У меня результат 0.39-0.41, это рядом с CodeRabbit (0.42-0.44), Copilot (0.35-0.44) и Claude Code (0.39-0.51).
Лидеры - cubic 0.73-0.80, augment 0.61-0.68 и qodo 0.58-0.65.
Если собираете ансамбль для ревью, сначала проверьте одну сильную модель на реальных PR. Мне ансамбль обходился в 2.3 раза дороже за тот же результат.
—
@azalio_tech