TGViewer
Azalio_tech Azalio_tech @azalio_tech · 659 subscribers
Post #92 227
#ai #llm #codereview

Проверил, нужен ли в моём AI-ревью ансамбль из трёх моделей. Не нужен: одна kimi-k3 находит столько же и обходится в 2.3 раза дешевле. Ансамбль в проде выключил.

Сравнивал на Martian Code Review Bench - это открытый набор реальных PR с эталонными замечаниями. Взял 10 PR от Grafana, потому что они похожи на то что у меня в проде.

режим      нашёл  $/PR
ансамбль 15/25 1.46
kimi-k3 14/25 0.62


Ансамбль - это kimi-k3, glm-5.3 и deepseek-v4.1-flash. Да, находок чуть больше, но не кардинально больше.
Подумываю о втором ревьювере по подписке (в комментах спросили про астру и она внезапно хуже kimi с моей обвязкой, но нашла то что не нашел kimi).

Ещё сравнил себя с коммерческими ревьюерами на тех же 10 PR.
У меня результат 0.39-0.41, это рядом с CodeRabbit (0.42-0.44), Copilot (0.35-0.44) и Claude Code (0.39-0.51).
Лидеры - cubic 0.73-0.80, augment 0.61-0.68 и qodo 0.58-0.65.

Если собираете ансамбль для ревью, сначала проверьте одну сильную модель на реальных PR. Мне ансамбль обходился в 2.3 раза дороже за тот же результат.

—
@azalio_tech
  • 👏 4
More from @azalio_tech
  1. Sep 25, 2026#ai #llm #codereview Перепрогнал тест своей системы AI-ревью кода на свежих китайских моде…
  2. Sep 22, 2026Post #90
  3. Sep 7, 2026А хорошо бы запускать спокойно батчевые задачи на всех нодах кубера и не беспокоиться за S…
  4. Aug 14, 2026Показать что ты Лев Толстой, а не толстый лев можно тут: https://aot-kuberconf.ru/cfp (Отк…
  5. Aug 1, 2026У меня синдром дефицита внимания. Это когда внимание не держится на одном предмете дольше…
  6. Jul 19, 2026В последнее время уж больно часто стало появляться новостей про фотонику. Решил чуть копну…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →