TGViewer
Azalio_tech Azalio_tech @azalio_tech · 659 subscribers
Post #91 235
#ai #llm #codereview

Перепрогнал тест своей системы AI-ревью кода на свежих китайских моделях.
Лучшее качество у kimi-k3, но она в 4 раза дороже glm-5.3 и в 27 раз дороже deepseek-v4.1-flash.

Баллы из 36 в двух прогонах:
модель               1-й  2-й  шум  $/ревью  $/балл
kimi-k3 29 34 16 0.42 0.22
glm-5.3 25 30 25 0.11 0.07
deepseek-v4.1-flash 26 26 15 0.016 0.010

Цены по каталогу OpenRouter.

Тест другой, чем в январе. Там был один большой дифф, здесь 18 маленьких репозиториев на Go и Python, в каждом одна регрессия.
Go-кейсы срисованы с реальных ревью наших k8s-операторов. Например, финализатор читает соседей из кэша информера, и при одновременном удалении IAM-привязка остаётся висеть. Или секреты генерируются заново на каждом reconcile.

За кейс до 2 баллов. Находки размечены вручную и сверены с кодом. Полный балл - только если находка точная и автор PR её увидит.

У kimi за 36 ревью ни одного своего сбоя.
GLM вторая, но самая шумная: 25 ложных и лишних находок, а на одном кейсе выдумала код, которого нет. И самая болтливая - 42-50 тысяч токенов на ревью. В январе, на другом тесте, GLM-4.5 не нашла почти ничего.
Дипсик набрал 26 в обоих прогонах. Один раз вернул пустой ответ, один раз не нашёл вообще ничего.
Qwen3.8-max в первой версии теста был последним (16 из 32), во второй я его уже не гонял.

Что ещё видно по прогонам:
У дипсика сумма в обоих прогонах одинаковая, а оценки поменялись в 8 кейсах из 18. По одному прогону я бы выводов не делал.

Между прогонами я чинил свой пайплайн, и kimi с glm получили по 5 баллов сверху. Дипсику это не помогло.
Все три иногда находят баг, но ставят ему LOW, и система его прячет. Автор PR такую находку не увидит.

Если тестируете своё AI-ревью, гоняйте хотя бы дважды и считайте только те находки, которые увидит автор PR (я скрываю LOW находки на ревью).

Отдельно проверил, нужен ли в ревью ансамбль из этих трёх моделей. Не нужен - подробности в следующем посте.

—
@azalio_tech
  • 🔥 4
  • 👍 2
More from @azalio_tech
  1. Sep 22, 2026Post #90
  2. Sep 7, 2026А хорошо бы запускать спокойно батчевые задачи на всех нодах кубера и не беспокоиться за S…
  3. Aug 14, 2026Показать что ты Лев Толстой, а не толстый лев можно тут: https://aot-kuberconf.ru/cfp (Отк…
  4. Aug 1, 2026У меня синдром дефицита внимания. Это когда внимание не держится на одном предмете дольше…
  5. Jul 19, 2026В последнее время уж больно часто стало появляться новостей про фотонику. Решил чуть копну…
  6. Jul 16, 2026Как некоторые тут знают, map-framework изначально писался под claude code. Что же делать е…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →