TGViewer
Azalio_tech Azalio_tech @azalio_tech · 659 subscribers
Post #58 2.02K
Пишу я тут систему AI ревью кода, а то больно смотреть как коллега ревьювит диффы на 35к строк.
Чтобы понять а какую модель вообще стоит брать прогнал тесты на 17 моделях.

Результаты оказались с одной стороны закономерные, с другой нашлось место и неожиданностям.

Вот большой отчет.

Выводы:

- GPT‑5.2 - лучший баланс “находит баги / не сходит с ума / стоит адекватно”.
- Gemini 3 Flash - примерно такое же покрытие багов, но гораздо дешевле и быстрее; особенно хорош на перформанс и инфраструктурных штуках.
- Claude Opus 4.5 - премиум по качеству и аккуратности, но дороже GPT‑5.2.
- Gemini 2.5 Pro - лучший “бюджетный рабочий конь”: аккуратные находки, смешная цена.
- DeepSeek V3‑2 / GLM‑4.5 - нишевые “охотники за редкими багами”: мало известных багов, но иногда попадание в то, что остальные пропускают.
- Часть моделей (O4‑mini, Qwen‑Max, Grok‑3/4, GPT‑4.1‑nano) не годятся как единственный gatekeeper: спокойно говорят APPROVE при наличии критических дефектов.

#ai #llm #codereview #devtools #backend
Gist model-compare.md GitHub Gist: instantly share code, notes, and snippets.
  • 👍 21
  • 🙊 1
More from @azalio_tech
  1. Sep 25, 2026#ai #llm #codereview Перепрогнал тест своей системы AI-ревью кода на свежих китайских моде…
  2. Sep 22, 2026Post #90
  3. Sep 7, 2026А хорошо бы запускать спокойно батчевые задачи на всех нодах кубера и не беспокоиться за S…
  4. Aug 14, 2026Показать что ты Лев Толстой, а не толстый лев можно тут: https://aot-kuberconf.ru/cfp (Отк…
  5. Aug 1, 2026У меня синдром дефицита внимания. Это когда внимание не держится на одном предмете дольше…
  6. Jul 19, 2026В последнее время уж больно часто стало появляться новостей про фотонику. Решил чуть копну…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →