Пишу я тут систему AI ревью кода, а то больно смотреть как коллега ревьювит диффы на 35к строк.
Чтобы понять а какую модель вообще стоит брать прогнал тесты на 17 моделях.
Результаты оказались с одной стороны закономерные, с другой нашлось место и неожиданностям.
Вот большой отчет.
Выводы:
- GPT‑5.2 - лучший баланс “находит баги / не сходит с ума / стоит адекватно”.
- Gemini 3 Flash - примерно такое же покрытие багов, но гораздо дешевле и быстрее; особенно хорош на перформанс и инфраструктурных штуках.
- Claude Opus 4.5 - премиум по качеству и аккуратности, но дороже GPT‑5.2.
- Gemini 2.5 Pro - лучший “бюджетный рабочий конь”: аккуратные находки, смешная цена.
- DeepSeek V3‑2 / GLM‑4.5 - нишевые “охотники за редкими багами”: мало известных багов, но иногда попадание в то, что остальные пропускают.
- Часть моделей (O4‑mini, Qwen‑Max, Grok‑3/4, GPT‑4.1‑nano) не годятся как единственный gatekeeper: спокойно говорят APPROVE при наличии критических дефектов.
#ai #llm #codereview #devtools #backend
Post #58
2.02K