Еще одна идея над которой успел поработать перед уходом из стартапа – это AI код ревьюеры.
В какой-то момент, как и многие стартапы, мы стали строить свою Software Factory (воркшоп от Курсора, если интересуетесь) с идей того, чтобы 0) cтать настоящей AI Native Dev компанией 1) еще быстрее шипить новый софт 2) продавать это другим.
Агентские код ревьюеры – это один из блоков такой фабрики, я и исследовал, какие существуют опции. Полигон для тестов – мои коллеги и их отзывы, исторические PR-ы с ревизиями, чтобы делать офлайн эвалы.
Начал я с коробчных решений. На слуху был Code Rabbit, шустрый грейдер, хорошо советовал на уровне файлов, отлавливая очевидный слоп. Но в общем-то на этом и все. Более сложные архитектурные вопросы он полностью игнорировал. Еще одна подобная штука - это Qodo, у них была интеграция с разными агентскими файлами (cursor rules, agents.md), но завести адекватно так и не смог
Другое коробочное решение – это Code Review от Claude Code. Вот это было прям хорошо: обшираная кастомизация (REVIEW.md для своих пожеланий, настраиваемые проверки для конкретного репозитория, калибровка severity). Работало правда как будто не обоснованно медленно, иногда ревьюер уходил в долгое изучения репозитория; крошечные изменения могли занимать 30 минут. В итоге очень большой расход токенов + лок ин на модели антропика. Запустить Claude Code + свои скиллы для ревью тоже пробовал, но получалось заметно хуже.
В идеале хотелось большего детерминированного контроля, возможности кастомизировать глубину ревью, и конечно поддержать разные модели. В общем по классике - надо писать свое.
Но писать c нуля для пилота мне не пришлось. Арсений, автор @partially_unsupervised в марте выложил в опенсоурс nitpicker, и быстро довел его до крайне полезной штуки. Большая мобильность, можно запускать не только на PR, но и просто на репе + интересующих файлах, чтобы мониторить состояние кодовой базы. Быстро я приблизился к качеству ревью от антропиков за счет запусков нескольких nitpicker-ов под разные цели, сделав при этом заметно быстрее.
По итогу всех экспериментов на живых PR-ах получилась система с высокой полнотой. Ревьюер регулярно предлагал правки, которые разработчики считали полезными. Но на одно хорошее срабатывание приходилось много ложных, такой шум регулярно раздражал кожаных ревьюеров.
Что из моих поделок доехало до продукта уже не знаю, но Tessl недавно выпустил Tessl Agent, первая версия фабрики.
В мире Loop Engineering-а, где агент сам занимается эволюцией кодовой базы human review уже не имеет значения. А вот возможны ли такие фабрики в принципе – вопрос открытый. Среди стартаперов уже есть хайповые скептики. Посмотрите свежий доклад Harness Engineering is not Enough: Why Software Factories Fail если интересно.
Post #222
3.74K
- 🔥 31
- 👍 9
- ❤ 6
- ⚡ 4
- 🎉 3
- 🆒 1