Давно хотел причесать большой Java-модуль со сложной бизнес-логикой (около 80 классов, 25k loc кода и 25k loc тестов), т.к. со временем логика там сильно задублировалась и рассинхронизировалась.
Решил поэкспериментировать и заваншотить такой рефакторинг, хотя изначально планировал дробить на разные фазы и ветки. Сделал несколько исследований и набросал черновик дизайна с Opus 4.5. И тут как раз выкатили новые модели.
Решил сравнить ревью дизайна на Opus 4.6 и GPT-5.3 Codex XHigh с одним и тем же промптом.
Наблюдения:
- Хоть я ставил на GPT, но Opus 4.6 справился лучше. Прогресс по сравнению с 4.5 заметен сразу: уровень дотошности и педантичности сопоставим с GPT-5.2. Он отловил кучу мелочей, которые пропустил 4.5. Но сравнение не совсем честное - тут явно зарешали субагенты и новый режим Agent Teams/teammates (его тоже потестил).
- GPT-5.3 тоже выдал достойное ревью, но чуть менее глубокое в данном контексте. Отмечу, что заметно увеличили скорость, теперь с опусом примерно паритет, раньше же был гораздо медленнее.
Про аппетиты: Opus 4.6 жрет лимиты как не в себя. Одно такое ревью съело 35% пятичасовой сессии. По моим грубым подсчетам, одна 5-часовая сессия — это ~40 млн токенов с кэшем (или ~3 млн без кэша). Если считать очень грубо, в неделю у нас ~10 сессий. Итого в месяц получаем около 1.8 млрд токенов. Это всё равно сильно меньше, чем дает openai. Но так как кэш у антропиков в подписке вроде не тарифицируется, честнее смотреть на токены без кэша.
Сделал несколько итераций ревью, составил план, подробил на эпики, отдал Codex и пошел спать. За 1.5 часа Codex управился ваншотом: +5279 / -3000 строк. (На скриншоте цифры больше, т.к. туда попал еще и рефакторинг документации)
Post #56
369

- 👍 7