Модель не умеет проверять свою работу. Она умеет проверять чужую — если ей соврать, что работа чужая.
Тред-благодарность в r/ClaudeAI: человек пишет, что проблема была не в том, что агент плохо пишет код.
Проблема была в том, что он сам себе ставит пятёрку. Починилось это одним приёмом.
Не «проверь этот код». А: свежий отдельный контекст плюс явно враждебная рамка — ты скептичный ревьюер, ты этого не писал, ты считаешь, что здесь есть дефекты, найди их.
Два условия обязательны. Свежий контекст — потому что в том же диалоге модель защищает уже написанное. Враждебная рамка — потому что нейтральная просьба даёт нейтральный ответ.
Дальше тред превратился в обмен схемами кросс-модельного ревью. Самое смешное наблюдение: «Если я говорю Codex, что это писал Claude, он рвёт код в клочья».
И трезвый вопрос оттуда же, который стоит держать в голове: так можно прогнать двадцать пять раз, и он будет находить недостатки бесконечно. Где остановиться? Ответ из треда: калибровать строгость ревьюера под сложность кода.
Натравливать топовую модель на максимальных усилиях на простой скрипт — это, как там сказали, отправить гроссмейстера играть в шашки с ребёнком.
https://old.reddit.com/r/ClaudeAI/comments/1vc11nl/
Post #770
318