TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.01K subscribers
Post #791 288
Второй агент на ревью — это не свежий взгляд. Это второй потолок качества, и он вполне может оказаться ниже первого.

LeadDev разобрал контролируемый эксперимент: Claude Opus 4.7 и Codex GPT-5.5 на 116 средних и сложных питоновских задачах из LiveCodeBench. Каждый сначала решал сам, потом второй правил его работу.

— Codex сам — 71,6%. Codex под ревью Claude — 89,7%. Схема работает.
— Claude сам — 91,4%. Claude под ревью Codex — 82,8%. Схема работает в минус.

Разбор по ходам объясняет, откуда минус. Claude починил 26 проваленных ответов Codex и сломал пять рабочих — чистый плюс 21. Codex починил три ответа Claude и превратил 13 верных решений в неверные.

Вот это и есть цифра, ради которой я притащил историю. Слабый ревьюер не просто «не помогает». Он активно ломает то, что работало, потому что вместе с ролью ревьюера получил право переписывать.

Теперь переносим к себе. Мы обсуждали ревью как рамку: враждебный промпт, свежий контекст, «ты этого не писал». Рамка действительно снимает с модели защиту собственного кода, и это работает. Но она не добавляет ревьюеру знаний. Найти дефект и правильно его починить — разные способности, и вторая упирается в силу модели, а не в формулировку роли.

Что сделать сегодня. Откройте свою связку «писатель — ревьюер» и посмотрите, кто в ней ревьюер. Если на ревью поставлена модель подешевле — ровно потому, что проверять кажется работой попроще, чем писать, — вы собрали ту самую конфигурацию, где джуниор переписывает синьора. Признак, по которому решать, один: ревьюер не должен быть слабее автора. Если сильнее взять негде — оставьте ревьюеру право говорить, но не право править.

Честности ради, у второго прохода есть цена и без единой ошибки: средняя стоимость задачи выросла с $0,19 до $0,44, а время — с 38,5 до 112,4 секунды. И это LiveCodeBench, изолированные алгоритмические задачи, а не ваша кодовая база с её конвенциями и архитектурой.

https://leaddev.com/ai/your-ai-coding-agents-might-need-an-org-chart

Кто ревьюит код вашего агента — модель сильнее той, что его написала, или та, что подешевле?
  • ❤ 2
  • 🔥 1
More from @vibecodingartem
  1. Sep 22, 2026Многие друзья жалуются, что лимиты стали заканчиваться за 1-3 дня. Я рекомендую вам рассмо…
  2. Sep 22, 2026Лучшее решение этой неделе - подключил ЧатГПТ к Профи.Ру. Закидываю в ЧатГПТ задачу в прос…
  3. Sep 22, 2026Сегодня ожидаем релиз Claude Opus 5.5 (а с ним, надеюсь, и сброс лимитов) #anthropic@rvnik…
  4. Sep 22, 2026Xiaomi выпустила MiMo V2.6 Pro и Flash с открытыми весами Pro — топ-1 в Artificial Analysi…
  5. Sep 22, 2026МиМо - одна из любимиц пользователей ОпенРоутера. В корпоративном сегменте РФ про нее забы…
  6. Sep 21, 2026🐹 Хомка за полторы недели: семейный ассистент, который помнит всё и не путает, кому что П…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →