Anthropic в статье про Claude Code в больших проектах прямо называет мифом идею, что возможности агента определяет модель. Команды смотрят на бенчмарки и тестовые задачи, а на практике результат сильнее определяет harness, то есть вся экосистема вокруг модели:
CLAUDE.md, hooks, skills, сценарии прогонов и проверок, сам способ взаимодействия с агентом.Полгода я по сути проверял этот тезис на себе. С января собираю свой воркфлоу вокруг ИИ-агентов и пришёл ровно к тому же выводу. Ключевое не в том, какая стоит модель, а в том, как настроены агенты, как устроено их взаимодействие, какие заданы сценарии прогонов и шаги проверки. Вот это та часть, в которую стоит вкладывать время.
Отсюда следует неприятная для индустрии вещь. Тесты моделей в изоляции, когда задачи просто прогоняют на голой модели, почти нерепрезентативны. Когда говорят, что OpenAI обходит Claude Code или наоборот, сравнение чаще меряет не модели, а то, как конкретный человек всё настроил. Модели плюс-минус одного поколения при равной обвязке дают очень схожий результат. А при хорошем мастерстве настройки даже слабую модель можно вытянуть на отличный результат.
Практический вывод для меня такой: не гнаться за свежей моделью в каждом релизе, а вкладываться в harness. Он переносится с модели на модель и окупается на каждой сессии, чего про эффект от простой смены модели не скажешь.
#ClaudeCode #AI #ИИ #Anthropic