TGViewer
Пятничный ИИ Пятничный ИИ @va_friday_ai · 225 subscribers
Post #608 74
Что: HarnessTax - бенчмарк для оценки стоимости обвязки вокруг модели при решении задач разработки
Ссылка: https://harnesstax.github.io/
Почему интересно: Продолжая тему харнесса, исследователи из UC Berkeley и Arena выложили любопытный бенчмарк прогона 21 пары модель + harness (7 моделей и 3 harness от Claude Code, Codex CLI и минималистичный Pi) через SWE-bench Lite и Terminal-Bench 2.0. На каждой задаче были 3 попытки, лимит в 100 итераций и общее ограничение по деньгам (в ценах на 1 сентября 2026 года).
Оказалось, что Claude Fable 5 решает 97.8% задач SWE-bench Lite в Claude Code и 96.7% в Pi. Разница в точности составила всего 1.1 п.п., а вот разница в цене двукратная ($1.33 против $0.67). При этом количество итераций почти одинаковое. Причина, почему Claude Code стоит в два раза дороже, кроется в отправке более чем в 10 раз большего числа токенов на первом вызове, чем у Pi (длинные инструкции, большие схемы инструментов, весь этот "энтерпрайзный балласт").
Этот простой эксперимент ещё наводит на мысль, что нативные обвязки не всегда лучшие для своих же моделей. Так, Claude Opus 4.8 в Codex CLI даёт 88.9% за $0.69 против 86.7% за $0.98 в Claude Code. То есть пользователь заплатит дороже за худший результат, просто потому что взял обвязку по-умолчанию (то, что в работе назвали "harness tax" - скрытый налог за безопасность, аудит, сендбоксинг и прочие корпоративные решения, встроенные в тяжёлые харнесы).
Конечно, сразу следует отметить методологическую слабость в выборе всего 3 харнесов - есть же OpenCode, Hermes Agent, Command Code, Aider, Continue и десятки других. Кроме того, выбор всего 2 базовых бенчмарков SWE-bench Lite и Terminal-Bench 2.0 (задачи починки багов и работы в терминале), да ещё и относительно легковесных, не вполне соответствует суровому энтерпрайзу с легаси-кодом на миллионы строк, внутренними API и специфическими требованиями. Поэтому напрямую обобщать выводы на всю индустрию рискованно.
Наконец, победа именно Pi в тесте была немного предсказуема, поскольку эта обвязка изначально нацеленная на максимальную скорость за счёт игнорирования гардрейлов и сендбоксинга. То есть, в некотором смысле, здесь меньший harness tax обусловлен потенциально меньшей безопасностью. При этом тяжёлые харнесы часто дают не только безопасность, но и лучшую работу с контекстом, управление состоянием, обработку ошибок, глубокую интеграцию с популярными IDE. Pi (со 107 тысячами звёзд на GitHub) не умеет многого из того, что умеет Claude Code, и что востребовано в корпоративном мире.
Тем не менее, HarnessTax - полезный прецедент и повод задуматься над тем, всегда ли нужно брать родную обвязку под модель. Особенно если в конце концов предстоит считать деньги.

#eng #разработка #бенчмарк #harness #harnesstax #pi #ии #агент
  • 🔥 1
More from @va_friday_ai
  1. Oct 5, 2026Что: NVIDIA Open Agent Safety Platform позволит ограничивать поведение агентов на уровне ж…
  2. Oct 1, 2026Что: Осенний отчёт a16z о состоянии рынков - ИИ-пузырь, триллионные капитальные затраты и…
  3. Sep 30, 2026Что: В MIT задумались о роли образования в эпоху, когда ИИ способен выполнить почти любое…
  4. Sep 28, 2026Что: Осенний open source дамп: суверенная MoE-модель от Яндекса, рассуждающий гигант от Xi…
  5. Sep 27, 2026Что: Matryoshka Attribution помогает найти веса сети, отвечающие за конкретное поведение С…
  6. Sep 26, 2026Что: Предложен подход по интеграции обвязки агента прямо в веса модели Ссылка: https://arx…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →