TGViewer
Сергей Булаев AI 🤖 Сергей Булаев AI 🤖 @sergiobulaev · 12.6K subscribers
Post #1606 4.85K
Харнесс (Agent Harness) 🧗

#ИИНЦИКЛОПЕДИЯ

Программная оболочка, внутри которой модель превращается в агента.

История появления

Слово пришло из альпинизма: harness — страховочная обвязка. Устоявшегося русского термина пока нет — говорят «харнесс» или «обвязка». Первым популярным харнессом стал Claude Code, и нейтральным он не был: его собирали под модели одной лаборатории. За 2026 год тема выросла в отдельную дисциплину, harness engineering: обзор насчитывает 110+ работ.

Почему это важно

Формула простая: агент = модель + харнесс. Разрыв уже измерили. GPT-5.5 в обвязке Cursor выдаёт 87.2% рабочего кода, та же самая модель в нативном Codex — 61.5%. Двадцать шесть пунктов, веса не тронуты. Это больше, чем разрыв между поколениями моделей.

Из чего состоит:

- Системный промпт — инструктаж новичка в первый день. Уходит в модель заново с каждым запросом
- Инструменты — код, который модель может вызвать. Харнесс их описывает, но не решает, когда применять .. решает модель
- Агентный цикл — модель смотрит на результат вызова и сама решает: искать ещё раз, посчитать, закрыть задачу
- Слой трансляции — позволяет подставить в тот же цикл модель Anthropic, OpenAI или открытую

Применение на практике

В мае вышел Harness-Bench: 106 задач, шесть харнессов на восьми моделях, 5194 прогона. Лучшая обвязка — 76.2%, худшая — 52.4%. Победитель потратил меньше токенов, чем отставшие: длинная траектория значит, что агент не сходится. И сильные модели держат удар при плохой обвязке, а слабые проваливаются .. харнесс окупается тем сильнее, чем дешевле модель. В июне агент правил собственную обвязку по трассам своих провалов при замороженной модели: проходимость выросла с 40.5% до 61.9%.

Подводные камни

Харнесс чинит работоспособность, но не безопасность: в том же замере функциональность выросла на 26 пунктов, а доля безопасного кода — с 20.1% до 23.5%. Оба агента писали дырявый код в четырёх случаях из пяти.

Без внешнего эталона модель сверяет ответ сама с собой. В бенчмарке JuliaHub модель тихо сократила время симуляции с 5 секунд до 3 и проверялась на укороченном отрезке. Проверки сошлись.

Сравнивать модели по лидербордам без указания харнесса бессмысленно — об этом в мае вышла отдельная работа.

Что почитать/посмотреть:

- Harness-Bench, arXiv 2605.27922 — самый честный замер обвязок
- Stop Comparing LLM Agents Without Disclosing the Harness — почему лидерборды врут
- Harness engineering у Мартина Фаулера — как строить проверки, а не только читать про них
- Документация хуков Claude Code — если хотите проверки, которые агент не обойдёт

Сергей Булаев AI 🤖 - об AI и не только
More from @sergiobulaev
  1. Sep 15, 2026Второй год учусь получать лиды для своих клиентов через LinkedIn. За это время сложилась с…
  2. Sep 14, 2026Claude Fable разгадал шифр, который не поддавался 370 лет В 1653 году шотландский роялист…
  3. Sep 9, 2026С окказией немного занимался нашим опенсорсным проектом, который мы достаточно активно исп…
  4. Sep 9, 2026Во Флориде внезапно для самого себя увлёкся стендовой стрельбой. На самом деле Макс меня в…
  5. Sep 8, 2026Несколько свежих примеров того, что сейчас делают Астрой Человек скормил модели обычную фо…
  6. Sep 8, 2026Семь моделей получили по 300 долларов и задание заработать Bottleneck Labs выдали семи топ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →