Новая работа Meta-Harness: End-to-End Optimization of Model Harnesses показывает важную вещь: один и тот же LLM может давать радикально разные результаты в зависимости от того, как устроен surrounding system code.
Harness решает:
- что хранить в контексте
- что извлекать из памяти
- какие данные показывать модели
- как вызывать инструменты
- как обрабатывать ошибки и повторные попытки
- как вообще строится workflow агента
На одном и том же benchmark разница между harness может доходить до 6× при неизменной базовой модели.
Авторы предлагают Meta-Harness — внешний optimization loop, который автоматически улучшает код harness.
Вместо одного score он получает доступ к:
code → logs → execution traces → previous attemptsчерез filesystem-like среду и на основе этого переписывает сам harness.
Результаты:
- +7,7 пункта на online text classification относительно сильного SOTA context management
- при этом примерно в 4 раза меньше context tokens
- +4,7 пункта в среднем на retrieval-augmented math reasoning по 5 held-out моделям и 200 задачам уровня IMO
- на agentic coding найденные harness обошли сильные hand-engineered baselines на TerminalBench-2
Главный вывод работы:
вопрос уже не только в том, “какая модель лучше”, а в том, “как построена вся система вокруг модели”.
Для production это напрямую влияет на reliability, tool use, context management, recovery после ошибок и стоимость запуска.
Paper:
https://arxiv.org/abs/2603.28052
