TGViewer
Книжный куб Книжный куб @book_cube · 15.8K subscribers
Post #5053 431
Annotated_An_Empirical_Study_of_Harness_Design_for_Coding_Agents.pdf7.7 MB
Проектирование обвязки для кодинговых агентов: что даёт обвязка (Рубрика #AI4SDLC)

С большим интересом прочитал сентябрьскую статью этого года "An Empirical Study of Harness Design for Coding Agents", в которой авторы пытались ответить на вопрос, а какая часть обвязки и насколько помогает: план, инструменты или управление контекстом (авторы остановились на этих трех фактора).

Вообще, авторы по классике определяют harness как среду, которая даёт модели инструменты, поддерживает ход работы и определяет, какую историю она видит. Для этой статьи авторы из UMass Amherst, Emory, UNC Charlotte и Zoom собрали свою модульную обвязку и меняли компоненты при фиксированном цикле исполнения.

Сама статья пока представлена в виде препринта на arxiv, есть обсуждение на Hacker News, но на крупную конфу ее еще не подавали. Но методология статьи вполне серьёзная:
1) Четыре модели: Nemotron-3 на 30B, 120B и 550B плюс Mistral Medium 3.5; 176 конфигураций, окна 32k–128k
2) Для измерения успеха и стоимости задач выбраны два бенча: SWE-Bench Verified (500 задач из Python-репозиториев) и Terminal-Bench 2.1 (89 терминальных задач)
3) Сравнения парные, на одних и тех же задачах: тест Мак-Немара учитывает, кому достались несовпадающие успехи и провалы. Benjamini–Hochberg ограничивает ожидаемую долю ложных находок при множестве сравнений

Основные результаты авторы примерно такие

1️⃣ Управление контекстом прежде всего позволяет агенту продолжить работу
На SWE-Bench средний выигрыш управляемых стратегий над T0 (без управления) сокращается с 35,7 процентного пункта при 32k до 2,7 при 128k. Переполнения у T0 падают с 78,7% до 8,7%. По траекториям агент действует примерно так же, но успевает дойти до исправления и проверки. Улучшение самого рассуждения этим не установлено.

2️⃣ Дешёвая очистка истории перед суммаризацией даёт хороший баланс
T4 сначала убирает объёмные старые выводы, затем при необходимости суммирует историю: дорогие вызовы суммаризации нужны реже. При усреднении по четырём окнам у неё близкая успешность и минимальная средняя стоимость среди управляемых стратегий в семи из восьми пар «модель — бенчмарк». Но по успешности она выигрывает не каждую конфигурацию.

3️⃣ Сохранённая память почти не востребована
Добавление возврата старых сообщений, T2 против T1, устойчивого прироста не даёт: средняя разница −0,36 процентного пункта. В 36 из 64 конфигураций T2/T4 инструмент recall_event вообще не вызывался. Его описание само предлагает заново прочитать файл или повторить команду. Это результат о конкретном механизме возврата; бесполезность внешней памяти вообще он не доказывает.

4️⃣ План помогает слабой модели продолжать, а сильной — вовремя закончить
Для Nemotron-3 30B успешность SWE-Bench растёт с 13,6% до 25,2%, стоимость тоже растёт. Без плана 68,6% запусков заканчиваются без правки, с планом — 27,8%. У 550B и Mistral, по анализу траекторий, сокращается повторная проверка: расчётная стоимость падает примерно на 30% и 32%, успешность — на 2 и 0,4 пункта. Один компонент помогает справляться с разными проблемами.

5️⃣ Shell может сделать действия крупнее и дешевле, но результат зависит от задачи
Для 550B переход к bash-only на SWE-Bench повышает успешность с 65,8% до 69,4%, снижая стоимость с $2,33 до $1,11. Правки крупнее, взаимодействий меньше. У Mistral там же успешность падает с 68,6% до 45,4%, а на Terminal-Bench растёт с 37,08% до 43,82% — вместе со стоимостью. Размер модели сам по себе не определяет подходящий интерфейс.

Красным отметил ограничения: по одному запуску на задачу; план и инструменты проверены только при 128k с одной стратегией контекста; вместе с инструментами меняются инструкции и автоматические проверки. И два семейства моделей — пока узкая база для универсальных рецептов.

Отдельно стоит отметить, что авторы хорошо анализировали траектории работы агентов, чтобы интерпретировать результаты (это стоит забрать себе для проведения экспериментов).

Во вторник, 13 октября, разберём этот whitepaper в эфире Research Insights Made Simple

#AI4SDLC #Agents #Evals #Engineering #SystemDesign #Software
  • 👍 2
  • 🔥 2
More from @book_cube
  1. Oct 10, 2026AI и платформа данных / Как подключить AI ко всей совокупности данных организации (Рубрика…
  2. Oct 10, 2026The Forward Deployed Engineer — Paden Gayle (Рубрика #Books) Paden Gayle начал писать книг…
  3. Oct 10, 2026YC Paper Club: что дальше после LLM + GPU? (Рубрика #AI) Интересное видео для тех, кто хоч…
  4. Oct 9, 2026The Man from the Future: The Visionary Life of John von Neumann (Человек из будущего. Жизн…
  5. Oct 9, 2026Материалы Research Insights #34: долгоживущие агенты и передача работы (Рубрика #AI4SDLC)…
  6. Oct 9, 2026Заходите на прямой эфир Research Insights - сегодня серия с обсуждением мартовской статьи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →