Что: Предложен подход по интеграции обвязки агента прямо в веса модели
Ссылка: https://arxiv.org/pdf/2609.24974
Почему интересно: Исследователи из Пекинского университета, Google и HKUST предлагают оригинальное решение актуальной практической проблемы современного агентного ИИ. Сильный харнесс (обвязка из тулзов, безопасности, управления памятью и т.д.) может поднять результаты слабой модели до уровня топовых, но эти улучшения жёстко привязаны к самому харнессу. На проде приходится либо тащить за собой зоопарк специализированных обвязок для каждой задачи, либо использовать один общий харнесс и мириться с падением качества в нишевых задачах.
Авторы предлагают концепцию агентной дистилляции харнесса. Идея в использовании мощного специализированного харнесса только на этапе обучения (с учителем) и последующего переноса вызванного им поведения прямо в веса модели. В итоге на инференсе модель работает с простейшим минимальным харнесом (вроде обычного bash-терминала), но показывает результаты, как будто к ней подключена вся сложная инфраструктура.
Технически agent-as-harness довольно простой. Сначала эволюционирует сложный харнес под конкретную задачу. Затем его правила адаптируются в приватную инструкцию для отдельной "модели-надзирателя". Базовая "модель-студент" генерирует действия в минимальной среде, а надзиратель перехватывает их до выполнения. Если студент собирается сделать глупость, надзиратель просто переписывает его ответ в рамках доступного студенту пространства действий. Модель файнтюнят на этих исправленных траекториях.
Конечно, для сбора обучающих траекторий нужна очень сильная модель-надзиратель (в статье использовали GPT-5.6 Sol). Эксперименты показывают, что при слабой модели-надзирателе её исправления только вредят модели-студенту. Кроме того, надо учитывать оверхед на сбор данных - каждое действие студента требует (как минимум) 2 вызовов LLM: генерация предложения и его ревью. Это увеличивает задержку и стоимость сбора траекторий более чем в 2 раза.
Подход хорошо применим для работы с процедурными паттернами (например, обязательной проверкой файла перед завершением работы), но не даёт сильных результатов на глубоких доменных знаниях (например, в задачах по химическому ретросинтезу дистиллированная модель так и не догнала базовую модель с подключенным харнессом, потому что сложные химические знания труднее вшить в веса через простые bash-команды).
Фактическим имеем пример сдвига фокуса с непрерывного усложнения инфраструктуры на этапе инференса к умному переносу знаний в веса на этапе обучения. В теории для целого класса простых задач можно один раз потратить вычислительные ресурсы на эволюционное развитие идеальной обвязки для внутренних API, собрать датасет с надзирателем и дообучить компактную open source модель. А на выходе получить легковесную модель, которой для работы нужен только интерпретатор командной строки, но которая хорошо знает все нюансы конкретного домена и не забывает проверять результаты.
#eng #harness #агент #исследование #llm #arxiv
Post #614
59