TGViewer
Пятничный ИИ Пятничный ИИ @va_friday_ai · 225 subscribers
Post #614 59
Что: Предложен подход по интеграции обвязки агента прямо в веса модели
Ссылка: https://arxiv.org/pdf/2609.24974
Почему интересно: Исследователи из Пекинского университета, Google и HKUST предлагают оригинальное решение актуальной практической проблемы современного агентного ИИ. Сильный харнесс (обвязка из тулзов, безопасности, управления памятью и т.д.) может поднять результаты слабой модели до уровня топовых, но эти улучшения жёстко привязаны к самому харнессу. На проде приходится либо тащить за собой зоопарк специализированных обвязок для каждой задачи, либо использовать один общий харнесс и мириться с падением качества в нишевых задачах.
Авторы предлагают концепцию агентной дистилляции харнесса. Идея в использовании мощного специализированного харнесса только на этапе обучения (с учителем) и последующего переноса вызванного им поведения прямо в веса модели. В итоге на инференсе модель работает с простейшим минимальным харнесом (вроде обычного bash-терминала), но показывает результаты, как будто к ней подключена вся сложная инфраструктура.
Технически agent-as-harness довольно простой. Сначала эволюционирует сложный харнес под конкретную задачу. Затем его правила адаптируются в приватную инструкцию для отдельной "модели-надзирателя". Базовая "модель-студент" генерирует действия в минимальной среде, а надзиратель перехватывает их до выполнения. Если студент собирается сделать глупость, надзиратель просто переписывает его ответ в рамках доступного студенту пространства действий. Модель файнтюнят на этих исправленных траекториях.
Конечно, для сбора обучающих траекторий нужна очень сильная модель-надзиратель (в статье использовали GPT-5.6 Sol). Эксперименты показывают, что при слабой модели-надзирателе её исправления только вредят модели-студенту. Кроме того, надо учитывать оверхед на сбор данных - каждое действие студента требует (как минимум) 2 вызовов LLM: генерация предложения и его ревью. Это увеличивает задержку и стоимость сбора траекторий более чем в 2 раза.
Подход хорошо применим для работы с процедурными паттернами (например, обязательной проверкой файла перед завершением работы), но не даёт сильных результатов на глубоких доменных знаниях (например, в задачах по химическому ретросинтезу дистиллированная модель так и не догнала базовую модель с подключенным харнессом, потому что сложные химические знания труднее вшить в веса через простые bash-команды).
Фактическим имеем пример сдвига фокуса с непрерывного усложнения инфраструктуры на этапе инференса к умному переносу знаний в веса на этапе обучения. В теории для целого класса простых задач можно один раз потратить вычислительные ресурсы на эволюционное развитие идеальной обвязки для внутренних API, собрать датасет с надзирателем и дообучить компактную open source модель. А на выходе получить легковесную модель, которой для работы нужен только интерпретатор командной строки, но которая хорошо знает все нюансы конкретного домена и не забывает проверять результаты.

#eng #harness #агент #исследование #llm #arxiv
More from @va_friday_ai
  1. Oct 5, 2026Что: NVIDIA Open Agent Safety Platform позволит ограничивать поведение агентов на уровне ж…
  2. Oct 1, 2026Что: Осенний отчёт a16z о состоянии рынков - ИИ-пузырь, триллионные капитальные затраты и…
  3. Sep 30, 2026Что: В MIT задумались о роли образования в эпоху, когда ИИ способен выполнить почти любое…
  4. Sep 28, 2026Что: Осенний open source дамп: суверенная MoE-модель от Яндекса, рассуждающий гигант от Xi…
  5. Sep 27, 2026Что: Matryoshka Attribution помогает найти веса сети, отвечающие за конкретное поведение С…
  6. Sep 25, 2026Что: DeepMind Institute опубликовал сразу 3 эссе о роевом интеллекте, AGI и глобальной пол…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →