Одна и та же модель в разных агентных харнессах (Claude Code, Codex, OpenCode и др.) показывает сильно разные результаты — 62% против 33%
Причина: каждый харнесс ходит по своему API-формату и циклу инструментов, и модель, обученная в одном, плохо переносится в другие.
Что сделали в Hugging Face
Multi-harness RL — дообучение сразу в нескольких харнессах, не меняя сами харнессы:
- Модель подключают через прокси, который понимает 4 API-формата coding-агентов: OpenAI Chat Completions, OpenAI Responses, Anthropic Messages, Gemini.
- Прокси записывает точные token ids и logprobs, которые отсемплировал vLLM, — на них и идёт обучение.
- Claude Code, Codex, OpenCode работают как есть, без единой правки.
Т.е. схема такая:
1. Qwen3.8-27B прогнали через 4 харнесса, она успешно решила задачи → собрали 3 189 её успешных траекторий (готовых «правильных» решений).
2. Маленькую модель LFM2.5-2.6B обучили имитировать эти траектории (SFT) → получилось 47,5%.
3. Ту же маленькую модель обучили через RL — сама решает задачи в харнессах и учится на своих результатах → 54% (мульти-харнесс) и 58% (только OpenCode).
Результаты (на LFM2.5-2.6B от Liquid AI)
- Обучение сразу в 4 харнессах: точность 42% → 54%.
- Небольшой бонус за решение за меньшее число шагов: вызовов инструментов − 31%.
- Обучение только в OpenCode: сам OpenCode 34% → 58%, но мульти-харнесс модель лучше везде.
Вывод: логика была такая: зачем мучиться с RL, если можно скопировать готовые решения умной модели. Результат: имитация упёрлась в 47,5%, а оба RL-варианта дали больше (54% и 58%). То есть маленькая модель, тупо повторяющая чужие ходы, справляется хуже, чем та же модель, которая сама «наиграла» опыт в среде — при имитации она не понимает, почему ход правильный, и разваливается на задачах, чуть отличающихся от показанных. Отсюда вывод: дистилляция из большой модели не заменяет собственного обучения с подкреплением.
Открыто всё: прокси записи траекторий (OpenEnv), тренер (TRL, async GRPO), задачи, SFT-данные, код, 7 обученных моделей.
Сколько ж денег надо на такое?
Грубая прикидка (ЛЛМ, не авторов): ~92 GPU-часа H100 по рыночным ~$2–3/час — это порядка $200–300 за сам мульти-харнесс прогон, с инфраструктурой песочниц и коллекцией данных — вероятно, до ~$500–1000.
https://huggingface.co/spaces/AdithyaSK/multi-harness-rl
Post #2178
296