⚡️ Одна и та же модель набирает 62% в одном агентном харнессе и 33% в другом. Hugging Face показали, как это исправить через RL
Команда Hugging Face выложила подробный гайд по multi-harness RL. Сами харнессы при этом не трогают. Модель подключают к прокси, который понимает все четыре API-формата coding-агентов: OpenAI Chat Completions, OpenAI Responses, Anthropic Messages и Gemini. Прокси записывает точные token ids и logprobs, которые семплировал vLLM, и на них идёт обучение. Claude Code, Codex и OpenCode работают как есть, без единой правки.
Результаты на LFM2.5-2.6B от Liquid AI получились такие. После обучения сразу в четырёх харнессах точность выросла с 42% до 54%. Небольшой бонус за решение задачи за меньшее число шагов сократил вызовы инструментов на 31%. Обучение только в OpenCode подняло сам OpenCode с 34% до 58%, но мульти-харнесс модель стала лучше везде.
Проверили и популярный короткий путь: SFT на 3 189 успешных траекториях Qwen3.8-27B. Имитация упёрлась в 47.5%, это ниже обоих RL-запусков. Копирование большой модели не заменяет практику в среде.
Открыто всё: прокси для записи траекторий в OpenEnv, тренер в TRL (async GRPO), задачи, SFT-данные, код и семь обученных моделей.
https://huggingface.co/spaces/AdithyaSK/multi-harness-rl
@ai_machinelearning_big_data
#HuggingFace
Post #11067
11.2K

- 🔥 64
- ⚡ 52
- 👏 16
- ❤ 12
- 🤔 8
- 🤓 5
- 👍 4