Multi-harness RL: Hugging Face обучает модели прямо внутри Claude Code и Codex
📋 Команда Hugging Face вместе с Liquid AI опубликовала открытый фреймворк и большую статью: маленькую модель LFM2.5-2.6B обучили методом GRPO одновременно в четырёх оболочках для кодинга,- OpenCode, Claude Code, Codex и Mini-SWE-Agent.
Оболочки работают как есть, их код не трогают.
Результат на отложенных задачах: с 42,2% до 54,2% решённых, и на 31% меньше вызовов инструментов на задачах, которые модель и раньше решала.
⚙️ Инженерный ход,- прокси-перехват между оболочкой и моделью.
Прокси записывает промпты и ответы ровно в том виде, в котором их видела и генерировала модель, вместе с лог-вероятностями.
OpenEnv отдаёт эти трассы в TRL, Harbor поставляет задачи и песочницы.
Оболочка сохраняет свои инструменты, сжатие контекста и цикл выполнения: повторять их логику внутри тренажёра не нужно.
💡 Зачем это нужно: одна и та же модель в разных оболочках показывает разные результаты. GLM-5.2 на SWE-bench Pro,- 23% в одной оболочке и 52% в другой (замер Joel Niklaus).
Смена оболочки двигала GLM-5.1 на 13 пунктов, смена модели внутри одной оболочки,- всего на 2,5-5.
Модель учит «как решать задачу в интерфейсе конкретной оболочки», и вне его навык теряется: OpenSWE-32B в непривычной оболочке падает на 59 пунктов. Frontier-лаборатории уже масштабируют число оболочек при обучении: Kimi K3, Qwen3-Coder-Next (шесть оболочек), MiMo-V2.6.
💼 Обучение на траекториях крупной модели (SFT) дало 43,1% против 54,2% у RL: копирование чужого поведения слабее собственной практики.
Фреймворк открытый, Apache-2.0, и маленькая модель после такого обучения одинаково предсказуема во всех оболочках сразу.
Прямой путь к дешёвым агентам на собственных мощностях.
📎 FineEnvs на GitHub,- код сред и обучения
📎 OpenEnv,- прокси и интерфейс сред
#RL #HuggingFace #агенты #OpenSource
———
@tsingular
Post #8779
1.57K

- 🔥 6
- ✍ 3
- ⚡ 1