Hugging Face исследовали multi-harness RL: обучение с подкреплением сразу через Claude Code, Codex, OpenCode и Mini-SWE-Agent.
Для этого объединили три проекта:
• OpenEnv записывает обращения к модели, токены и вероятности генерации.
• Harbor запускает одинаковые задачи в контейнерах через разные обвязки.
• TRL использует собранные данные для обучения.
Каждая обвязка сохраняет собственные инструменты, промпты и цикл работы. Модель учится внутри настоящих агентов.
По данным авторов, у LFM2.5-2.6B доля тестовых задач, решённых с первой попытки, выросла с 42,2% до 54,2%. Улучшения появились во всех четырёх обвязках. На задачах, которые решили обе версии модели, обученная использовала на 31% меньше вызовов инструментов.
Эксперимент ограничен одним семейством задач, но показывает перспективный подход: адаптацию к разным обвязкам можно закладывать прямо в обучение.
📖 Руководство: https://huggingface.co/spaces/FineEnvs/multi-harness-rl
Post #3067
1.28K

- 🔥 5
- ❤ 4
- ⚡ 2
- 👍 1