TGViewer
Vibe Coding: OpenCode, Claude Code, Codex, Cursor, Kilo Vibe Coding: OpenCode, Claude Code, Codex, Cursor, Kilo @prog_ai · 4.52K subscribers
Post #2178 296
Одна и та же модель в разных агентных харнессах (Claude Code, Codex, OpenCode и др.) показывает сильно разные результаты — 62% против 33%

Причина: каждый харнесс ходит по своему API-формату и циклу инструментов, и модель, обученная в одном, плохо переносится в другие.

Что сделали в Hugging Face

Multi-harness RL — дообучение сразу в нескольких харнессах, не меняя сами харнессы:

- Модель подключают через прокси, который понимает 4 API-формата coding-агентов: OpenAI Chat Completions, OpenAI Responses, Anthropic Messages, Gemini.
- Прокси записывает точные token ids и logprobs, которые отсемплировал vLLM, — на них и идёт обучение.
- Claude Code, Codex, OpenCode работают как есть, без единой правки.

Т.е. схема такая:

1. Qwen3.8-27B прогнали через 4 харнесса, она успешно решила задачи → собрали 3 189 её успешных траекторий (готовых «правильных» решений).
2. Маленькую модель LFM2.5-2.6B обучили имитировать эти траектории (SFT) → получилось 47,5%.
3. Ту же маленькую модель обучили через RL — сама решает задачи в харнессах и учится на своих результатах → 54% (мульти-харнесс) и 58% (только OpenCode).

Результаты (на LFM2.5-2.6B от Liquid AI)

- Обучение сразу в 4 харнессах: точность 42% → 54%.
- Небольшой бонус за решение за меньшее число шагов: вызовов инструментов − 31%.
- Обучение только в OpenCode: сам OpenCode 34% → 58%, но мульти-харнесс модель лучше везде.

Вывод: логика была такая: зачем мучиться с RL, если можно скопировать готовые решения умной модели. Результат: имитация упёрлась в 47,5%, а оба RL-варианта дали больше (54% и 58%). То есть маленькая модель, тупо повторяющая чужие ходы, справляется хуже, чем та же модель, которая сама «наиграла» опыт в среде — при имитации она не понимает, почему ход правильный, и разваливается на задачах, чуть отличающихся от показанных. Отсюда вывод: дистилляция из большой модели не заменяет собственного обучения с подкреплением.

Открыто всё: прокси записи траекторий (OpenEnv), тренер (TRL, async GRPO), задачи, SFT-данные, код, 7 обученных моделей.

Сколько ж денег надо на такое?

Грубая прикидка (ЛЛМ, не авторов): ~92 GPU-часа H100 по рыночным ~$2–3/час — это порядка $200–300 за сам мульти-харнесс прогон, с инфраструктурой песочниц и коллекцией данных — вероятно, до ~$500–1000.

https://huggingface.co/spaces/AdithyaSK/multi-harness-rl
More from @prog_ai
  1. Oct 3, 2026Вот что бывает, когда модель становится что ли слишком умной Промпт: Создайте Nokia 3310 с…
  2. Oct 3, 2026Легким движением ЛЛМ pip превращается в Пётр В рубрике #юмор
  3. Oct 3, 2026Как поднять бабла на вайбокодинге? Участие в баунти программах — не благодарите за идею. h…
  4. Oct 3, 2026Гугл нефигово так навернули Colab — добавили туда ИИшку Момент который немного проморгал.…
  5. Oct 3, 2026Vibe Coding: OpenCode, Claude Code, Codex, Cursor, Kilo pinned «Mini-SWE-Agent — минималис…
  6. Oct 3, 2026Mini-SWE-Agent — минималистичный coding-агент от команды SWE-bench (авторы SWE-agent, Прин…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →