⚡️ 100 шагов GRPO на бесплатном Colab подняли structured output у 350M-модели на 7 пунктов
Hugging Face показала, как за 100 шагов GRPO в TRL научить LiquidAI/LFM2.5-350M отдавать валидный JSON: на бенчмарке IFStruct результат вырос с 22.6% до 29.7%, по JSON — с 18.0% до 31.9%. Всё на 16 GB GPU бесплатного Colab или Kaggle.
Данные — около 500 примеров из nvidia/Nemotron-RL-instruction_following-structured_outputs: к 40% добавлена инструкция «верни в fenced code block», ещё 20% превращены в задачи с top-level массивом. Награда из трёх функций на шкале [0, 1]: json_format_reward (1.0 за нужную форму, 0.2 за парсящуюся, но не ту), field_count_reward с линейным штрафом за промах по числу полей и schema_validation_reward по JSON Schema, веса 1.0 / 0.5 / 2.0. GRPO: 8 генераций на промпт, lr 5e-5, temperature 1.1, beta 0.01, LoRA r=16 — учится около 6M параметров, 1.66% модели.
Честная деталь: YAML почти не сдвинулся (27.2% → 27.5%), а Qwen3.5-2B всё равно выше с 33.15%. Но рецепт переносится: если маленькая модель на edge «почти» отдаёт JSON — три reward-функции и вечер на Colab дешевле, чем менять модель.
👉🏻 Канал | 💬 Чат | 📕 Каталог
Post #559
151