[Перевод] Как сделать модель, которая умеет думать: дообучение через GRPO
DeepSeek наглядно показал: способность рассуждать по шагам реально прокачивается на этапе дообучения. Хочешь такое же поведение от локальной LLM — есть вариант: Group Relative Policy Optimization, он же GRPO.
SFT — это когда модель по сути заучивает шаблоны из примеров. GRPO работает иначе: reinforcement learning. Модель получает фидбек о качестве своих ответов и потихоньку начинает генерить удачные варианты чаще.
Дальше раскладываем, как GRPO стыкуется с современными подходами RLHF и что вообще происходит внутри такого обучения. Читать далее
👉 Telegram | Max
Post #5927
1.23K

- ❤ 1