TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5927 1.23K
[Перевод] Как сделать модель, которая умеет думать: дообучение через GRPO

DeepSeek наглядно показал: способность рассуждать по шагам реально прокачивается на этапе дообучения. Хочешь такое же поведение от локальной LLM — есть вариант: Group Relative Policy Optimization, он же GRPO.

SFT — это когда модель по сути заучивает шаблоны из примеров. GRPO работает иначе: reinforcement learning. Модель получает фидбек о качестве своих ответов и потихоньку начинает генерить удачные варианты чаще.

Дальше раскладываем, как GRPO стыкуется с современными подходами RLHF и что вообще происходит внутри такого обучения. Читать далее

👉 Telegram | Max
  • ❤ 1
More from @devsp
  1. Sep 23, 2026Код клепается в разы быстрее — а проекты как стояли. Куда утекло ускорение? Александр Саха…
  2. Sep 23, 2026Модель в курсе, что она не в курсе? Как психология 70-х прокачивает твой prompt engineerin…
  3. Sep 23, 2026Гига Писарь: что там за полторы недели после дебютной статьи Автор говорит: с момента выхо…
  4. Sep 22, 2026Китай в отпуске — DeepSeek дешевеет Прикинуть, во сколько реально встаёт использование Dee…
  5. Sep 22, 2026Писать код стало дёшево. Дорого — придумать, нахрена Лет тридцать-сорок весь IT-менеджмент…
  6. Sep 22, 2026[Перевод] ИИ-дилемма: разгоняем рост — или закладываем выживание человечества? Разбираем с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →