Разработчики Alibaba отказались от гибридной версии Qwen3-235B-A22B, но выпустили две модели: instruct и thinking, последняя заточена под длинные сложные цепочки рассуждений; метрики ризонинга значительно улучшились по сравнению с майским релизом, а на кодинг и мат. бенчмарках она вроде как почти SOTA.
А сразу после релиза команда опубликовала статью 🔗«Group Sequence Policy Optimization» (GSPO). И статья эта вскрывает фундаментальную и почти «незаметную» проблему (пока не начал тренить модель 😄) в популярном алгоритме GRPO (Group Relative Policy Optimization)
Разберемся подробнее
✨| GRPO и RLVR: как сошлись две гениальные идеи
Рабочая лошадка, на которой держится весь современный «ризонинг» это RL. Долгое время стандартом был алгоритм PPO (Proximal Policy Optimization).
Прорыв случился, когда сошлись две мощные идеи. Первая — алгоритм GRPO, предложенный командой DeepSeek. Они предложили отказаться от модели-критика. Это значит меньше затрат памяти и вычислений, да и натренить надженого критика обычно задача непростая. Вместо того, чтобы сравнивать ответ с предсказанием «критика», мы сравнивам его с другими ответами модели: генерим набор вариантов, оцениваем каждый и считаем «хорошим» тот, что оказался лучше среднего по группе (см. картинку).
Вторая идея — RLVR (RL from Verifiable Rewards). Она позволила снизить зависимость от субъективной человеческой разметки в пользу проверяемых правил (например, код проходит тесты или ответ в задаче по математике совпадает с верным).
С этого момента начался стремительный прогресс ризонинга. Недавно даже набрела на 🌸занимательный пост от ресерчера из OpenAI, где автор предлагает идею verifier’s law: All tasks that are possible to solve and easy to verify will be solved by AI.
🥹 | Проблема: противоречивые сигналы
Вообще, цель GRPO в том, чтобы слегка подкрутить веса, поощряя модель за правильные ответы. Если ответ лучше среднего, то увеличиваем вероятность каждого токена в нем.
Теперь представьте, что на вопрос «Кто изобрел лампу накаливания?» модель среди других кандидатов сгенерила верный ответ: «Томас Эдисон». За это она получает большую награду (см. картинку). Но GRPO работает на уровне токенов. В ходе тренировки, после очередного обновления, вероятность всей фразы в текущей политике «Томас Эдисон» может и возросла, но вероятность какого-то одного или нескольких токенов могли немного снизиться. Влияние таких low probability токенов может нарастать и приводить к коллапсу тренировки, особенно если цепочка рассуждений длинная. Взгляните, как это выглядит в objective function GRPO (см. картинку):🟠константная награда А, одна на всю последовательность;🔴importance sampling, для каждого токена свой, и это источник дисперсии
PPO, благодаря модели-критику, также и награду считает для каждого токена, фильтруя шумы. GRPO же в связке с sequence-level reward применяет одну и ту же награду ко всей последовательности, но штрафует или поощряет каждый токен на основе локального изменения его вероятности.
По наблюдениям авторов эта нестабильность еще сильнее при тренировке MoE, после нескольких градиентных апдейтов для одной и той же последовательности активируются разные эксперты, приходилось прибегать к костылям типо Routing Replay.
🐱 | Решение: согласовать масштабы
Авторы предлагают простую идею: если мы выдаем награду за всю последовательность, то и importance sampling должен быть один на всю последовательность. В GSPO этот коэффициент показывает, насколько новая версия модели (current policy) стала увереннее в этой последовательности в целом, и ее легко можно посчитать через sequence likelihood. Теперь градиенты каждого токена в последовательности получают один и тот же вес в соответствии с качеством всего ответа (см. картинку)
Итог — авторы добились значительного роста стабильности и производительности, особенно на сложных задачах и длинных цепочках рассуждений. Это именно то, что мы и видим на бенчмарках. Возможно, именно GSPO станет новым, более надежным фундаментом для обучения ризонеров.
Post #53
574




- 👍 13
- ❤ 5
- 👀 3