TGViewer
ML Underhood ML Underhood @mlunderhood · 5.05K subscribers
Post #29 2.61K
PPO для YandexGPT 4 Lite

Недавно инженеры Яндекса использовали онлайн-обучение с подкреплением для YandexGPT 4 Lite. На файнтюне этой модели использовались как DPO, так и PPO. Павел Темирчев, один из разработчиков команды алаймента Яндекса, рассказал нам, как внедряли эти методы.

Proximal Policy Optimization (PPO) — метод, который предполагает применение размеченных асессорами данных для обучения reward-модели. Это итеративный и весьма трудоёмкий процесс. Сложность, в частности, заключается в том, что модель должна прямо во время обучения генерировать ответы. Кроме того, необходимо хранить в памяти GPU не только обучаемую, но и ряд вспомогательных моделей. Например, value-модель, которая содержит информацию о наградах и используется в алгоритме как бейзлайн.

Важной частью внедрения PPO для обучения YandexGPT 4 Lite стало создание правильной инфраструктуры — от этого зависит примерно 50% успеха. Кроме того, была проведена большая работа с обучающим множеством. Инженеры перебрали разные варианты того, на чём можно обучать модель.

Также было важно не дать модели переобучиться под reward-модель. Для этого существует практика штрафа, который накладывается, если обучаемая модель слишком далеко ушла от SFT. В Яндексе попробовали применить разные варианты штрафов, чтобы выбрать наиболее подходящий.

Из хаков использовали, например, нормализацию advantage, то есть разницы награды за ответ и средней награды. Этот трюк позволяет получить более стабильную сходимость взамен теоретических гарантий.

На алайменте YandexGPT 4 Lite проводили сперва онлайн RL — PPO, а затем DPO. Комбинация методов позволила получить хорошие результаты, которые превосходят полученные от каждого метода отдельно.

Делитесь своими мыслями о PPO и DPO в комментариях!

ML Underhood
  • ❤ 10
  • 🔥 7
  • 👍 6
More from @mlunderhood
  1. Sep 30, 2026Мы на Interspeech — и не с пустыми руками ¡ɹǝpun uʍop ɯoɹɟ ʎɐp,ƃ Ой.. То есть, привет из А…
  2. Sep 25, 2026Как сделать интерактивного агента с помощью KV‑кеш‑манипуляций AI-ассистенты, роботы и дру…
  3. Sep 21, 2026Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля…
  4. Sep 16, 2026Выпустили агента «Исследовать» в Алисе AI. Рассказываем, почему сделали ставку на обвязку…
  5. Sep 12, 2026Вчера на ECCV послушали кейноут Яна Лекуна — делимся основными тезисами. Лекун начал с кон…
  6. Sep 11, 2026Сегодня мы опенсорсим модель, результатом работы которой пользуются 49,5 млн пользователей…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →