TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2404 4.21K
🚀 QWEN представили SAPO - Soft Adaptive Policy Optimization.

Новый метод обучения LLM, делающий RL-тюнинг более стабильным и масштабируемым.

Зачем он нужен?
🔹 Жёсткое ограничение градиентов часто ломает обучение, то они исчезают, то взрываются .
🔹 В MoE-моделях эта нестабильность усиливается ещё больше

Что делает SAPO:
✓ вместо резких границ - плавный «температурный» контроллер
✓ более мягкая зона доверия - без внезапного обнуления градиентов
✓ согласованное поведение на уровне последовательности
✓ адаптация на уровне токенов - сохраняет полезные сигналы и ускоряет обучение
✓ асимметричные температуры - сильный выигрыш по стабильности, особенно для MoE

Что это даёт:
📌 длинные стабильные RL-тренировки
📌 выше точность (Pass@1)
📌 заметный прирост в задачах математики, кода и мультимодальности (например, на Qwen3-VL)


SAPO - шаг к более надёжному и предсказуемому RL-тюнингу больших моделей.

📄 Paper: https://arxiv.org/abs/2511.20347
📚 Blog: https://qwen.ai/blog?id=sapo
🔍 Видео: https://www.youtube.com/watch?v=aQyzIzUw9zI
  • ❤ 11
  • 👍 5
More from @machinelearning_interview
  1. Sep 27, 2026🚨 OpenAI-агенты более 16 000 раз атаковали сайт ООН запросами ради обычных публичных данн…
  2. Sep 26, 2026🚀 LongCat-2.5-Preview: 1.6 трлн параметров и контекст на 1 млн токенов Вышла LongCat-2.5-…
  3. Sep 25, 2026Сингулярность
  4. Sep 25, 2026📋 Китай впервые обошёл США по числу ведущих ИИ-исследователей По данным нового исследован…
  5. Sep 25, 2026Пользователь смотрит видео, листает клипы, ставит лайки — каждое действие становится сигна…
  6. Sep 25, 2026🛡️ Microsoft открыла skill для автоматического поиска рисков в AI-агентах Новый run-asser…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →