Я сделал внимательный анализ, как Xiaomi сделала прорыв в Reinforcement Learning: они смогли путём создания огромных батчей с параллелизмом ускорить RL-обучение примерно в 10 раз. Тут есть тревожный момент ещё для разработчиков российских LLM в Сбере и Яндексе — в части усложнения попыток догнать китайцев. Давайте разберёмся.
Если поглядеть на архитектуру самой MiMo-V2.6, то там нет rocket science. Это обычный GPT, в котором сделали сокращение KV Cache за счёт использования Full Attention только небольшим числом слоёв, а остальные видят «скользящее окно» вокруг токенов и результат глобального анализа из предыдущих слоёв. Это не сложно, и тут нет архитектурной инновации на уровне CED у DeepSeek V4.1. Однако это иллюзия, т.к. инновации Xiaomi — это процесс обучения Reinforcement Learning, а GPT лишь «молотилка данных» для него, т.е. даже не главный компонент.
Архитектор MiMo-V2.6 — Fuli Luo, ранее работала над DeepSeek V2. Поэтому не удивительно, что по факту она создала новый вариант знаменитого GRPO от DeepSeek.
Как работает их процесс RL-обучения? Для начала используется огромная среда обучения из 7000 песочниц с разными harness, MCP, CLI и т.п. и т.д. Xiaomi также входит в сингулярность обучения ИИ и реально готовят среду их ИИ-агенты. Они крайне интеллектуально готовят dataset к песочницам, получая seed-задачи, но конечные задачи определяются уже исследованием реальной среды. Также агенты генерируют «предварительные рубрики» — предварительные критерии оценок.
Далее формируется огромный батч примерно на 2-4 миллиарда токенов из крайне разноплановых задач. Разноплановость нужна для равномерной нагрузки экспертов MoE. Сами внутри задачи это модифицированный GRPO с 16 вариантами, но математически они обрабатываются иначе: Fuli Luo придумала новый распараллеленный и более качественный вариант оценок с улучшенной защитой от reward hacking, что уже головная боль всех вендоров LLM. Побеги ИИ из песочниц — это и есть взломы системы оценок со стороны ИИ.
Первый приём Fuli Luo — метод группового синтеза вознаграждений (Groupwise Reward Synthesis, GRS). Для задач уже есть предварительные рубрики, но если их сделать константами, то ИИ быстро до них догадается и приступит к мошенничеству reward hacking. Поэтому Fuli Luo создаёт окончательные рубрики агентом-оценщиком только после ответов. Сами по себе рубрики уже классика — их применяет и DeepSeek V4.
Далее применяется метод группового перераспределения преимуществ (Groupwise Advantage Redistribution, GAR). Классический GRPO имеет проблемы:
• нужно ждать окончания всего батча до обновления весов
• если ответы все «довольно хорошие», то оценка в баллах «все по 10» не позволяет понять, в какую сторону менять веса
Агент GAR на деле не смотрит взвешенные оценки, а делает множество попарных A/B сравнений ответов относительно рубрик и каждый раз выбирает лучший. После этого можно уже менять веса, а не ждать всю партию 16 ответов из 16 песочниц. Это и есть секрет огромного параллелизма Xiaomi.
Какая тут мораль из этого:
🔹 Для разработчиков российских LLM в Сбере и Яндексе: происходит перелом, когда уже ключевую технологию китайцев для GPT нельзя «скачать с Hugging Face» и она просто не содержится физически в уже готовой модели. Требуется развивать компетенции и среды RL-обучения, которые у наших очень слабые, давайте честно.
🔹 Рубрики как оценки вариантов решений становятся де-факто стандартом во множестве LLM, поэтому почти обязательны при архитектурной аналитике с агентами при анализе вариантов в суперпозиции смысла уже на использовании моделей. Модели глубоко нативно понимают введение критериев оценок как рубрики и применение их для выбора лучших вариантов решений.
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
Post #5206
2.87K

- 🔥 18
- 👍 9
- 👀 6
- ❤ 3
- 💯 1