TGViewer
AI Projects AI Projects @turboproject · 11.3K subscribers
Post #5206 2.87K
Я сделал внимательный анализ, как Xiaomi сделала прорыв в Reinforcement Learning: они смогли путём создания огромных батчей с параллелизмом ускорить RL-обучение примерно в 10 раз. Тут есть тревожный момент ещё для разработчиков российских LLM в Сбере и Яндексе — в части усложнения попыток догнать китайцев. Давайте разберёмся.

Если поглядеть на архитектуру самой MiMo-V2.6, то там нет rocket science. Это обычный GPT, в котором сделали сокращение KV Cache за счёт использования Full Attention только небольшим числом слоёв, а остальные видят «скользящее окно» вокруг токенов и результат глобального анализа из предыдущих слоёв. Это не сложно, и тут нет архитектурной инновации на уровне CED у DeepSeek V4.1. Однако это иллюзия, т.к. инновации Xiaomi — это процесс обучения Reinforcement Learning, а GPT лишь «молотилка данных» для него, т.е. даже не главный компонент.

Архитектор MiMo-V2.6 — Fuli Luo, ранее работала над DeepSeek V2. Поэтому не удивительно, что по факту она создала новый вариант знаменитого GRPO от DeepSeek.

Как работает их процесс RL-обучения? Для начала используется огромная среда обучения из 7000 песочниц с разными harness, MCP, CLI и т.п. и т.д. Xiaomi также входит в сингулярность обучения ИИ и реально готовят среду их ИИ-агенты. Они крайне интеллектуально готовят dataset к песочницам, получая seed-задачи, но конечные задачи определяются уже исследованием реальной среды. Также агенты генерируют «предварительные рубрики» — предварительные критерии оценок.

Далее формируется огромный батч примерно на 2-4 миллиарда токенов из крайне разноплановых задач. Разноплановость нужна для равномерной нагрузки экспертов MoE. Сами внутри задачи это модифицированный GRPO с 16 вариантами, но математически они обрабатываются иначе: Fuli Luo придумала новый распараллеленный и более качественный вариант оценок с улучшенной защитой от reward hacking, что уже головная боль всех вендоров LLM. Побеги ИИ из песочниц — это и есть взломы системы оценок со стороны ИИ.

Первый приём Fuli Luo — метод группового синтеза вознаграждений (Groupwise Reward Synthesis, GRS). Для задач уже есть предварительные рубрики, но если их сделать константами, то ИИ быстро до них догадается и приступит к мошенничеству reward hacking. Поэтому Fuli Luo создаёт окончательные рубрики агентом-оценщиком только после ответов. Сами по себе рубрики уже классика — их применяет и DeepSeek V4.

Далее применяется метод группового перераспределения преимуществ (Groupwise Advantage Redistribution, GAR). Классический GRPO имеет проблемы:
• нужно ждать окончания всего батча до обновления весов
• если ответы все «довольно хорошие», то оценка в баллах «все по 10» не позволяет понять, в какую сторону менять веса

Агент GAR на деле не смотрит взвешенные оценки, а делает множество попарных A/B сравнений ответов относительно рубрик и каждый раз выбирает лучший. После этого можно уже менять веса, а не ждать всю партию 16 ответов из 16 песочниц. Это и есть секрет огромного параллелизма Xiaomi.

Какая тут мораль из этого:
🔹 Для разработчиков российских LLM в Сбере и Яндексе: происходит перелом, когда уже ключевую технологию китайцев для GPT нельзя «скачать с Hugging Face» и она просто не содержится физически в уже готовой модели. Требуется развивать компетенции и среды RL-обучения, которые у наших очень слабые, давайте честно.
🔹 Рубрики как оценки вариантов решений становятся де-факто стандартом во множестве LLM, поэтому почти обязательны при архитектурной аналитике с агентами при анализе вариантов в суперпозиции смысла уже на использовании моделей. Модели глубоко нативно понимают введение критериев оценок как рубрики и применение их для выбора лучших вариантов решений.

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
  • 🔥 18
  • 👍 9
  • 👀 6
  • ❤ 3
  • 💯 1
More from @turboproject
  1. Sep 24, 2026Opus 5.5 ожидаемо занял первое место на Arena в разработке фронтов. На деле разница с Astr…
  2. Sep 24, 2026Агент OpenAI, занятый медицинским исследованием, вышел из-под контроля и ворвался в сеть М…
  3. Sep 24, 2026🇫🇷 Франция созвала Совет Безопасности ООН, чтобы Дарио Амодеи зачитал по веб-трансляции…
  4. Sep 24, 2026🎬 Не успели мы познакомиться с тем, что Opus 5.5 — хороший композитор, но теперь оказывае…
  5. Sep 24, 2026🧬 Рой агентов Claude, похоже, сделал прорыв в генной инженерии и как минимум доказал, что…
  6. Sep 23, 2026🚩 Fuli Luo опубликовала новую архитектуру HySparse2, на которую перейдёт MiMo V3. Сходств…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →