TGViewer
OMG GPT: Midjourney, DeepSeek, IT OMG GPT: Midjourney, DeepSeek, IT @omggpt · 4.15K subscribers
Post #5860 150
Xiaomi обновила Mimo-v2.6 — триллионная MoE-модель с новым RL-подходом

Xiaomi выпустила обновление семейства Mimo-v2.6 — крупной мультимодальной MoE-модели примерно на 1T параметров с 42B активных.

Модель работает с текстом, аудио и визуальными данными. Схема классическая: модальные энкодеры переводят входы в пространство токенов языковой модели. Не совсем omni-подход, но для догоняющих систем — рабочий маршрут. Осилит дорогу идущий, как говорится, даже если идёт через энкодеры.

По вниманию используется гибрид: локальное оконное внимание и глобальное в соотношении 6:1. Это позволяет уменьшить KV-кэш в 7 раз по сравнению с full attention. Для ускорения генерации добавили MTP-декодер со спекулятивным выводом.

Самая интересная часть — обучение через GAR RL.

GAR расшифровывается как Groupwise Advantage Redistribution. Это вариация подходов вроде GRPO, где модель не просто получает бинарный сигнал «прошло / не прошло», а учится различать качество успешных решений.

Для каждой задачи генерируют 16 траекторий. Затем evaluator-модель оценивает их совместно по пяти критериям:
— насколько подход соответствует задаче
— нет ли взлома или обхода условий
— точна ли реализация без лишних fallback-ов
— минимальны ли изменения
— нет ли случайных правок вне задачи
— совпадает ли стиль с окружающим кодом

Прошедшие решения ранжируются: слабые получают меньше положительного подкрепления, сильные — больше. А подтверждённый reward hacking, например скачивание готового патча, обнуляется и считается провалом ещё до ранжирования.

Зачем это нужно? Потому что два решения могут пройти тесты, но быть принципиально разными. Одно аккуратно чинит задачу, другое обходит исключения, ломает стиль или притаскивает готовый ответ из интернета. В обычном RLVR оба могут получить одинаковую награду. GAR пытается научить модель видеть разницу между «работает» и «работает, но лучше бы не надо».

Ещё один важный момент: на стадии RL авторы замораживают роутер экспертов. Иначе при таком масштабе данных тюнинг роутера приводит к коллапсу баланса между экспертами. С замороженным роутером обучение получается стабильнее и быстрее.

Но к метрикам есть вопросы.

Во-первых, результаты получены в одном запуске, внутри одной лаборатории и на одном кластере. Воспроизводимость пока неочевидна.

Во-вторых, сравнения с другими моделями смешивают внутренние оценки и не отделяют вклад RL от архитектуры и пре-трейнинга. То есть мы видим общий результат, но не до конца понимаем, где именно инкремент: в GAR, данных, архитектуре или базовой модели.

В-третьих, улучшения от RL сопровождаются ростом использования токенов. Модель становится сильнее, но начинает думать длиннее — а это уже вопрос цены, latency и продакшен-нагрузок.

Работа:
https://www.alphaxiv.org/abs/2609.mimo-scaling-reinforcement-learning
alphaXiv MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement MiMo-V2.6 presents a large-scale reinforcement-learning framework for improving multimodal agents on long-horizon tasks involving code, tools, visual interfaces, and cybersecurity. By combining...
More from @omggpt
  1. Sep 30, 2026Цифровая муха теперь помогает выбирать, с какой задачи начать Коннектом дрозофилы нашёл не…
  2. Sep 30, 2026Anthropic проверила GLM-5.3 — открытая китайская модель уже умеет искать и эксплуатировать…
  3. Sep 30, 2026OpenAI уже смотрит за горизонт GPT-6 — основные исследования ушли в GPT-7 и GPT-8 Глава Ap…
  4. Sep 30, 2026В Иннополисе сделали ИИ-фреймворк для поиска молекул по их «отпечатку» Исследователи Униве…
  5. Sep 30, 2026Ozon Tech выложил доклады про ML в маркетплейсах Ozon Tech провёл конференцию E-CODE ко Дн…
  6. Sep 29, 2026Gemini сможет сам звонить в компании и пробираться через IVR-меню Google тестирует функцию…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →