Изучил я пока предварительно технический отчёт по MiMo V2.6. Основной прорыв вендора в кардинальном ускорении Reinforcement Learning за счёт обучения крупными блоками данных. Поэтому они быстрее и дешевле учат модели.
Однако если сравнить MiMo V2.6 и DeepSeek V4.1, то тут есть «тревожный звонок» архитекторам LLM в Сбербанке и Яндексе: начав копировать модный китайский гибрид GPT + Delta State, они могут проиграть с треском конкуренцию Flash-моделям китайцев. Просто всем и так понятно, что даже если вы возьмёте с Hugging Face архитектуру Kimi K3 и запустите обучение в наших условиях, то у вас не выйдет копия Kimi K3. У наших намного меньше ресурса GPU, и на Hugging Face не лежит описание пайплайнов обучения. В реальности Сберу и Яндексу хоть даже не догнать DeepSeek V4.1 и MiMo V2.6, а сделать хотя бы ситуацию, чтобы отставание не выглядело уже неприличным образом, как сейчас. Китайские «флешки» умеют и программировать, и быть сложными агентами, а наши LLM — нет. Так вопрос в том, что обе эти «флешки» у китайцев не используют гибрид GPT + Delta State. Они сидят на доработанном GPT. У DeepSeek доработка сделана через CED, у Xiaomi не так радикально: на доработанном обычном GPT комбинациями глобального и оконного (SWA) внимания между слоями.
Тут как бы не вышло, как в известном меме Матвиенко «копали не туда» (про туннель Метростроя в Питере, который ушёл не туда, а стоил кучу денег).
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
Post #5205
3.1K

- ✍ 20
- ❤ 4
- 👏 3
- 👍 2