🚩 Fuli Luo опубликовала новую архитектуру HySparse2, на которую перейдёт MiMo V3. Сходство с DeepSeek V4.1 довольно очевидное, да и сама она один из бывших создателей DeepSeek. Однако крайне тревожный момент, что всё больше ситуация напоминает: архитектуры Сбербанка и Яндекса ошиблись, начав копировать модный китайских гибрид GPT+State для тяжелых LLM как в Kimi K3.
Дело в том, что гибрид как в Kimi K3 потенциально сильнее в IQ, т.к. лучше понимает глобальный контекст в своём State. Однако чтобы реализовать это преимущество, нужно иметь суперкластер, аналогичный доступному Kimi, а также очень сложные пайплайны RL-обучения с тысячами песочниц. В случае Сбербанка и Яндекса там нет такого ресурса GPU, а практика Reinforcement Learning ограниченная. Достаточно указать, что Яндекс выпустил только Base-модель своей Алисы без RL, но её хватило, чтобы перебить RL-обучение GigaChat, т.е. у Яндекса недовели RL до конца, у Сбера оно такое слабое, что Base перебить не может у Яндекса. Я уже писал про это по бенчмаркам.
Однако в архитектуре GPT+State есть серьёзная уязвимость для построения «worker-агентов», т.е. агентов-делателей. Для начала DeepSeek и Xiaomi решили опираться на идею YOCO (self-/encoder-часть готовит глобальные KV, которые верхняя/cross-/decoder-часть переиспользует). Это даёт ранний выход из prefill: после self-decoder / causal encoder можно остановиться и не гонять весь prompt через верхние слои. В случае агентов им нужно без конца «префилить» контекст, т.к. они постоянно его перечитывают. Поскольку у DeepSeek и Xiaomi нейросети умеют подготовить векторную репрезентацию контекста и выйти, то они просто громят по эффективности и старые GPT, и GPT+State.
Второй аспект. У DeepSeek и Xiaomi более точное цитирование при маленьких затратах VRAM за счёт разреженного внимания на Top-K лучших токенов. В Mamba-like моделях это огромная проблема, т.к. State сжимает информацию с потерями, поэтому там возникает проблема в точности цитат, что в том же коде сразу же syntax error. Чтобы это решить, и Kimi K3, и GigaChat добавляют слои на Full Attention, чтобы нейросеть лучше видела цитаты, но он чудовищно неэффективен относительно разреженного внимания DeepSeek и Xiaomi по расходу GPU и VRAM.
Проще говоря, сейчас DeepSeek и Xiaomi могут установить феерически низкий ценник по API, что даже сделали, а также делать бессмысленным установку других моделей локально для агентов. Самое время командам Сбера и Яндекса подумать, туда ли они идут. Пытаться сделать «русский Kimi K3» — хорошая идея для маркетинга, но пока задача хотя бы не флешки китайцев догнать, а даже Qwen 3.8 27B. Надо быть реалистичнее в том плане, что ты делаешь не самую умную LLM, но которая полезна как агент-исполнитель, а не агент-думатель. Так вот, агенты-исполнители, похоже, не делаются на гибридах через State лидерами рынка и ведущими учёными в LLM.
https://arxiv.org/pdf/2609.26368
Post #5219
1.8K

- 👍 14
- 🔥 7
- 💯 4
- ❤ 3
- 🏆 1