TGViewer
AI Projects AI Projects @turboproject · 11.2K subscribers
Post #5219 1.8K
🚩 Fuli Luo опубликовала новую архитектуру HySparse2, на которую перейдёт MiMo V3. Сходство с DeepSeek V4.1 довольно очевидное, да и сама она один из бывших создателей DeepSeek. Однако крайне тревожный момент, что всё больше ситуация напоминает: архитектуры Сбербанка и Яндекса ошиблись, начав копировать модный китайских гибрид GPT+State для тяжелых LLM как в Kimi K3.

Дело в том, что гибрид как в Kimi K3 потенциально сильнее в IQ, т.к. лучше понимает глобальный контекст в своём State. Однако чтобы реализовать это преимущество, нужно иметь суперкластер, аналогичный доступному Kimi, а также очень сложные пайплайны RL-обучения с тысячами песочниц. В случае Сбербанка и Яндекса там нет такого ресурса GPU, а практика Reinforcement Learning ограниченная. Достаточно указать, что Яндекс выпустил только Base-модель своей Алисы без RL, но её хватило, чтобы перебить RL-обучение GigaChat, т.е. у Яндекса недовели RL до конца, у Сбера оно такое слабое, что Base перебить не может у Яндекса. Я уже писал про это по бенчмаркам.

Однако в архитектуре GPT+State есть серьёзная уязвимость для построения «worker-агентов», т.е. агентов-делателей. Для начала DeepSeek и Xiaomi решили опираться на идею YOCO (self-/encoder-часть готовит глобальные KV, которые верхняя/cross-/decoder-часть переиспользует). Это даёт ранний выход из prefill: после self-decoder / causal encoder можно остановиться и не гонять весь prompt через верхние слои. В случае агентов им нужно без конца «префилить» контекст, т.к. они постоянно его перечитывают. Поскольку у DeepSeek и Xiaomi нейросети умеют подготовить векторную репрезентацию контекста и выйти, то они просто громят по эффективности и старые GPT, и GPT+State.

Второй аспект. У DeepSeek и Xiaomi более точное цитирование при маленьких затратах VRAM за счёт разреженного внимания на Top-K лучших токенов. В Mamba-like моделях это огромная проблема, т.к. State сжимает информацию с потерями, поэтому там возникает проблема в точности цитат, что в том же коде сразу же syntax error. Чтобы это решить, и Kimi K3, и GigaChat добавляют слои на Full Attention, чтобы нейросеть лучше видела цитаты, но он чудовищно неэффективен относительно разреженного внимания DeepSeek и Xiaomi по расходу GPU и VRAM.

Проще говоря, сейчас DeepSeek и Xiaomi могут установить феерически низкий ценник по API, что даже сделали, а также делать бессмысленным установку других моделей локально для агентов. Самое время командам Сбера и Яндекса подумать, туда ли они идут. Пытаться сделать «русский Kimi K3» — хорошая идея для маркетинга, но пока задача хотя бы не флешки китайцев догнать, а даже Qwen 3.8 27B. Надо быть реалистичнее в том плане, что ты делаешь не самую умную LLM, но которая полезна как агент-исполнитель, а не агент-думатель. Так вот, агенты-исполнители, похоже, не делаются на гибридах через State лидерами рынка и ведущими учёными в LLM.

https://arxiv.org/pdf/2609.26368
  • 👍 14
  • 🔥 7
  • 💯 4
  • ❤ 3
  • 🏆 1
More from @turboproject
  1. Sep 24, 2026🧬 Рой агентов Claude, похоже, сделал прорыв в генной инженерии и как минимум доказал, что…
  2. Sep 23, 2026Лян Вэньфэн — создал DeepSeek, который лидер Flash-моделей Ян Чжилинь — создал Kimi, котор…
  3. Sep 23, 2026📉 Хороший пример краха «ларечного мышления в бизнесе», которое свойственно не только росс…
  4. Sep 23, 2026🎼 Claude Opus 5.5 в лидерах бенчмарков по композиции классической музыки. Auggie отмечает…
  5. Sep 23, 2026🚀 Qwen Image 2.1 стал самой мощной открытой моделью редактирования изображений на LM Aren…
  6. Sep 23, 2026📉 ИИ становится дешевле и доступнее, чем любая другая трансформационная технология в исто…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →