TGViewer
MrGips • Про LLM MrGips • Про LLM @procomfy · 2.2K subscribers
Post #210 831
🚀 Появился новый движок Strata, который запускает огромную Qwen3.8 Flash Next даже на видеокартах с 12 GB VRAM

Думаю вы уже знаете что Qwen3.8 Flash Next большая MoE-модель, которая требует очень много памяти. Но разработчик нового inference-движка Strata смог распределить её между GPU, оперативной памятью и SSD.

В результате модель уже запускают даже на обычных игровых видеокартах.

На RTX 5070 12 GB при контексте 128K разработчик получил:

• Q2_0 - около 65 tok/s
• IQ2_XS - около 52 tok/s
• IQ3_XXS - около 45 tok/s
• IQ3_S - около 42 tok/s

На коротком контексте скорость ещё выше.

Появились и тесты от других пользователей:

• RTX 5070 Ti - около 86 tok/s на IQ3_XXS при 64K
• RTX 4090 - примерно 58–70 tok/s на IQ3_S при 262K
• даже RTX 2070 8 GB удалось запустить примерно на 20 tok/s

Как это работает?

Strata не пытается полностью загрузить огромную модель в видеопамять.

Самые востребованные части модели находятся на GPU, остальные MoE-эксперты - в RAM, а большая PLE/n-gram память может храниться на SSD.

Таким образом, Flash Next можно запускать даже при относительно небольшом объёме VRAM.

Ещё одна важная функция — кеширование диалога. После первого запроса Strata сохраняет состояние и при следующих обращениях обрабатывает только новый контекст, что особенно важно для AI-агентов и программирования.

Пока у проекта есть ограничения: нет полноценного multi-GPU.

Но сам факт уже интересный: Qwen3.8 Flash Next постепенно превращается из огромной модели для дорогих серверов в LLM, которую можно запускать на обычном домашнем ПК.

Я сам еще не пробовал, но в НАШЕМ ЧАТЕ люди потихоньку запускают, скорость реально повыше.

Линк на движок: https://github.com/Niko1221/Strata

Модели, которые нужны Страте: https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF

Пробовали уже?

MrGips • Про LLM / НАШ ЧАТ
GitHub GitHub - Niko1221/Strata: Qwen3.8-Flash-Next (125B MoE) on a 8GB+ NVIDIA GPU: one-click install for Windows / Linux. Strata inference… Qwen3.8-Flash-Next (125B MoE) on a 8GB+ NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input. - Niko1221/Strata
  • 🔥 18
  • 🤔 5
More from @procomfy
  1. Sep 28, 2026Попробовал повторить тренд из инстаграма Делал в Minimax H3, стандартный ворк Ref2V. Руки…
  2. Sep 28, 2026Qwen Image 2.1 - несколько примеров как работает режим редактирования Промты: Change all C…
  3. Sep 27, 2026Opus 5.5 + Blender + Unreal Engine У меня нет идей на игры, поэтому делаю прототип разборк…
  4. Sep 27, 2026Qwen 3.8 27B NVFP4 (Ninfer) тоже может в геймдев Не без косяков конечно. 🔥 Запускал я это…
  5. Sep 27, 2026Немного увлекся в Блендере с Opus'ом 5.5 А как вы проводите выходные? MrGips • Про LLM / Н…
  6. Sep 26, 2026Honda Accord созданный Opus 5.5 В комментариях под последним видео люди просили посмотреть…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →