🚀 Появился новый движок Strata, который запускает огромную Qwen3.8 Flash Next даже на видеокартах с 12 GB VRAM
Думаю вы уже знаете что Qwen3.8 Flash Next большая MoE-модель, которая требует очень много памяти. Но разработчик нового inference-движка Strata смог распределить её между GPU, оперативной памятью и SSD.
В результате модель уже запускают даже на обычных игровых видеокартах.
На RTX 5070 12 GB при контексте 128K разработчик получил:
• Q2_0 - около 65 tok/s
• IQ2_XS - около 52 tok/s
• IQ3_XXS - около 45 tok/s
• IQ3_S - около 42 tok/s
На коротком контексте скорость ещё выше.
Появились и тесты от других пользователей:
• RTX 5070 Ti - около 86 tok/s на IQ3_XXS при 64K
• RTX 4090 - примерно 58–70 tok/s на IQ3_S при 262K
• даже RTX 2070 8 GB удалось запустить примерно на 20 tok/s
Как это работает?
Strata не пытается полностью загрузить огромную модель в видеопамять.
Самые востребованные части модели находятся на GPU, остальные MoE-эксперты - в RAM, а большая PLE/n-gram память может храниться на SSD.
Таким образом, Flash Next можно запускать даже при относительно небольшом объёме VRAM.
Ещё одна важная функция — кеширование диалога. После первого запроса Strata сохраняет состояние и при следующих обращениях обрабатывает только новый контекст, что особенно важно для AI-агентов и программирования.
Пока у проекта есть ограничения: нет полноценного multi-GPU.
Но сам факт уже интересный: Qwen3.8 Flash Next постепенно превращается из огромной модели для дорогих серверов в LLM, которую можно запускать на обычном домашнем ПК.
Я сам еще не пробовал, но в НАШЕМ ЧАТЕ люди потихоньку запускают, скорость реально повыше.
Линк на движок: https://github.com/Niko1221/Strata
Модели, которые нужны Страте: https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
Пробовали уже?
MrGips • Про LLM / НАШ ЧАТ
Post #210
831