Оп-паа. Что это тут у нас?
Qwen/Qwen3.8-Flash-Next
125B A6B, 512 экспертов(10 routed + 1 shared) на 640d
Гибридный аттеншен: GDN + QSA (QwenSparseAttention) - 12 слоев в 3:1
N-gram Embedding
И если посмотреть, это прям во многом похоже на мой незавершенный эксперимент по LLM с нуля, на который так и не хватило ресурсов
По метрикам естественно интереснее Qwen3.8-27B, 3.7-Plus.
Post #361
816

- 🔥 12
- ❤ 1