🤷♂️ Qwen3.8-Flash-Next не оправдал мои надежды.
Есть у нас вымученный датасет с 89 тасками для агента.
Qwen3.8-27B по качеству сильно опережает Qwen3.8-Flash-Next.
Скорость по tok/s у Flash-Next похожа на 27B-NVFP4.
Тулзов вызывает сильно больше, но даже не смотря на это с задачей справляется хуже, хоть и завершает её быстрее.
Ну и понятное дело, в силу размера модели и новизны архитектуры - тюнить его я даже и не пробовал пока что.
В целом, по трейсам сложилось впечатление, что реальный пре-трейн у модели крайне слабый, как и пост-трейн - примерно на уровне qwen3.5. Видимо в превью как всегда сделали упор на бенчмарках, а не реальных задачах.
Русские знания о мире по моим опять таки ощущениям слабее, чем в qwen3.8-27b. То есть total params + ngram здесь как будто бы ничего не дали.
Возможно в ваших сценариях эта модель и проявит себя лучше.
Тесты проводились на 2 серверах с 4x RTX Pro 6000.
Flash-Next запускался с TP=4 EP=4
Остальные модели PP=4
Post #364
1.23K
EdTech, AI и HighLoad | Блог AK из Школково Оп-паа. Что это тут у нас? Qwen/Qwen3.8-Flash-Next 125B A6B, 512 экспертов(10 routed + 1 shared) на 640d Гибридный аттеншен: GDN + QSA (QwenSparseAttention) - 12 слоев в 3:1 N-gram Embedding И если посмотреть, это прям во многом похоже на мой незавершенный…

- ❤ 13
- 🔥 10
- 👀 6