TGViewer
MrGips • Про LLM MrGips • Про LLM @procomfy · 2.16K subscribers
Post #175 1.24K
MrGips • Про LLM Безумная сборка для 5090 - скорость доходила до 175 т/с Наконец-то я чуть пощупал вот это чудо: https://huggingface.co/neroued/Qwen3.8-27B-nvfp4-NInfer А все началось с этого поста на Reddit, после которого я загорелся проверить действительно ли такие цифры…
Небольшое сравнение NInfer: MTP vs DFlash2 🚀

Вчера забыл уточнить что тестил модель с ускорителем MTP. А в этом посте уже попробовал с DFlash2. Кстати, что MTP, что DFlash2, все эти ускорялки вшиты в модель, ничего отдельно качать не надо. Даже vision внутри. Ну не кайф ли.

И так начнем, модель: Qwen 3.8 27B NVFP4

KV-кэш: FP8, concurrency 2, vision включён.

🔹 MTP, draft tokens: 3
• Средняя генерация: ~143 ток/с
• Типичная скорость: 120–175 ток/с
• Acceptance rate: ~64%
• Контекст: 220k
• Cached TTFT: ~0,37 с

🔸 DFlash2, draft tokens: 7
• Средняя генерация: ~166 ток/с
• Длинная генерация: 25 893 токена со скоростью 242 ток/с
• На отдельных интервалах: до ~290 ток/с
• Acceptance rate: ~38%
• Контекст: 160k
• Медианный TTFT: ~0,62 с

Итог от электронной головы: DFlash2 оказался примерно на 16% быстрее в среднем и особенно хорошо разгоняется на длинных ответах. MTP принимает больше draft-токенов и позволяет держать более широкий контекст — 220k против 160k.

Это не строгий синтетический бенчмарк. В реальной работе Claude Desktop с инструментами DFlash2 выглядит быстрее, а MTP — универсальнее для очень длинного контекста.

Быть может вы заметили, нет цифр по префиллу. Вот они:
MTP: около 5 110 ток/с
DFlash2: около 3 536 ток/с

MTP быстрее по prefill примерно на 45%
По обработке входного контекста MTP заметно быстрее: ~5,1k против ~3,5k ток/с у DFlash2. Поэтому MTP лучше при частой загрузке нового большого контекста, а DFlash2 выигрывает на длинной генерации ответа: ~166 против ~143 ток/с в среднем.

Итог от меня: тут нужно выбрать что тебе важнее контекст или скорость? Либо ты жертвуешь контекстом и префиллом и получаешь на 15-20% больше скорости декода. Либо чувствуешь себя как босс с длинным контекстом и молниеносным префиллом и практически не чувствуешь снижение скорости.

Приятной генерации!
  • 👍 7
  • ❤ 6
More from @procomfy
  1. Sep 22, 2026Alibaba анонсировала Qwen 4 На конференции Apsara алибабаевцы анонсировали Qwen 4. Пока эт…
  2. Sep 21, 2026Чуть потестил Qwen Image 2.1 Вроде неплохо. Правда долговато генерит конврот. Боюсь предст…
  3. Sep 20, 2026Deepseek V4.1 Flash VS GPT-6 Astra VS Qwen 3.8 27B (Ninfer) - Blender и Godot Тест Смотрет…
  4. Sep 20, 2026Qwen Image 2.1 релиз для ComfyUI Разбираем парни: https://huggingface.co/Comfy-Org/Qwen-Im…
  5. Sep 20, 2026Сегодня вечером новое видео Я так преисполнился дешевым Дипсиком V4,1 Flash что решил его…
  6. Sep 20, 2026Qwen-Image-2.1 - открытые веса нового генератора релизнут сегодня! Обратный отсчет тут: ht…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →