Вчера забыл уточнить что тестил модель с ускорителем MTP. А в этом посте уже попробовал с DFlash2. Кстати, что MTP, что DFlash2, все эти ускорялки вшиты в модель, ничего отдельно качать не надо. Даже vision внутри. Ну не кайф ли.
И так начнем, модель: Qwen 3.8 27B NVFP4
KV-кэш: FP8, concurrency 2, vision включён.
🔹 MTP, draft tokens: 3
• Средняя генерация: ~143 ток/с
• Типичная скорость: 120–175 ток/с
• Acceptance rate: ~64%
• Контекст: 220k
• Cached TTFT: ~0,37 с
🔸 DFlash2, draft tokens: 7
• Средняя генерация: ~166 ток/с
• Длинная генерация: 25 893 токена со скоростью 242 ток/с
• На отдельных интервалах: до ~290 ток/с
• Acceptance rate: ~38%
• Контекст: 160k
• Медианный TTFT: ~0,62 с
Итог от электронной головы: DFlash2 оказался примерно на 16% быстрее в среднем и особенно хорошо разгоняется на длинных ответах. MTP принимает больше draft-токенов и позволяет держать более широкий контекст — 220k против 160k.
Это не строгий синтетический бенчмарк. В реальной работе Claude Desktop с инструментами DFlash2 выглядит быстрее, а MTP — универсальнее для очень длинного контекста.
Быть может вы заметили, нет цифр по префиллу. Вот они:
MTP: около
5 110 ток/сDFlash2: около
3 536 ток/сMTP быстрее по prefill примерно на 45%
По обработке входного контекста MTP заметно быстрее: ~5,1k против ~3,5k ток/с у DFlash2. Поэтому MTP лучше при частой загрузке нового большого контекста, а DFlash2 выигрывает на длинной генерации ответа: ~166 против ~143 ток/с в среднем.
Итог от меня: тут нужно выбрать что тебе важнее контекст или скорость? Либо ты жертвуешь контекстом и префиллом и получаешь на 15-20% больше скорости декода. Либо чувствуешь себя как босс с длинным контекстом и молниеносным префиллом и практически не чувствуешь снижение скорости.
Приятной генерации!