RTX 3090 上 Qwen3.6-27B 性能提升 2.25 倍
在单张 RTX 3090 上,使用 llama.cpp 并启用 multi-token prediction (MTP) 使 Qwen3.6-27B 的生成吞吐从 35.7 tok/s 提升至 80.2 tok/s,实现 2.25× 加速。
- 更轻量的 ik_llama.cpp 引擎将吞吐提升至 41.9 tok/s,显存降至 17.3 GB。
- 将量化从 Q4_K_M 切换到 IQ4_XS 进一步提升至 47.5 tok/s,显存降至 15.1 GB。
- 开启 MTP(--spec-draft-n-max 3)在同上配置下达到 80.2 tok/s,相当于在同等引擎下单独 MTP 带来约 1.78× 加速。
原文链接
#开发者 #工具
📢 频道:@DevToolboxHub
Post #903
5
