NVIDIA Model Optimizer:深度学习模型压缩与推理加速库
面向需要把大模型部署到生产环境的开发者,提供量化、剪枝、蒸馏、NAS、投机解码等优化技术,把 Hugging Face、PyTorch 或 ONNX 模型压缩后导出,直接用于 TensorRT-LLM、TensorRT、vLLM、SGLang 等推理框架。
· 支持 PTQ、QAT、剪枝、蒸馏、投机解码、稀疏化,提供 Python API 组合使用
· 量化后模型体积可缩小 2–4 倍,官方教程中 FP8 量化实现 2.6 倍 vLLM 吞吐
· 已开源,可通过 pip install -U nvidia-modelopt[all] 安装,也提供预装容器镜像
Post #1284
13
