在大规模语音识别部署中,单模型占用整块 GPU 往往浪费算力。通过 NVIDIA CUDA MPS 在同一 GPU 上并发运行多个 CUDA 客户端,可在不改写代码的前提下提升利用率。本文在 Amazon EC2 g6e.4xlarge 与 g7e.4xlarge(均配备 48 GB L40S)上实验,找到的最佳并发点是平均延迟 ≤ 650 ms、p99 延迟 ≤ 1 000 ms,此时推理成本比单实例下降约 75%。
实现步骤包括:使用 NVIDIA Triton Inference Server 基础镜像nvcr.io/nvidia/tritonserver:26.03-py3,在 Dockerfile.single 中通过--build-arg LOCAL_NEMO_FILENAME=your_model.nemo将模型打包进镜像,生成parakeet-mps:latest。三层容器化结构保证了职责分离、配置切换和可重复基准测试。
关键经验:并发提升必须以延迟为约束,超过阈值即失去生产价值;实验结束后务必清理 EBS 卷,防止残留费用。对已有模型、GPU 使用率低的 ASR 场景,MPS 与 Triton 的组合提供了低成本的性能提升路径。
nvcr.io/nvidia/tritonserver:26.03-py3
#开发者 #工具 #NVIDIA #AWS #ASR #GPU共享 #Triton
@DevToolboxHub
