TensorRT 多 GPU 推理能力已在 Dynamo-Triton 中集成
NVIDIA Generativ4 天前
生成式 AI 模型对计算能力和显存容量的需求持续增长,越来越多场景已经超出单块 GPU 能够提供的范围。
NVIDIA TensorRT 多设备推理是一项新能力,允许单个 TensorRT 网络跨多块 GPU 执行,同时继续保留 TensorRT 的推理优化能力。
核心信息
- 单个 TensorRT 网络可以在多块 GPU 上运行。
- 多设备执行使用基于 NCCL 的分布式 collective 通信机制。
- 该能力面向需要更高算力或更大显存空间的生成式 AI 推理场景。
- 从 TensorRT 11.0 开始,该能力获得完整支持。
对模型服务的意义
对于部署大模型或复杂生成式 AI 工作负载的团队来说,多 GPU 推理可以降低单卡资源限制带来的部署压力。通过在 TensorRT 推理优化基础上引入跨设备执行,模型服务系统可以更直接地利用多 GPU 资源,而不必完全依赖单卡承载整个网络。
该能力已集成到 NVIDIA Dynamo-Triton 相关模型服务方案中,目标是简化多 GPU 推理部署流程。
