GPU虚拟化让一张卡同时服务多个用户或任务,提升利用率3~5倍。MPS、MIG和vGPU三种技术各有适用场景,选错了要么性能损失大,要么隔离性不够。
一、三种GPU虚拟化技术对比
| 技术 | 隔离级别 | 性能损失 | 切分粒度 | 支持卡型 |
|---|---|---|---|---|
| MPS | 软隔离(进程级) | 小于5% | 无固定切分 | 所有NVIDIA GPU |
| MIG | 硬隔离(硬件级) | ~10%~15% | 固定切分(最多7份) | A100/H100 |
| vGPU | 软隔离(时间片) | ~15%~30% | 灵活切分 | 支持GRID的卡 |
二、MPS:多进程服务,性能损失最小
原理
MPS(Multi-Process Service)允许多个CUDA进程共享同一个GPU上下文,避免每个进程各自初始化CUDA的开销,同时提升GPU利用率。
优缺点
- 优点:性能损失极小(小于5%),配置简单;
- 缺点:没有强隔离,一个进程崩溃可能影响其他进程;不保证GPU时间分配;
- 适合:可信团队内部多任务共享同一张卡。
三、MIG:硬件级切分,A100/H100专属
原理
MIG(Multi-Instance GPU)将一张A100/H100从硬件层面切分成最多7个独立实例,每个实例有独立的显存、缓存和计算核心,互不干扰。
MIG切分方案
| 切分方式 | 实例数 | 每实例显存 | 适合任务 |
|---|---|---|---|
| 1g.10gb | 7份 | 10GB | 轻量推理/开发 |
| 2g.20gb | 3份 | 20GB | 中等模型推理 |
| 3g.40gb | 2份 | 40GB | 大模型推理 |
| 完整GPU | 1份 | 80GB | 训练任务 |
优缺点
- 优点:硬件级隔离,安全性最高;性能损失小(~10%);
- 缺点:只能用于A100/H100;切分后固定,不能动态调整;
- 适合:多租户共享GPU、开发测试环境。
四、vGPU:软件时间片切分
原理
vGPU(如NVIDIA GRID)通过软件在多个虚拟机之间时间片复用GPU,每个虚拟机看到完整的GPU,但实际按时间片轮流使用。
优缺点
- 优点:切分灵活,可以动态分配GPU时间比例;支持VM隔离;
- 缺点:性能损失较大(~15%~30%);需要额外的vGPU授权费用;
- 适合:云计算多租户场景、VDI桌面云。
五、选型建议
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 同团队多任务共享 | MPS | 性能最好,配置简单 |
| 多租户生产环境 | MIG(A100/H100) | 硬件隔离安全 |
| 云计算平台多客户 | vGPU | 灵活切分+VM隔离 |
| 4090/消费级卡共享 | MPS | 不支持MIG/vGPU |
六、虚拟化的成本收益
以A100为例:
- 独占使用:GPU利用率约30%,月费1.2万;
- MIG切7份:每份服务一个用户,总利用率提升到70%;
- 单用户分摊成本:1.2万÷7份÷0.7利用率≈2450元/份;
- 相比独占节省约80%。
需要GPU虚拟化部署和资源切分方案,可以咨询GPU虚拟化服务,提供MIG/MPS部署支持。
七、总结
GPU虚拟化是提升利用率的利器,但不是免费的午餐。MPS损失最小适合内部共享,MIG隔离最好适合多租户,vGPU灵活但有授权成本。根据团队信任程度和安全要求选最合适的方案。




