同样的70B模型,用不同推理框架吞吐量可以差3~5倍,选对推理框架等于把GPU成本直接砍半。vLLM、TensorRT-LLM和Triton各有所长。
一、三大推理框架核心对比
| 框架 | 开发方 | 核心技术 | 吞吐量 | 易用性 |
|---|---|---|---|---|
| vLLM | UC Berkeley | PagedAttention | 高(开源最强) | 极高(几行代码) |
| TensorRT-LLM | NVIDIA | 内核融合+FP8 | 最高(官方优化) | 中等(编译复杂) |
| Triton Inference Server | NVIDIA | 多框架+动态批处理 | 中等 | 中等 |
二、vLLM:最快的开源选择
优势
- PagedAttention技术,KV缓存分页管理,吞吐量比HuggingFace原生高2~4倍;
- 支持主流模型:LLaMA、Qwen、ChatGLM、Mistral等;
- 一行代码启动OpenAI兼容API服务;
- 活跃的开源社区,持续更新新模型支持。
劣势
- 只支持GPU推理,不支持CPU;
- 某些小众模型需要自己适配;
- 生产级特性(多模型路由、灰度发布)需要自己搭。
三、TensorRT-LLM:NVIDIA官方最优
优势
- NVIDIA官方深度优化,支持FP8量化,在H100/A100上性能最优;
- 支持int4/int8/FP8多种精度,吞吐量最高;
- 和TensorRT生态无缝集成。
劣势
- 需要编译模型,上手成本高;
- 新模型支持滞后于vLLM;
- 调试复杂,出问题排查难度大。
四、Triton:生产级服务框架
优势
- 支持多框架(TensorRT、ONNX、PyTorch、Python backend);
- 动态批处理、模型版本管理、灰度发布等生产特性完善;
- 适合混合模型部署(一个服务里跑多个模型)。
劣势
- 本身不优化模型性能,底层还是依赖vLLM或TensorRT;
- 配置复杂,学习曲线陡。
五、选型建议
| 场景 | 推荐框架 | 理由 |
|---|---|---|
| 个人/小团队API服务 | vLLM | 快速启动,性能好 |
| 企业生产API(NVIDIA卡) | TensorRT-LLM | 吞吐量最高,成本最低 |
| 多模型混合部署 | Triton + vLLM后端 | Triton做管理,vLLM做推理 |
| 自定义业务逻辑 | Triton Python backend | 灵活度最高 |
六、性能实测参考(70B INT4,单张A100)
| 框架 | 吞吐量(token/s) | 相对vLLM |
|---|---|---|
| HuggingFace原生 | ~35 | 1×(基准) |
| vLLM | ~140 | 4× |
| TensorRT-LLM(FP8) | ~180 | 5.1× |
需要高性能GPU推理部署,可以参考GPU推理部署方案,提供预配置好vLLM/TensorRT的镜像环境。
七、总结
推理框架的选择直接决定你的GPU能跑多少请求。vLLM是入门首选,TensorRT-LLM是性能极致,Triton是生产级管理。用对了框架,同样的GPU能服务3~5倍的用户量。




