结论先行:快速上线选vLLM,追求极致延迟选TensorRT-LLM。两者都是当前主流推理框架,vLLM上手快,TensorRT-LLM性能强但配置复杂。
一、vLLM优势
PagedAttention显存利用率高,部署简单,一行命令启动OpenAI兼容API。支持各种主流模型,社区活跃。中小团队首选。
二、TensorRT-LLM优势
TensorRT编译优化,单query延迟最低,适合高并发在线服务。但需要编译模型,配置复杂,适合有工程能力的团队。
三、怎么选
开发测试和初期上线用vLLM,简单快速。并发量大、延迟敏感时再迁移到TensorRT-LLM。不要一上来就折腾TensorRT-LLM。
四、性能对比
同样70B INT4模型,vLLM单卡4090约每秒30个token,TensorRT-LLM编译后约每秒50个token。差距在长输出和高并发时更明显。
五、部署建议
先用vLLM跑通API,确认业务正确。并发上来后再考虑TensorRT-LLM。不要在业务还没验证时就折腾推理框架优化。
部署推理服务的GPU实例可在GPU算力平台选择合适规格。




