推理服务的三个核心指标——延迟、吞吐量和成本——形成不可能三角:低延迟高吞吐必然高成本,要省钱就必须在延迟或吞吐量上做让步。
一、不可能三角详解
| 目标 | 手段 | 代价 | 适合场景 |
|---|---|---|---|
| 最低延迟 | 大batch不合并+小模型 | 吞吐量低,单位成本高 | 实时对话/搜索 |
| 最高吞吐 | 大batch动态合并+量化 | 单请求延迟增加 | 批量离线处理 |
| 最低成本 | 量化+蒸馏+竞价实例 | 精度或稳定性下降 | 成本敏感业务 |
二、SLO等级与成本对应
| SLO等级 | P99延迟要求 | 可用性 | 所需GPU方案 | 相对成本 |
|---|---|---|---|---|
| 极致(S级) | 小于100ms | 99.99% | A100常驻+多可用区 | 100% |
| 标准(A级) | 小于500ms | 99.9% | A100常驻+单可用区 | ~60% |
| 经济(B级) | 小于2s | 99.5% | 4090+量化+弹性 | ~25% |
| 最低(C级) | 小于10s | 99% | 竞价实例+批量推理 | ~10% |
三、如何找到你的最优平衡点
第1步:明确业务对延迟的真实要求
不是所有场景都需要100ms延迟。实际调研:
- 实时对话:用户能接受的延迟是1~2秒,不是100ms;
- 文档摘要:用户能等10~30秒;
- 批量处理:几小时都没关系。
把延迟要求放宽到业务可接受的最大值,成本可以降50%以上。
第2步:根据流量模式选部署策略
- 稳定流量:包月常驻实例,成本最低;
- 峰谷明显:包月保底+按量弹性;
- 突发流量:全按量或Serverless,接受冷启动延迟。
第3步:用量化换成本
延迟要求不是极致的场景,INT4量化完全够用,成本降75%,延迟反而更低(因为显存带宽瓶颈减小了)。
四、成本优化的优先级排序
- 先量化:INT4量化几乎不影响体验,成本立降70%;
- 再弹性:非高峰时段自动降配或释放,省20%~30%;
- 再蒸馏:把70B蒸馏到7B,成本再降10倍;
- 最后谈价:和供应商谈包月折扣,省10%~20%。
五、成本监控仪表盘
建议建立以下监控指标:
- 每次请求的GPU成本(token成本);
- GPU利用率与请求队列长度;
- P50/P95/P99延迟分布;
- 月度GPU费用与业务收入比。
需要优化推理服务的延迟和成本平衡,可以参考GPU推理成本优化提供的SLO-aware部署方案。
六、总结
推理成本优化的本质是在SLO约束下找到最低成本方案。先明确业务真实要求,再用量化和弹性手段降本,不要盲目追求最高配置。




