推荐系统要在几十毫秒内为用户从海量物品中选出个性化内容,GPU推理是关键。本文给互联网团队一套高并发方案。
一、推荐系统的算力特点
推荐分召回和排序两阶段。召回从海量物品里粗筛,排序对候选精排。排序模型复杂,吃GPU推理;召回相对轻量。线上推理要常年高并发运行。
二、推荐配置
| 阶段 | GPU建议 | 说明 |
|---|---|---|
| 排序推理 | 常驻GPU | 低延迟 |
| 模型训练 | 多卡节点 | 夜间跑 |
| 特征处理 | CPU为主 | 配合GPU |
三、优化建议
- 排序模型量化后推理更快。
- 热点内容做缓存,减少重复推理。
- 训练和推理分开部署。
推荐系统训练是周期性的,云GPU按需起实例。需要训练或优化推荐模型时,可参考GPU推理算力。
实际推荐系统中,排序模型量化后推理延迟显著下降,用户体验更好。热点内容做缓存,相同请求不必重复推理。训练在夜间用多卡节点跑,白天只跑推理。召回阶段相对轻量,不必过度配置。
四、成本建议
训练用云GPU夜间跑,推理常驻,训练推理分离。
推荐团队要持续关注线上指标,点击率、留存变化要和模型版本对应上。每次模型上线做灰度,小流量验证再全量。训练在夜间批量跑,白天只推理。
总之,训练夜间跑、白天只推理,是推荐系统成本最优的分工。
每次模型上线A/B测试,和旧版本对比指标,有提升再全量。
总之,A/B测试驱动模型上线,推荐效果才稳。
热点内容做缓存,减少重复推理。
模型上线做灰度,稳定再全量。
训练夜间批量跑,白天只服务线上。
总之,A/B测试驱动,灰度上线。
每次模型上线和旧版本做A/B对比。
热点内容缓存,减少重复推理开销。
训练和推理分开部署,互不干扰。
模型量化后推理更快,体验更好。
训练用云GPU夜间跑,白天只推理。
推荐系统要持续关注线上指标变化。
常见问题
问:推荐一定要用大模型吗?答:传统深度学习排序已够用,大模型用于内容理解和召回。




