结论:推理批大小调大,吞吐上升但单请求延迟增加;调小,延迟低但吞吐上不去。找到平衡点,才能在用户体验和成本间取最优。
批大小的影响
一批处理多个请求,能摊薄显存读取成本,整体吞吐提高。但每批越大,单个请求要等更久,首token延迟变差。
怎么调
- 交互场景偏小批,保延迟;
- 批量生成场景偏大批,保吞吐;
- 用连续批处理动态凑批。
在 gpu.topyun.vip 上,租一张卡跑不同批大小实测,看延迟和吞吐曲线,再定参数。
常见疑问
问:批越大越好吗?答:不是,超过显存后反而OOM,要逐步加大观察。
问:交互场景怎么选?答:优先保首token快,批别太大。




