结论:推理时每生成一个token都要把模型权重从显存读一遍,显存带宽直接决定单token速度。很多人只看显存容量,忽略带宽,结果推理慢得离谱。
带宽和容量的区别
容量决定你能不能放下模型,带宽决定你读得多快。推理是访存密集型,带宽不够就算装得下,也跑不快。
怎么选
- 推理优先选带宽高的卡型;
- 训练才更看算力峰值;
- 量化能降低需要读取的权重体积。
在 gpu.topyun.vip 上,选推理用卡时别只看显存大小,结合带宽一起看,实测延迟最准。
常见疑问
问:大显存一定快吗?答:不一定。容量够但带宽低,推理照样慢。
问:怎么提升带宽利用?答:量化和连续批处理能摊薄读取成本,先做软件优化。




