结论先行:推理优先INT4,显存减半速度翻倍;训练保持FP16不要量化。INT4和INT8的选择主要看显存预算和精度要求。
一、INT4量化
70B模型INT4约需40GB显存,48GB的L40S或24GB的4090配合offload都能跑。精度损失很小,业务场景几乎无感。
二、INT8量化
70B模型INT8约需80GB显存,需要A100 80GB。精度比INT4略好,但显存需求翻倍。适合对精度要求稍高的场景。
三、训练不要量化
训练时梯度和优化器状态不支持INT4,量化只用于推理。训练保持FP16或BF16,训练完再量化部署。
四、量化工具选择
GPTQ和AWQ是两种主流INT4量化方案,AWQ精度略好。llama.cpp支持GGUF格式量化,适合CPU推理。vLLM内置量化支持,直接加载量化模型即可。
五、什么时候不该量化
高精度场景如数学推理、代码生成,量化后精度下降明显。这类场景保持FP16,不要省显存。
需要推理大模型的GPU实例,可在GPU算力平台选择48GB显存规格。




