量化模型部署时有GPTQ、AWQ、GGUF三种主流格式,各有适用场景:GPU推理选AWQ或GPTQ,CPU/边缘部署选GGUF,选错了要么跑不动要么精度掉。
一、三种量化格式对比
| 格式 | 底层技术 | 推理框架 | 硬件支持 | 精度保持 |
|---|---|---|---|---|
| GPTQ | 二阶信息量化 | vLLM/AutoGPTQ | NVIDIA GPU为主 | 好 |
| AWQ | 激活感知量化 | vLLM/AutoAWQ | NVIDIA GPU为主 | 更好 |
| GGUF | llama.cpp量化 | llama.cpp/Ollama | CPU/GPU/边缘 | 较好 |
二、GPTQ:最早成熟的GPU量化方案
原理
GPTQ(Generative Pre-trained Transformer Quantization)利用二阶Hessian信息逐层量化,在尽量少精度损失的前提下将权重量化到INT4。
优缺点
- 优点:生态最成熟,支持模型最多,vLLM原生支持;
- 缺点:量化过程较慢(70B模型需要几小时),精度略逊于AWQ。
三、AWQ:当前GPU推理的最优选择
原理
AWQ(Activation-aware Weight Quantization)观察到模型中1%的显著权重对精度影响最大,保留这些权重的高精度,其余量化到INT4。
优缺点
- 优点:精度保持最好,量化速度比GPTQ快,vLLM原生支持;
- 缺点:相对较新,支持的模型数量略少于GPTQ;
- 推荐:2026年GPU推理首选AWQ格式。
四、GGUF:CPU和边缘部署的标配
原理
GGUF是llama.cpp项目推出的模型格式,专为CPU推理和边缘设备优化,支持从F16到2bit的多种量化级别。
优缺点
- 优点:CPU上也能跑大模型,文件格式统一,Ollama一键部署;
- 缺点:GPU推理速度不如vLLM+AWQ,不适合高并发生产环境;
- 适用:本地开发、笔记本部署、边缘设备。
五、不同部署场景的选型建议
| 部署场景 | 推荐格式 | 推理框架 | 理由 |
|---|---|---|---|
| 云端GPU API服务 | AWQ INT4 | vLLM | 速度最快,精度最好 |
| 云端GPU(兼容性优先) | GPTQ INT4 | vLLM/AutoGPTQ | 支持模型最多 |
| 本地笔记本开发 | GGUF Q4_K_M | Ollama/llama.cpp | CPU/GPU都能跑 |
| 边缘设备部署 | GGUF Q4/Q5 | llama.cpp | 资源占用最小 |
| 多模型混部 | AWQ INT4 | vLLM | 单卡多模型高效调度 |
六、量化精度级别怎么选
| 量化级别 | 显存(70B) | 精度损失 | 推荐度 |
|---|---|---|---|
| FP16 | 140GB | 无 | 高精度场景 |
| INT8 | ~70GB | 小于1% | 高精度生产 |
| INT4(Q4) | ~35GB | 1%~3% | 推荐(性价比最优) |
| INT3(Q3) | ~26GB | 3%~8% | 仅边缘/极低资源 |
| INT2(Q2) | ~18GB | 10%+ | 不推荐 |
七、实战建议
- 云端生产推理:直接用AWQ INT4,vLLM部署,性能和精度的最佳平衡点;
- 本地开发调试:用Ollama+GGUF,一行命令跑起来;
- 先量化后评估:下载量化模型后必须在业务测试集上验证精度,不能只看MMLU分数;
- 关注社区:HuggingFace上已有大量预量化模型,直接下载使用即可。
需要GPU推理服务器运行量化模型,可以参考GPU量化推理部署,提供预配置vLLM环境的GPU实例。
八、总结
AWQ是当前GPU推理的量化首选,GGUF是本地/边缘的标配,GPTQ是兼容性兜底。INT4量化是性价比的甜蜜点——精度损失可接受,显存省75%。




