广告图片
TOP云-靠谱的企业级公有云服务平台

云服务器、物理服务器、云安全、SSL证书限时3折抢购!

双路E5-2640V4(40核)64G内存480G SSD硬盘30M独享带宽物理机仅需368元;香港铂金云服务器2H/2G/15M仅需19.8元/月;4H/4G/25M仅需29.8元/月,

TOP云-靠谱的企业级公有云服务平台:双路E5-2640V4(40核)64G内存480G SSD硬盘30M独享带宽物理机仅需368元;香港铂金云服务器2H/2G/15M仅需19.8元/月;4H/4G/25M仅需29.8元/月,云服务器、物理服务器、云安全、SSL证书限时3折抢购!点击这里立即抢购! 展开广告

LoRA vs QLoRA:微调7B模型怎么选

9 月 16, 2026

结论先行:LoRA用FP16训练,QLoRA用INT4加载+FP16训练。显存不够选QLoRA,显存够选LoRA,效果差别很小。

一、LoRA原理

冻结原模型权重,只训练低秩矩阵。可训练参数只有原模型的0.1%到1%,显存省很多。

二、QLoRA原理

原模型用INT4量化加载,节省75%显存。LoRA部分仍用FP16训练。效果和全量微调接近。

三、显存对比

7B模型LoRA训练约需16GB显存,QLoRA约需10GB。24GB的4090两种都能跑。70B模型QLoRA需要48GB显存。

四、选哪个

显存够选LoRA,速度快精度好。显存不够选QLoRA。两者效果差距在小模型上几乎不可见。

补充:LoRA rank选8到64之间,rank越大效果越好但显存也越大。一般32足够,不需要太大。

微调训练GPU实例可在GPU算力平台选择4090规格。

xtyly

发表回复