结论先行:LoRA用FP16训练,QLoRA用INT4加载+FP16训练。显存不够选QLoRA,显存够选LoRA,效果差别很小。
一、LoRA原理
冻结原模型权重,只训练低秩矩阵。可训练参数只有原模型的0.1%到1%,显存省很多。
二、QLoRA原理
原模型用INT4量化加载,节省75%显存。LoRA部分仍用FP16训练。效果和全量微调接近。
三、显存对比
7B模型LoRA训练约需16GB显存,QLoRA约需10GB。24GB的4090两种都能跑。70B模型QLoRA需要48GB显存。
四、选哪个
显存够选LoRA,速度快精度好。显存不够选QLoRA。两者效果差距在小模型上几乎不可见。
补充:LoRA rank选8到64之间,rank越大效果越好但显存也越大。一般32足够,不需要太大。
微调训练GPU实例可在GPU算力平台选择4090规格。




