结论先行:租云GPU选4090,新任务几乎没有理由选3090;3090仅在预算极度紧张、模型较小、且能接受单卡24GB时才值得考虑。
一、硬参数对比
| 项目 | RTX 3090 | RTX 4090 |
|---|---|---|
| 架构 | Ampere | Ada Lovelace |
| 显存 | 24GB GDDR6X | 24GB GDDR6X |
| FP16吞吐 | 约71 TFLOPS | 约165 TFLOPS |
| 显存带宽 | 936GB/s | 1008GB/s |
二、性价比怎么算
以跑同样的LoRA微调任务计时,4090速度约为3090的2到2.3倍,而云月租往往只有1.3到1.6倍,单位算力成本4090明显占优。再考虑4090对FlashAttention-2、TF32等新特性支持更好,实际收益还会更高。
三、3090还能做什么
- 7B模型INT4/INT8推理:显存够用,延迟可接受;
- 课程作业、毕业设计、小型实验;
- 已有3090本地机器,不想额外花钱;
- 对训练速度不敏感、只跑小规模demo。
四、避坑点
3090云实例需警惕二手矿卡翻新机,务必选提供稳定SLA的厂商,否则跑关键任务时随时可能掉卡。4090无NVLink,做多卡训练前先测通信瓶颈,PCIe P2P在多卡时收益有限。
另外,3090功耗约350W、4090约450W,机房电费与散热成本也要算进TCO。整体看,新上云项目直接选4090更省心。
五、云实例选购提醒
租3090实例前务必确认机型是否为翻新矿卡:看运行时长、ECC报错记录、是否提供硬件监控面板。4090实例注意查看是否为4090D阉割版,报价应比原版低10%以上才算合理。另外,3090已停产,后续扩容可能面临无货,新项目不建议再以3090为基准做长期规划。
六、总结
3090的时代已经过去,云GPU新用户直接选4090。如果手上已有3090本地机器,可以继续用来做小规模实验,但不要在它上面做长期的生产规划。租云实例时务必按小时试跑,确认无矿卡痕迹后再转长期。
补充一点:如果是做图像生成类任务,4090对新版Diffusers库的支持更好,3090在某些最新模型上可能需要打补丁才能跑。这也是新项目不建议选3090的理由之一。
想先用最低成本验证模型可跑通,可在GPU算力平台按小时租用4090实例,跑通后再转包月。




