广告图片
TOP云-靠谱的企业级公有云服务平台

云服务器、物理服务器、云安全、SSL证书限时3折抢购!

双路E5-2640V4(40核)64G内存480G SSD硬盘30M独享带宽物理机仅需368元;香港铂金云服务器2H/2G/15M仅需19.8元/月;4H/4G/25M仅需29.8元/月,

TOP云-靠谱的企业级公有云服务平台:双路E5-2640V4(40核)64G内存480G SSD硬盘30M独享带宽物理机仅需368元;香港铂金云服务器2H/2G/15M仅需19.8元/月;4H/4G/25M仅需29.8元/月,云服务器、物理服务器、云安全、SSL证书限时3折抢购!点击这里立即抢购! 展开广告

模型并行与张量并行:70B怎么塞进单卡

9 月 16, 2026

结论先行:模型装不下时用模型并行,把模型层切到多张卡。70B模型80GB单卡FP16装不下,必须张量并行或量化。

一、三种并行方式

数据并行:每张卡完整模型,处理不同数据。张量并行:单层权重切到多卡。流水线并行:不同层放不同卡。

二、70B训练怎么做

ZeRO-3或FSDP把模型状态切分到多卡,每张卡只存1/N。配合激活检查点,8张A100 80GB可以训70B。

三、推理怎么做

推理用张量并行更高效,vLLM和TensorRT-LLM都支持自动切分。70B INT4两张4090就能跑推理。

四、通信开销

模型并行通信量大,必须用NVLink互联。PCIe卡做模型并行效率很低。

补充:70B模型推理用vLLM的tensor_parallel_size=2或4自动切分,不用手动改代码。训练才需要复杂的张量并行配置。

大模型训练多卡实例可在GPU算力平台选择NVLink规格。

xtyly

发表回复