结论先行:驱动不兼容报错八成是驱动版本太旧或PyTorch版本太新。升级驱动或降级PyTorch,二选一即可解决。
一、常见报错现象
报错CUDA driver version is insufficient for CUDA runtime version,或者no kernel image was executed for executing on the device。前者是驱动太旧,后者是GPU架构不支持。
二、排查步骤
第一步nvidia-smi看驱动版本和支持的最高CUDA。第二步python -c print torch.version.cuda看PyTorch需要的CUDA。如果PyTorch需要的CUDA高于驱动支持的,升级驱动或降级PyTorch。
三、不要乱动驱动
云实例不要随便卸载驱动重装,容易把系统搞崩。直接选预装正确驱动的镜像更省事。真要自己装,先看平台文档的推荐版本。
四、实际案例
有用户从CUDA 11.8镜像升级到PyTorch 2.4(需要CUDA 12.4),结果训练一开始就报driver too old。原因是镜像里的驱动还是535,只支持到CUDA 12.2。解决方案要么升级驱动到550以上,要么降级PyTorch到2.1。云实例上升级驱动有风险,建议直接换预装正确驱动的新镜像。
五、预防方法
新实例先用nvidia-smi确认驱动版本,再决定装哪个版本的PyTorch。把驱动版本和PyTorch版本写在团队文档里,新人上手直接照着装,不要每次都踩一遍。
想省去驱动兼容问题,可在GPU算力平台选择预装正确驱动和CUDA的镜像。




