结论先行:新手按实名认证、选实例、配安全组、SSH连接、装环境、跑demo六步走,2小时内即可跑通第一个GPU任务,不用一上来就买包月。
一、六步流程
第1步:注册与实名
完成实名认证,个人或企业均可;企业认证后可开发票、申请更高配额。首次使用通常有新客代金券,记得先领。
第2步:选实例规格
新手推荐从单卡4090或A10按量付费起步,系统镜像选预装CUDA的Ubuntu 22.04,省去自己装驱动的麻烦。系统盘给足50GB以上,数据盘按需挂载。
第3步:配置安全组与公网IP
放行22端口用于SSH,按需开放Jupyter的8888端口;公网IP按量计费,不用时释放。安全组遵循最小开放原则,不要一开全开。
第4步:SSH连接
Windows用PowerShell或MobaXterm,执行ssh root加公网IP,输入密钥或密码登录。建议使用密钥对而非密码,更安全。
第5步:验证环境
运行nvidia-smi看GPU状态,python导入torch检查cuda是否可用,应输出True。若为False,检查是否装了CPU版PyTorch。
第6步:跑通demo
用PyTorch官方mnist示例或一行print验证GPU可用,再上传自己的代码。建议用scp或git管理代码,避免直接在服务器上编辑。
二、新手最易踩的3个坑
- 忘记放行22端口,SSH连不上;
- 选了无公网IP的内网实例;
- 系统镜像选了无GPU驱动的纯净版。
三、首次任务建议清单
开机后按顺序做四件事:跑nvidia-smi确认GPU在线;跑python torch cuda检查环境;下载一个7B模型做推理测速;把数据和代码放到数据盘而非系统盘。完成这四步就算真正上手,后续就是按业务需求迭代模型了。
四、总结
新手上云不要怕,按六步走一遍就熟了。关键是第一步选对镜像(预装CUDA)和第二步配好安全组。后续遇到问题,90%都能在社区搜到答案。先跑起来比什么都重要。
补充:选镜像时注意看镜像是否带CUDA版本号。有些镜像只装了驱动没装Toolkit,导致编译自定义算子时报错。最稳妥的做法是选明确标注CUDA版本的预装镜像。
想一步到位用预装环境的镜像,可在GPU算力平台选择带CUDA/PyTorch预装的GPU实例。




