结论先行:对象存储适合存训练数据集和模型权重,容量大、价格低、不随实例释放。GPU实例通过S3兼容API对接,配合s5cmd可加速传输。
一、为什么用对象存储
数据盘跟着实例走,实例释放数据就没了。对象存储独立存在,实例删了数据还在。价格只有数据盘的五分之一,适合存海量数据。
二、对接方法
安装awscli,配置access key和endpoint,即可用aws s3 cp上传下载。大数据量用s5cmd并行传输,比awscli快5到10倍。PyTorch训练时直接从对象存储读数据。
三、成本优化
冷数据转低频存储,价格再降一半。生命周期规则自动清理过期文件。模型权重只保留最近3个版本,不要全留。
四、常见问题
上传慢检查是否走公网,同VPC走内网传输不收费且更快。大文件用分片上传。训练时不要每个step都读对象存储,先把数据拉到本地数据盘再训练。
五、模型版本管理
每次训练完把权重上传到对象存储,按日期和版本号命名。不要只留最新版,旧版万一新版效果差还能回滚。推荐结构:bucket/project/yyyy-mm-dd/model.pt,同时上传一份训练日志和配置文件,方便复现。
对象存储有上传下载费用,小文件多次读写很不划算。建议先把数据集打包成大文件,训练时一次性下载到本地,训练完再上传结果。
需要对象存储与GPU实例联动,可在GPU算力平台选择支持内网对接的实例。




