竞价实例价格可低至按需价的2~4折,但最大风险是随时可能被回收(通常只有30秒~2分钟通知),用对了省大钱,用错了丢数据。
一、竞价实例的原理
云厂商将闲置的GPU容量以折扣价格出售,用户出价高于当前现货价格即可使用。当现货价格上涨或厂商需要收回资源时,实例会被强制终止。
核心特点:
- 价格低:通常是按需价格的20%~40%;
- 随时可能被回收:回收通知时间通常30秒~2分钟;
- 无SLA保障:不承诺可用率,故障和回收都不赔偿;
- 资源不稳定:价格和可用量随时波动。
二、哪些任务适合用竞价实例
| 任务类型 | 适合度 | 原因 |
|---|---|---|
| 数据预处理/清洗 | 非常适合 | 可中断,重跑成本低 |
| 离线批量推理 | 适合 | 支持断点续跑,多任务排队 |
| 模型训练(有checkpoint) | 适合 | 从最近checkpoint恢复即可 |
| 超参数搜索(并行实验) | 非常适合 | 每个实验独立,挂了重跑 |
| 在线推理服务 | 不适合 | 回收会导致服务中断 |
| 生产环境API | 绝对不适合 | SLA要求99.9%以上可用 |
| 数据库/存储服务 | 不适合 | 数据安全性无保障 |
三、竞价实例的省钱效果
以A100 80G为例:
- 按需价格:18元/小时;
- 竞价价格:3.5~6元/小时(约2~3.3折);
- 包月价格:约16.7元/小时(7.2折)。
如果一个训练任务需要运行200小时,使用竞价实例可以节省:(18-5)×200=2600元。考虑到可能被回收重跑的成本,实际节省仍在40%~60%。
四、使用竞价实例的五条铁律
铁律1:每30分钟保存一次checkpoint
训练脚本必须实现自动保存checkpoint功能,被回收后从最近的checkpoint恢复训练。损失最多30分钟的训练进度。
铁律2:多区域、多卡型容错
不要只在一个区域竞价。同时在2~3个区域提交竞价请求,某个区域资源被收回时自动切换到其他区域。
铁律3:设置出价上限
设置一个你能接受的最高出价(比如按需价的40%),超过此价格自动取消竞价,避免价格飙升时意外多花钱。
铁律4:不要把数据放在本地盘
竞价实例回收后本地数据全部丢失。所有数据集、模型权重、checkpoint都要存在对象存储或网络存储中。
铁律5:关键路径用按需实例兜底
对训练时间有严格要求的项目,保留一台按需实例作为主线,竞价实例做辅助计算。即使竞价实例全挂,主线仍在推进。
五、竞价实例被回收的概率有多大
回收概率取决于:
- 卡型热度:4090、A10等推理卡回收概率低;H100等高端卡回收概率高;
- 时段:工作日白天回收概率高,夜间和周末回收概率低;
- 区域:资源充裕的区域(如西部、二线城市)回收概率低于一线城市。
在冷门区域、非高峰时段使用4090跑批量任务,连续运行一周不被回收是常态。
想寻找高性价比的竞价GPU实例,对比不同区域的现货价格,可以访问GPU竞价实例平台,实时查看各卡型现货价格和可用量。
六、总结
竞价实例不是穷人版按需实例,而是一种需要工程能力驾驭的成本优化工具。做好checkpoint和数据备份,竞价实例能把GPU成本砍掉一半以上。




