GPU 实例关机还收不收费?算力停了,存储还在计

2026-09-20 6 0

关机之后账单没归零,是大多数人第一次租 GPU 时最容易困惑的一件事。答案很直接:

  • 关机(停机):GPU、vCPU、内存停止占用,算力费用随之停止计量;但系统盘和数据盘还在,存储费继续按容量计
  • 销毁(释放/Terminate):算力和存储一起释放,计费全部停止,同时磁盘里没备份出去的东西永久消失。

所以“关机还收不收费”这个问题,更准确的问法是:你愿意为保留那块盘付多少钱、保留多久。

为什么关了机还在扣

按小时计费的 GPU 实例,账单通常就三项:算力、存储、流量。NexGPU 的口径也是这三项,按秒计量,无最低消费、无合约。

关机时消失的是第一项。第二项之所以还在,是因为平台得继续给你留着那块磁盘——上面有你装好的驱动和 CUDA 环境、pip/conda 依赖、从 Hugging Face 拉下来的几十 GB 模型权重、ComfyUI 的自定义节点和模型目录、以及已经跑出来的图片、视频或 checkpoint。这些数据占着实实在在的物理空间,不会因为你点了关机就凭空消失,所以按容量持续计费。

换个角度理解:停机费买的是“下次开机能接着干”。环境不用重装,权重不用重下,开机就是原来那台机器。这笔钱值不值,取决于你多久会回来,以及重建一次要花多少时间。

关机与销毁在算力、存储、数据三方面的对比

关机还是销毁:按“多久回来”来判断

该关机的情况:

  • 微调跑到一半要吃饭、睡觉,几小时到一两天内会回来继续。
  • 环境是自己一点点调出来的:装了特定版本的 flash-attn、编译过算子、ComfyUI 里堆了一串自定义节点,重建一次要花两三个小时。
  • 调试阶段,需要反复回到同一个现场看日志、改参数。

该销毁的情况:

  • 这一批图/视频已经生成完、已经下载到本地了。
  • 微调结束,LoRA 或权重文件已经传到对象存储或本地。
  • 盘上占大头的是公开可下载的开源权重——这些随时能重新拉,没必要按月付钱替 Hugging Face 保管一份。
  • 你不确定下次什么时候用。“不确定”在计费上等于“一直在扣”。

中间地带的判断口径很简单:预计停机的时长 × 存储单价,对比重建环境要花的时间成本。短暂离开就停机,任务收尾就销毁,不要让一块装满权重的盘挂着过完一整个月。

还有一点值得提前知道:在 NexGPU 上,下单时的单价会锁定到该实例销毁为止。也就是说,长期要用的实例保留下来有它的价值;而一旦销毁,下次开新实例按当时的价格重新计。如果你租到了合适的节点又打算持续使用,这是“先别急着销毁”的一个理由;但如果只是临时任务,别被这条绑住。

销毁前的四步检查

销毁是不可逆的,磁盘释放后数据找不回来。动手前过一遍:

1. 产物是否已经离开这台机器。训练出的权重、LoRA、生成的图片视频、评估结果、日志——确认已经传到对象存储、网盘或本地,而不是只在实例的某个目录里。别只看文件名,检查一下文件大小对不对、能不能打开。具体的外移方式可以看租的 GPU 实例数据怎么保存

2. 环境能不能复现。导出 pip freeze 或 conda 环境文件,把自定义节点清单、启动命令、改过的配置文件一起存下来。下次用镜像模板重开一台,照着装回去比凭记忆强得多。

3. 确认没有进程在写盘。训练脚本还在跑、正在保存 checkpoint 的时候销毁,等于把半个文件丢掉。先停任务,再销毁。

4. 确认磁盘上没有你忘了的东西。数据集的预处理中间结果、手工标注过的文件、改过的推理脚本,常常是销毁之后才想起来的。关于数据和费用的完整边界,可以参考GPU 实例销毁后数据还能找回吗

几个容易踩的坑

在系统里敲 shutdown 不等于平台的停机。实例内部的关机指令和控制台上的“停机”操作,在不同平台上处理方式不一样,计费状态以控制台显示的实例状态为准。要停机,就去控制台停。

别把“各家云的停机规则”互相套用。有些云厂商提供特殊的省钱停机模式,有些对关机后的资源保留另有约定,规则彼此并不通用。你在哪个平台租卡,就看哪个平台的计费说明——NexGPU 的口径写在计费说明页,只有算力、存储、流量三项,停机仍收存储费,销毁才全停。

别用关机代替 checkpoint。关机是你主动的、有序的暂停;长任务真正的风险是非计划中断。训练脚本该写 checkpoint 还是要写,恢复逻辑该测还是要测,这件事和计费无关,参考云端 GPU 长任务中断恢复与 Checkpoint 设置

推理服务没有“停机省钱”这一说。只要对外提供接口,停机就是服务下线。真要控成本,方向是降低精度档位、换更小的卡或做请求合并,而不是靠停机。

按场景的实际做法

出图/出视频的创作者。一次性任务跑完就销毁,比长期停机更省心。ComfyUI、Whisper 这类环境用镜像模板一键重建很快,没必要为保留一块装满 checkpoint 的盘持续付费——除非你天天都在用。挑模板的思路在云 GPU 镜像模板怎么选

做微调的开发者。训练期间把 checkpoint 定期同步到外部存储,中途休息时停机保现场;整轮训练结束、权重取回后销毁。这样停机时长可控,存储费不会失控。

评估多卡或集群的团队。多节点实例停机时的存储占用是单机的数倍,更要明确“什么时候释放”的规则,最好在任务排期时就定好。需要谈多卡或长期方案的,走联系销售

回到最开始那句话:关机省的是算力钱,销毁才是真正的停止计费。把产物和环境备份这一步做扎实,销毁就不再是一个让人犹豫的按钮。

相关文章

GPU 实例销毁后数据还能找回吗?停机与销毁的数据和费用边界
租的 GPU 实例数据怎么保存:停机保盘、销毁清空与三条外移路线
GPU 实例端口映射怎么设置:SSH 隧道与公网映射两条路
ComfyUI 跑 Flux 显存不足怎么办?量化、启动参数与选卡边界
跑 FLUX 显存不够怎么降门槛:按 8G/12G/16G/24G 分档给做法
Llama 模型部署实操:选卡、vLLM 开服、多卡切分与停机费用边界

评论(0)

暂无评论

发布评论