H100租用按量价格已下探到 $1.99–$2.99/GPU-小时,中位数 $2.29–$3.12;该不该租,取决于你的负载是否真的吃满 80GB 显存。训练脚本刚跑起来不到十分钟,显存就逼近 80GB,你盯着监控面板开始犹豫。2026 年 8 月的价格横评显示,B200 均价还在 $7.11/GPU-小时,H200 则在 $2.60–$4.50 之间,H100 在中间提供了一个相当有吸引力的性价比锚点。
下文先给出一张价格快照,再给你 5 条可自查的判据,最后附上同负载对照实测的清单(注:以下价格与显存判断均基于 2026 年 3–8 月公开监测数据,实际会随区域与合约浮动)。
价格快照:H100、H200、B200 的价差摆在一起看
下表把 H100租用与相邻卡型的按量价格并排列出。需要说明,这里的价格是区间而非某一家的固定报价,且传统超大规模云厂商 8 卡整机的折算单价通常更高。
| 卡型 | 按量均价($/GPU-小时) | Spot/预留最低 | 说明 |
|---|---|---|---|
| H100 | $1.99–$2.99 | 监测数据未单列 | 专业 GPU 云平台主力报价区间 |
| H200 | $2.60–$4.50 | 未单列 | 显存与带宽更高,价格上浮 |
| B200 | $7.11 | $3.35–$3.60 | 均价较高,Spot 价有吸引力 |
超大规模云厂商的整机折算单价($3.00–$8.00+)明显高于专业 GPU 云,差异来自合约形态、区域与是否包含存储网络等附加服务。价格区间来自 GetDeploying 跨 26 家云厂商的 B200/H100 价格索引(2026-08)与 GMI Cloud 的 H100 租买成本分析(2026-04),监测口径为 2026 年 3–8 月。H100 spot 实例与预留模式在部分平台可进一步压低单价,但需要能接受中断与重排队。
判据一:80GB 显存装不装得下——权重、KV Cache 与中间张量的分账法
显存占用不是只看权重大小,要按三段分账:权重×精度字节 + KV Cache + 激活与碎片余量。以 70B 模型为例,使用 4-bit AWQ 量化推理或 QLoRA 微调,显存需求约 35–73GB,可以落在单卡 H100 的 80GB 内;但若是 FP16 全参微调,70B 模型需要超过 1TB 显存,就得 8×H100 或多节点。
你可以这样粗算:权重显存 = 参数量 × 每参数字节(FP16 为 2 字节,INT4 为 0.5 字节),再加上输入序列的 KV Cache,最后留出 15–20% 余量。那么微调 7B 模型需要租 H100 吗?FP16 下 7B 权重仅约 14GB,中端卡通常就够,除非你同时跑高并发推理或超长上下文。

判据二:上下文长度与并发数,决定你先撞显存墙还是带宽墙
KV Cache 会随上下文长度和并发数线性增长,直接压缩可用的 batch 大小。你可以先设定目标并发数,反推可支持的上下文长度:先算出 KV Cache 每 token 占用,乘以上下文与并发,看剩余显存是否够放权重。
长文本场景下,吞吐瓶颈往往从显存容量转向带宽,信号是 batch 上不去了但显存还没满——这时候加并发,延迟会快速恶化。H100 的 80GB 在 128K 上下文下可能只够支撑较小并发,具体取决于模型与优化程度。
判据三:持续满载还是断续脉冲——按量与长期占用的分界点
H100租用的按量计费适合低频或脉冲式负载,但如果你每月有效满载小时数超过 400 小时(示意阈值,按自身单价与包月折扣重算),长期包月或预留更划算。Spot 实例和按量哪个便宜?答案是 Spot,但代价是随时可能被回收。另外注意空转计费:实例开起来但没跑任务也会计费,关掉或自动休眠可省隐性成本。
判据四:是否依赖 Blackwell 专属算子路径,以及怎么核实
如果你的代码或推理框架用到了 B200 上的专属算子(如特定精度或并行模式),在 H100 上可能回退到通用路径,性能打折。核实方法很直接:查推理框架的 kernel/后端支持矩阵,看编译目标算力版本;再验证量化格式(如 AWQ)在 Hopper 上的可用性与回退路径,必要时查阅 vLLM 和 SGLang 等框架官方文档或 GitHub 上的算子支持列表。多数主流部署路径在 H100 上仍可用,但个别新算子未必有优化。
判据五:单价不等于成本——把 $/小时换算成每百万 Token 成本
比价不能只看小时单价,要看单位产出成本。公式很简单:
每百万 Token 成本 = 小时单价 ÷ 实测吞吐 tokens/s ÷ 3600 × 1,000,000
务必使用自己的实测吞吐,而非官方标称 TFLOPS。比如你测出 H100 在某负载下吞吐为 3000 tokens/s(示意值),按 $2.50/小时算,每百万 Token 成本约为 **$0.23**;而若 H200 在同一负载下吞吐比 H100 高 40%,而单价只贵 25%(示意值),单位 Token 成本反而更低——判断门槛是吞吐涨幅必须大于单价涨幅。H100 和 H200 租哪个划算,别只看小时单价,套上面的公式算一遍同一负载的实际成本最靠谱。
| 判据 | 判定阈值(示意) | 结论倾向 |
|---|---|---|
| 显存占用 | ≤73GB(INT4/AWQ/QLoRA) | 单卡 H100 可行 |
| 上下文与并发 | KV Cache 不超 65GB | 可考虑 H100 |
| 每月满载小时数 | >400 小时 | 建议长期包月 |
| 算子路径 | 无回退 | H100 适用 |
| 单位成本 | 低于备选卡型 | 值得租用 |

推理引擎优化会改变结论:DCP 等并行技术对已有 H100 的吞吐利用率
2026 年中,vLLM部署 和 SGLang 推出的 Decode Context Parallelism(DCP)等并行技术,显著提升了长文本场景下已有 H100 资源的吞吐利用率。这意味着以前可能因为显存或带宽限制而放弃 H100 的长上下文任务,现在可能跑得更快。但这属于软件侧优化,不等于硬件性能提升。
所以,比价必须在更新后的框架版本上重测,否则基于旧版本的结论可能失真。同时也别把 DCP 当成 H100 的“免费午餐”,你的部署架构要支持才行。
什么时候不该租 H100:往下走用中端卡就够的负载
不少场景其实用不上 H100 的 80GB 与高带宽:
- 小模型(7B 以下)推理,更低规格的卡型(如 RTX 4090、L40S 或上一代数据中心卡)就够,租 H100 溢价买不到对应产出;
- 低并发的内部工具调用,比如每天跑几十次问答,用按量的中端卡或 Serverless 更划算;
- 图像生成类任务,对显存容量要求高但计算密度低,未必需要 H100 级别的算力。
当显存需求小于 40GB、并发也不高时,建议降级卡型,把预算花在刀刃上。
什么时候该往上走:H100 明显吃亏的三种场景
反过来,下面三种情况 H100 可能不够用,值得考虑 H200租用 或 B200:
- 超长上下文(如 128K+)且高并发:KV Cache 反复溢出,H100 显存撑不住,H200 单卡显存容量高于 H100,长上下文更从容(具体规格以厂商官方参数为准)。
- 大规模全参训练:需要频繁跨节点通信,H100 的卡间带宽可能成瓶颈,H200 或 B200 单卡更强。
- 对单卡显存有硬需求:比如要跑超过 80GB 的模型权重,H100 单卡装不下,只能往上走。
以 B200 的 Spot 价 $3.35–$3.60 做上限测算,若它能让你避免多节点通信开销,单位成本可能反而更低。
用按量资源做一次同负载对照实测:步骤与决策检查清单
建议先按显存分账公式和单位成本公式算一遍,再用按量资源实测。可以先用 H100 和相邻卡型(如 H200)跑同一提示集,注意这属于按量使用,避免长时间占坑。
步骤如下:
- 固定同一提示集与并发曲线,预算控制在 50–100 美元以内;按量资源可在 NexGPU 等 GPU 云平台上按小时起租,跑完即停。
- 分别在 H100 与候选卡型(如 H200)上各跑一轮——NexGPU 这类平台提供多种 GPU 服务器型号,便于用同一提示集横跨卡型对照——记录峰值显存、稳态吞吐、P95 延迟。
- 记录实际计费时长(含启动与排队时间);
- 套用单位成本公式,算出每百万 Token 成本;
- 结合可用性与预算,决定是否长期锁定。
决策检查清单(可勾选):
- [ ] 70B 模型在 INT4/AWQ/QLoRA 下单卡显存 ≤ 73GB
- [ ] FP16 全参微调已确认需 8×H100 以上
- [ ] 目标并发与上下文下 KV Cache 占用未挤压到权重所需空间(阈值需按自己模型实测,本文示例数值为示意)
- [ ] 每月有效满载小时数 > 400(示意阈值,按自身单价与包月折扣重算)
- [ ] 可接受 Spot 中断,愿意用 Spot 拉低单价
- [ ] 关键算子路径在 Hopper 上无回退
- [ ] 实测吞吐达到标称预期
- [ ] 每百万 Token 成本低于备选卡型
若清单大部分满足,H100租用就是值得的选项;否则,要么降级要么升级。用 NexGPU 的预制模型与应用模板可缩短起租到出结果的时间,减少空转计费,再用实测数据决定是否长期锁定规格。
常见问题
H100租用一小时多少钱?
主流专业 GPU 平台按量报价在 $1.99–$2.99/GPU-小时之间,市场中位数约 $2.29–$3.12。超大规模云厂商整机折算单价可能更高,具体取决于区域和合约。建议以平台实时报价页为准。
80GB显存够跑70B模型吗?
分情况。4-bit 量化推理(如 AWQ)或 QLoRA 微调时,70B 模型显存需求约 35–73GB,单卡 H100 够用;但 FP16 全参微调需要超 1TB,单卡不行,必须多卡集群。
H100和H200租哪个划算?
不能只看小时单价,要算单位产出成本。H200 单价更高但显存和带宽可能带来更高吞吐。用公式:每百万 Token 成本 = 小时单价 ÷ 实测吞吐 ÷ 3600 × 1e6,哪个低选哪个。
H100按量计费怎么算成本?
成本 = 小时单价 × 实际计费时长,再加可能的存储与网络费用。隐性成本是空转:实例开着但没跑任务也计费。用 Spot 或预留可降低单价,但要承担中断风险。
H100降价了还值得租吗?
值得,但要看负载。如果你的任务吃满 80GB 显存、需要模型微调或高并发推理,H100 目前的价格区间有优势;若负载较轻,中端卡可能更划算。建议先用按量资源实测再决定。
NexGPU-算力租赁,GPU服务器,GPU云算力,AI服务器租用-新闻博客
评论(0)