跑推理时你有没有碰到过这种事:模型权重明明塞得下,一开长上下文或多并发就OOM,或者token生成速度死活上不去?别急着加卡。现在越来越多一线反馈指向同一个点——推理尤其是decode阶段,真正卡脖子的不是FLOPS,而是显存容量和带宽。
训练时GPU几乎满负荷算梯度,算力是主角。推理反过来。生成一个token,整模型权重得从HBM搬进计算单元,GPU核心经常在等数据。KV cache更是大户,它存着对话上下文的key-value状态,随序列长度和并发线性膨胀。长文档、多轮agent、深度推理链一上来,KV cache就能把权重挤到角落,甚至占到显存大头。内存受限时,模型不只是慢,还会截断上下文、遗忘早期信息,幻觉也跟着上来。业内已经普遍把推理经济学——每token成本、延迟、可服务用户数——看作内存问题优先,算力其次。
硬件这边升级很直观。H100常见是80GB HBM3,带宽约3.35 TB/s。H200跳到141GB HBM3e,带宽4.8 TB/s左右,容量多七成多,带宽多四成多。Blackwell系列B200到了192GB量级,带宽进一步拉到约8 TB/s。更高阶的GB300甚至到288GB HBM3e。一个72卡机架的内存总量直接把供应商行为都改变了——AI服务器愿意为容量和带宽付溢价,连带影响了整个内存供应链。对agentic工作负载来说,新卡150-200GB级显存里,KV cache占比经常冲到九成,模型权重反而不那么吃紧了。
云端租赁把这些新卡变得可及。Blackwell供应仍紧,现货价近期波动明显,中位数大概在6美元/GPU小时上下,有的spot更高,hyperscaler保留价更贵;H200中位数约4美元区间,H100则更宽,主流在2-3美元多。新一代卡价格溢价不小,但带宽和容量提升直接转化成更高token吞吐,尤其小batch、低延迟场景。H200对内存绑定的decode几乎是“同算力带宽升级版”,很多团队用它做70B+长上下文或高并发。B200更进一步,适合更大KV或需要更高吞吐的agent流水线。AWS上已有Blackwell实例,推理性能相对上一代有数倍提升的报告。

怎么选、怎么用?先算清楚自己的KV footprint。公式大致是层数×KV头数×头维度×序列长×batch×精度字节×2(K和V)。70B FP16、8K上下文、8并发已经二十多GB KV,32K就轻松破80GB。H100上跑70B高并发或长上下文容易顶满,直接上H200或B200更省事,少做分片。精度也有空间:KV cache FP8能砍一半带宽压力,精度损失通常可控;Blackwell对更低精度支持更好。软件层同样关键——disaggregated serving把prefill和decode拆开、大专家并行、多token预测等优化叠起来,能把有效吞吐抬很高。单靠加卡解决不了带宽瓶颈,互联反而可能成新短板。
实操上几个常见坑。一是只看峰值FLOPS选卡,忽略batch size小的时候几乎全是内存绑定。二是低估并发和上下文增长,上线后KV暴涨再临时扩容。三是不考虑checkpoint或中断容忍,明明能用spot却全上on-demand,白白多花钱。四是忽视诊断:用nvidia-smi或dcgm看内存带宽利用率(MBU)和SM利用率,MBU高而SM低就是内存墙;再靠Nsight看具体kernel。解决路径按成本排:先量化KV、调batch和分页注意力,再考虑NVMe offload冷KV,最后才是换更大显存卡或加节点。
场景上,长上下文文档分析、代码agent多文件读取、多步推理链、高并发API服务,都是大显存的主场。短prompt小模型反而不用上最新卡,A100或消费级就够。NexGpu这类专注GPU算力租赁的平台,正好适合这种弹性需求——按小时起租,随时换规格,不用自己囤货应对供应波动。训练完切换推理、流量高峰临时加H200或Blackwell实例,做完就释放,成本可控。团队可以先用小卡验证pipeline,确认内存压力后再升配,避免一上来就锁长期大单。

供应端,Blackwell还在爬坡,CoWoS和HBM仍是瓶颈,现货紧俏时预约或混合使用H200是现实选择。价格会随新产能和软件优化波动,但内存墙短期内不会消失。agent和长上下文只会让KV需求继续涨。与其死磕本地采购周期,不如把云租赁当“按需内存池”:需要大显存就租大卡,带宽不够就换代,软件优化同步跟上。
下次部署前先画张表:模型权重+最坏KV+激活,对上目标卡的容量和带宽,再算每token成本和延迟。内存对了,很多“算力不够”的幻觉就消了。灵活租赁让中小团队也能跟上这一轮显存升级,不用等供应链松动。
NexGPU-算力租赁,GPU服务器,GPU云算力,AI服务器租用-新闻博客
评论(0)