以前训练跑完就完事,账单也清零。现在模型一上线,推理就成了无底洞——用户每点一次、agent每跑一步,token就在持续燃烧。行业估算,企业AI的GPU支出里,推理已经占到55%到80%。训练是一次性项目,推理是永续运营。一个70B模型,假设服务1000日活用户、每人每天1000次请求、每次500 token,日均就能到5亿token量级。按常见H100节点的token单价粗算,光算力一天就可能上千美元,年化轻松几十万。中小团队刚把模型推上生产,账单就可能反超训练总成本。
GPU租赁市场本身也在快速膨胀。2026年规模已到约74亿美元量级,还在继续两位数增长。硬件代际更新快,自建集群采购周期长、折旧风险高,越来越多团队转向云端按需租赁,尤其是推理这种流量波动大、需要弹性伸缩的场景。问题不在“有没有卡”,而在“同样的卡,怎么榨出更多有效token、压低每百万token成本(CPM)”。
CPM是核心指标:GPU小时价除以(每秒token吞吐 × 3600 / 100万)。单纯比峰值FLOPS没用,实际吞吐和利用率才决定钱花得值不值。当前很多推理负载的GPU利用率只有20%-40%,要推到50%-60%以上,资本开支才真正划算。推理对同步、时序和内存管理的要求,往往比训练更苛刻。
优化不是单点技巧,而是四层叠加,层层都有独立收益空间。
第一层是模型本身。量化是最直接的杠杆。H100上开FP8,吞吐通常能提1.3-2倍,质量损失控制在2%以内,对对话、摘要、代码生成这类任务几乎无感。Blackwell原生支持更激进的NVFP4,再叠一层1.5-2倍增益。INT4(GPTQ/AWQ)则能让70B模型塞进单卡,高batch场景下把节点从8卡砍到2-3卡。蒸馏更狠:如果任务允许,把70B蒸馏到14B或8B,GPU需求直接降4-8倍。别默认上最大模型,先跑自己的评测集,很多场景中等模型+量化已经够用。

第二层是运行时。连续批处理(continuous batching)是利用率杀手锏。静态批处理会让GPU在请求间隙空转,连续批处理配合PagedAttention能把利用率从15%-30%拉到60%-80%,有效吞吐提升3-4倍。推测解码(speculative decoding)用小草稿模型生成候选、大模型并行验证,输出密集任务能再提2-4倍。长上下文场景重点管KV cache:分页注意力消除碎片,INT8/FP8量化能再省30%-50%显存,腾出空间塞更多并发。vLLM、TensorRT-LLM、SGLang这些引擎在这些点上各有侧重,选型后务必用真实流量profile压测。
第三层是基础设施。工作负载决定选型。有严格P99延迟SLA的同步API,用on-demand的H100/H200/B200,spot中断风险太大。批量任务(嵌入、异步摘要、夜间评估)优先spot,价格能低一大截,配好队列和重试就行。自动扩缩容别看CPU/内存,盯请求队列深度——每卡积压超过几十个请求就该加节点。小模型(14B以下FP8)单卡PCIe可能比多卡SXM更划算,网络简单、运维省心。Blackwell系列在token产出上优势明显:相比Hopper,某些配置下每兆瓦token吞吐能提升50倍量级,成本每百万token可低到接近1/35。软件侧Dynamo这类分布式推理框架进一步解耦prefill和decode、智能路由、多级KV缓存,能把同硬件吞吐再提2.7倍甚至更高,直接砍token成本超60%。多家推理服务商已经用Blackwell+开源模型+优化栈,把token成本压到原来的1/4到1/10,医疗、游戏、客服等场景都有落地案例。
第四层是FinOps。没有归因,GPU账单就是黑盒。提交任务时打上模型名、用例ID、团队标签;把token数当核心指标上报,而不是只盯GPU小时。每周复盘CPM,80%预算就告警,别等超支才动。推理成本变化快,周度节奏比月度更合适。
实操里常见踩坑:训练卡直接拿来做推理(利用率低、冷启动吃延迟);忽略量化直接上全精度;没有连续批处理,流量稀疏时钱白烧;扩缩容看错指标导致要么空转要么排队;只算GPU价不算egress和存储。流量有波峰波谷时,云端租赁的弹性优势就出来了——按需起停、秒级扩容,不用为峰值常备冗余。

像NexGpu这样的云算力平台,正好适配这种节奏:提供灵活的GPU租赁能力,覆盖主流卡型,方便团队快速切换到更新的架构、做量化实验、挂连续批处理和自动伸缩,同时把FinOps标签和计量接进来。不用一开始就砸重资产,先用小规模验证CPM,跑通后再放量。中小团队做推理部署,往往先从单节点起步,确认延迟和吞吐达标,再横向扩;批量任务混用spot进一步压成本。
最近行业里也有硬核进展:有大厂工程师通过软件优化把特定流量的推理成本砍半,所需GPU数量大幅下降;多家服务商在新数据中心部署Blackwell集群,专门服务生产级推理;软件栈(CUDA内核、TensorRT-LLM、Dynamo等)持续迭代,部署后还能继续提吞吐、降成本。硬件买回来是固定的,软件和调度却是持续复利。
落地建议很直接:先算自己的日token量和目标CPM;用真实请求压测不同精度和引擎;把连续批处理、KV优化、队列扩缩容做进默认配置;每周看一次归因报表。云租赁降低了试错门槛,最新卡型和软件栈也能更快上手。推理已经是主战场,谁把token成本压得更低、利用率提得更高,谁就能在同样预算下服务更多用户、跑更复杂的agent流程。动手比观望更重要,从模型量化和运行时批处理开始,几周内就能看到账单变化。
NexGPU-算力租赁,GPU服务器,GPU云算力,AI服务器租用-新闻博客
评论(0)