最近几周,云算力市场最热的动静,是Meta在推进自家“Meta Compute”计划。消息一出,相关股票波动明显。简单说,Meta打算把多余的AI算力拿出来对外提供,模式可能是托管模型访问,也可能是直接出租原始GPU资源。这不是空穴来风——公司CEO之前在股东大会上就提过类似想法,现在推进到了具体业务层面。Meta自己一边大规模自建、一边向外部租赁大量GPU,累计承诺金额不小,现在反过来考虑出售余量,说明大厂算力布局已经到了“有进有出”的阶段。
这对中小团队意味着什么?供给端可能多一个玩家,竞争加剧,部分场景下议价空间会打开。但别高兴太早。真正推高需求的,是智能体(Agentic AI)工作负载的爆发。以前大家习惯的是模型训练完了就推理,token成本一路往下走,很多人觉得新芯片一出,旧卡价格会崩。现实却是另一回事:模型更高效了,单位算力产出更多token,质量也更高,结果使用量反而暴增。这就是典型的杰文斯悖论——效率提升带来的不是需求萎缩,而是应用场景爆炸。智能体不是单次问答,而是多步骤推理、工具调用、子代理协作、长时状态保持,token消耗轻松翻几倍甚至十几倍。算力需求变得对价格不那么敏感,因为ROI实在太明显。
市场数据也在印证这点。AI GPU租赁市场从2023年的约33亿美元,已经增长到2026年的70多亿美元量级,远期还在向更高规模冲刺,年复合增速不低。H100这类主流卡的按需价格区间现在大致在每小时2美元到11美元之间,不同提供商差异很大;A100更亲民一些,从1美元出头到5美元左右;最新Blackwell系列B200则更高,中位数在6美元上下,供应还偏紧。新一代卡价格过去一年大致翻倍,主流卡相对平稳,老卡则继续下滑。一年期合约和按需价格的走势也不完全一致,长期锁定有时反而没以前那么优惠,因为提供商对未来需求更有信心。
国内团队面对这局面,不用慌,但得换思路。过去“囤一批卡训练完再关”的模式,在智能体时代不那么适用了。智能体往往是持续运行、负载波动大、CPU编排压力不小。以前CPU:GPU比可能1:4到1:8就够,现在很多场景往1:1甚至更高靠拢,因为规划、检索、工具调用、安全检查、数据搬运这些都吃通用算力。如果你租的实例CPU核数不够,GPU就会空转,钱白花。

实操上,第一步先把工作负载摸清楚。别一上来就冲H100或B200。先用小模型或量化版在便宜卡上跑通多代理流程,测真实token吞吐、延迟、CPU利用率。很多团队发现,7B-30B级别的智能体,A100 80GB或H100就够用,显存和带宽能撑住KV cache;再大或内存敏感的,再考虑H200或MI300X这类大显存卡。B200目前供应有限、价格溢价明显,留给真正需要的训练或超大规模推理。NexGpu这类平台提供多种规格的弹性选择,正好方便你从单卡测试快速切到多卡生产,不用一开始就押宝最贵的硬件。
第二步,弹性组合比“全买断”更划算。基础负载用预留或长期合约拿折扣,尖峰用按需或现货补。智能体流量往往白天高、夜间低,或者活动期间暴涨,纯按需烧钱,纯预留又浪费。很多提供商现在支持分钟级计费、一键扩缩,甚至支持休眠/唤醒,能把闲置时间压下去。监控是关键,别只看GPU利用率,同时盯CPU、网络、显存碎片。利用率常年卡在20%-40%的推理集群很常见,目标是通过更好的调度框架(比如拆分prefill和decode、动态批处理)拉到50%以上,token成本才能真正下来。
第三步,避开几个常见坑。一是忽略互联和存储。多GPU训练或大模型分片,没有高速互联(NVLink或InfiniBand级别)性能会塌。二是只看小时价,不看总拥有成本。冷启动时间、数据搬迁费、运维人力、故障恢复,这些加起来可能比卡钱还贵。三是长期合约锁死,却没预留弹性退出条款。市场波动快,Meta一入场、新卡一放量,价格结构就会变。四是CPU配比不足,或者没做checkpoint,现货被抢占就前功尽弃。智能体链路长,中间状态丢了损失更大。
场景举例:一个做企业内部多代理助手的中型团队,之前用几张A100做微调,现在要上线持续服务。他们先在云端起几张A100做单代理原型,验证工具调用和记忆模块;确认后扩到H100集群,配上足够vCPU,用容器编排实现按需扩缩;日常用预留实例保底,活动期加按需。整体token成本比纯API调用可控得多,还能把数据留在可控环境。另一类是研究型小团队,直接租消费级或中端卡做量化实验,验证完再上专业卡。NexGpu在这类灵活切换场景里表现自然,支持从开发到生产的平滑过渡,帮团队少踩环境配置的坑。

价格波动怎么应对?别追热点卡。主流H100/H200供应相对充足,性价比往往更好。多对比几家的实际可用库存,而不是只看标价。区域差异也有,有的地方电费、网络延迟更友好。内存供应紧张是当前结构性问题,HBM产能被AI大单抢走,间接推高整机成本,但这对租赁用户影响小于自购。长期看,供给会跟上,但智能体带来的增量需求不会轻易消失。
最后提醒一点:大厂入场短期可能增加供给压力,但Meta自己还在疯狂扩容,外部租赁需求也还在,整体不是简单的“过剩”。真正决定你成本的,是工作负载设计、资源匹配和运维效率。先小规模验证智能体链路的真实消耗,再弹性放大;把CPU和GPU一起规划;用好按需+预留的组合;持续盯利用率。做到这些,云GPU租赁就能从“烧钱黑洞”变成真正的业务加速器。NexGpu这类专注算力弹性的服务,正好贴合这种快速试错、按需扩展的节奏,帮中小团队把精力放在模型和应用上,而不是硬件采购和运维琐事。
市场还在快速演化,Meta的动作只是信号之一。跟上智能体带来的负载变化,比死磕某一张卡的价格更重要。动手测一测你的代理链路,比空谈趋势管用得多。
NexGPU-算力租赁,GPU服务器,GPU云算力,AI服务器租用-新闻博客
评论(0)