智能体一上线,很多人第一反应还是多囤GPU。结果账单飞涨,利用率却低得吓人。实际跑起来你会发现:GPU经常在等。企业Kubernetes集群的平均GPU利用率只有5%左右,相当于配了20倍实际需要的容量。智能体场景更典型——典型工作负载跨一小时测量,GPU实际利用率常落在15%到40%。更细的研究显示,工具处理、编排、API调用、数据解析这些环节占端到...
最近两周GPU租赁市场动静不小。多家提供商上调H100期限报价,价格曲线整体抬升并趋于平坦,从之前的陡峭backwardation转向收紧。数据清晰显示,自7月初以来短中长期费率同步走强,市场不再定价过剩,而是持续紧俏。这不是偶发波动,背后是智能体AI工作负载爆发带来的真实需求。智能体不再是简单的提示-回答模式。它要把目标拆成多步、调用工具、查数据库、...
以前训练跑完就完事,账单也清零。现在模型一上线,推理就成了无底洞——用户每点一次、agent每跑一步,token就在持续燃烧。行业估算,企业AI的GPU支出里,推理已经占到55%到80%。训练是一次性项目,推理是永续运营。一个70B模型,假设服务1000日活用户、每人每天1000次请求、每次500 token,日均就能到5亿token量级。按常见H10...
0 条留言