很多团队租了云GPU跑大模型推理,看着卡在那里却利用率上不去。看着监控,SM利用率常常只有二三十,甚至更低,钱却一分没少花。这不是卡不够强,而是推理本身的特性在作怪。推理分两段:prefill把长prompt或上下文一次性算完,生成KV cache;decode则一个token一个token往外吐。prefill偏计算密集,decode偏内存带宽。两者...
智能体不是单次调用,GPU得常开最近几个月,做AI应用的团队明显感觉到变化。以前调大模型,发个prompt、收个回复就结束。现在智能体一上线,规划、调工具、检查结果、再循环,一个任务动不动就跑十几二十轮。行业分析显示,这类代理式工作流单任务token消耗往往是普通聊天的5到30倍,有些复杂编码或企业场景甚至更高。结果就是GPU不再是“用完就关”的资源,...
0 条留言