大模型训练GPU怎么选:先算显存账,再定互联和卡数

同一个 7B 模型,QLoRA 微调一张 24GB 消费级卡就能跑,全参数微调却要好几张 80GB 卡加参数切分。差别不在模型本身,而在训练时显存里到底装了几样东西。所以选卡的顺序永远是:先确定用哪种训练方式,再算显存账,最后才决定卡数和互联。四档训练方式对应的卡位先给一个可以直接对照的起点,具体到某个模型的显存门槛,官网的模型选卡指南按模型列得更细,...