我的模型需要几张什么卡?

推理:权重 + KV cache(注意力架构决定,MLA 模型比 GQA 省 3–5 倍)。训练:混合精度 + Adam 的 16 字节法则,ZeRO 分片。

输入参数

所需卡数
总显存需求
权重显存
参数量 × 量化字节
KV cache

全硬件对照

硬件显存所需卡数租赁成本/小时

本页面需要在线使用

计算器由服务端提供算力支持,保存到本地的副本无法运行。请访问官方站点使用。

用同一组参数继续算

推理 KV cache 按 FP16 计(生产环境一般不做 INT4)。训练模式按混合精度 + Adam 估算(权重 2N + FP32 主副本 4N + 梯度 2N + 优化器 8N),激活值按梯度重计算后量级估算。结果用于选型参考,实际部署以压测为准。