推理:权重 + KV cache(注意力架构决定,MLA 模型比 GQA 省 3–5 倍)。训练:混合精度 + Adam 的 16 字节法则,ZeRO 分片。
| 硬件 | 显存 | 所需卡数 | 租赁成本/小时 |
|---|
计算器由服务端提供算力支持,保存到本地的副本无法运行。请访问官方站点使用。
推理 KV cache 按 FP16 计(生产环境一般不做 INT4)。训练模式按混合精度 + Adam 估算(权重 2N + FP32 主副本 4N + 梯度 2N + 优化器 8N),激活值按梯度重计算后量级估算。结果用于选型参考,实际部署以压测为准。