主流模型的总参数量、激活参数量与 KV cache 每 token 占用;闭源模型标注"估算"。
计算器由服务端提供算力支持,保存到本地的副本无法运行。请访问官方站点使用。
总参数量 / 激活参数量单位 B(十亿)。"估算"表示闭源模型参数为业内反推。KV 为 FP16 精度每 token 字节数,由注意力架构决定(GQA ~300KB 级,MLA/压缩路线 ~100KB 级)。