大模型成本第一原理 01:6ND——训练一个模型到底要多少计算量?

2026-08-22 · 阅读约 6 分钟

几乎所有训练成本问题,都可以先回到同一个公式:总计算量 = 6 × 激活参数量 × 训练 token 数。它把"训练要烧多少钱"拆成三个可查的数字,是整个成本链条的第一性原理。

公式拆解

「6」来自一次前向 + 一次反向:反向传播大约是前向计算量的两倍,前向每参数每 token 约 2 FLOPs,合计 6。注意是激活参数量而非总参数量——MoE 模型按每次路由到的专家计,这就是为什么 DeepSeek-V4-Pro 总参数 1600B,训练计算量却按 49B 激活参数估算。

token 数则由你的训练计划决定;Chinchilla 法则给出经验最优:约 20 × 总参数量。训练 70B 的 Llama,最优 token 量约 1400B——超过这个规模收益递减。

代入一个真实例子

用 Llama-3-70B、训练 2000B token、1024 张 H100 试算:计算量约 8.4×10²³ FLOPs,满负载约 27 天。这就是为什么大模型训练动辄上千张卡、数周起步——不是效率低,是计算量物理上就在那里。

训练成本计算器

结论与局限:6ND 给数量级上限与下限,是预算的第一刀;但它不含显存与通信瓶颈(那是 ZeRO 分片与带宽的领域),也不含数据质量带来的"有效 token"折扣。逐项补充时再看下一原理。

动手算一下用你自己的参数量与 token 量代入 6ND,结果即时可见
联系我们,获取详细方案

文中数字来自站内训练成本计算器(6ND 公式),租赁价每周更新。结果用于数量级估算。