
⏺ Scaling Law 描述验证集交叉熵损失 L 与参数量 N、数据量 D、计算量 C 的幂律关系:
核心公式:L(N) = (N_c / N)^α + L_∞,α ≈ 0.07。
三个投入:N=596M 参数;D=训练 token 数;C≈6ND=总浮点运算量。三者增大都使 Loss 下降,但服从幂律——N 翻倍 Loss 仅降约 5%,×10 降约 15%,收益递减。
Chinchilla 最优:给定固定计算量 C,N 和 D 应按 1:20 分配。即 0.6B 模型配约 12B tokens 训练最优。Qwen3-0.6B
实际训练量远超此值,属于"过度训练"策略——用小模型吃大量数据,推理便宜但性能不差。
与单次评测的关系:用一个验证集测一次得一个 L_val → 一个数据点。换 6 个不同 N 的模型各测一次得 6 个点 → 拟合出幂律曲线。Scaling Law
不是精确预言,而是统计趋势——给定 N 和 D,Loss 大致落在这条曲线上。

1. 前向传播得到 logits
输入 token ID 序列 [x₁,...,x_{t-1}],经过 Embedding(151936×1024)、28 层 Transformer Block、Final RMSNorm、LM Head(1024→151936),输出 151936
个 logits。
2. Softmax 得到概率
P(i) = e^logit_i / Σ e^logit_j,151936 个候选 token 各得一概率,总和为 1。取正确答案 x_t 对应的概率 P(x_t)。
3. 取负对数再平均
单 token:L_t = −ln P(x_t)。对验证集全部 T 个 token 做同样计算后求均值:L_val = (1/T) Σ L_t。
---
例:"中国的首都是" → 模型给"北"的概率 0.30 → L = −ln(0.30) = 1.20。
Loss 含义:e^L = 模型等效在几个候选里猜。L=2.0→约 7 个,L=1.0→约 2.7 个。这个 L_val 就是 Scaling Law 拟合的 Y 轴数据。
作者简介:
中科院博士,任职算法工程师(5年),从事大模型训练工作,有著作《快速部署大模型 LLM 策略实践》,《图深度学习从理论到实践》 交个朋友