首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Qwen3-0.6B模型的Scaling Law怎么计算?

Qwen3-0.6B模型的Scaling Law怎么计算?

作者头像
用户10637292
发布2026-07-27 18:48:42
发布2026-07-27 18:48:42
1220
举报

⏺ Scaling Law 描述验证集交叉熵损失 L 与参数量 N、数据量 D、计算量 C 的幂律关系:

核心公式:L(N) = (N_c / N)^α + L_∞,α ≈ 0.07。

三个投入:N=596M 参数;D=训练 token 数;C≈6ND=总浮点运算量。三者增大都使 Loss 下降,但服从幂律——N 翻倍 Loss 仅降约 5%,×10 降约 15%,收益递减。

Chinchilla 最优:给定固定计算量 C,N 和 D 应按 1:20 分配。即 0.6B 模型配约 12B tokens 训练最优。Qwen3-0.6B

实际训练量远超此值,属于"过度训练"策略——用小模型吃大量数据,推理便宜但性能不差。

与单次评测的关系:用一个验证集测一次得一个 L_val → 一个数据点。换 6 个不同 N 的模型各测一次得 6 个点 → 拟合出幂律曲线。Scaling Law

不是精确预言,而是统计趋势——给定 N 和 D,Loss 大致落在这条曲线上。

1. 前向传播得到 logits

输入 token ID 序列 [x₁,...,x_{t-1}],经过 Embedding(151936×1024)、28 层 Transformer Block、Final RMSNorm、LM Head(1024→151936),输出 151936

个 logits。

2. Softmax 得到概率

P(i) = e^logit_i / Σ e^logit_j,151936 个候选 token 各得一概率,总和为 1。取正确答案 x_t 对应的概率 P(x_t)。

3. 取负对数再平均

单 token:L_t = −ln P(x_t)。对验证集全部 T 个 token 做同样计算后求均值:L_val = (1/T) Σ L_t。

---

例:"中国的首都是" → 模型给"北"的概率 0.30 → L = −ln(0.30) = 1.20。

Loss 含义:e^L = 模型等效在几个候选里猜。L=2.0→约 7 个,L=1.0→约 2.7 个。这个 L_val 就是 Scaling Law 拟合的 Y 轴数据。

作者简介:

中科院博士,任职算法工程师(5年),从事大模型训练工作,有著作《快速部署大模型 LLM 策略实践》,《图深度学习从理论到实践》 交个朋友

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-26,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档