
如果给大模型一倍计算预算,最直觉的选择是什么?过去几年的答案几乎都是:增加参数、堆更多层、喂更多数据。
循环 Transformer 提出了另一条路:不急着造新层,而是让已有的层重复工作,在同一组参数上进行多步计算。这个想法很迷人,却一直绕不开一笔账——同一个模型循环 N 次,预训练计算量也会近似放大 N 倍。只和同参数量模型比较,当然容易显得划算;真正公平的对手,应该是消耗相同训练预算的更大非循环模型。
论文名称:Loop the Loopies! 论文链接:https://arxiv.org/abs/2607.16051

新论文《Loop the Loopies!》把这场比较推到了大型稀疏模型上。作者训练了两款 MoE 模型:总参数量 20B、单次激活 2B 的 Loopie-20B-A2B,以及总参数量 6B、单次激活 0.6B 的 Loopie-6B-A0.6B。
Loopie 最值得关注的,不是“循环”这个动作本身,而是它第一次把循环深度、显存占用和真实硬件吞吐放进了同一套设计里。

传统循环模型常强调参数效率:同一组权重多用几次,就能以较少参数获得更深的有效计算。但对预训练来说,权重可以复用,算力不能免费复用。
论文举出的思路很直接:一个 2.6B 模型循环 4 次,不能只和 2.6B 的普通模型比;从计算预算看,它面对的竞争者更接近 10.4B。类似地,3.5B 模型循环 32 次,对应的计算规模甚至接近 112B。于是问题从“循环有没有用”,变成了:在相同预训练成本下,循环是否比增加普通容量更值得?

这也是 Loopie 的评价底线。作者不是按存储参数量配对,而是在固定硬件、序列长度、每次优化器更新的 token 数、数据和优化器后,用真实的单步墙钟时间选择对手。这里的“计算匹配”是一个工程口径,并不等于理论 FLOPs 完全相同。

以三层模型、循环两次为例,过去常见的 model-loop 顺序是:先跑第 1、2、3 层,再从第 1 层重新开始。Loopie 采用的 layer-loop 则是:第 1 层连续跑两次,再让第 2 层连续跑两次,最后处理第 3 层。

两者执行的层数相同,但参数共享发生的位置不同。整模循环会让同一个物理层服务于相距很远的有效深度;逐层循环则让它在相邻状态上做局部迭代,更像“先把这一层的表示修两遍,再交给下一层”。
论文给出三点理由。第一,layer-loop 在训练早期略落后于 model-loop,大约到 1.2T token 后反超,后程增长更快。第二,相同层的前后向计算紧挨着,更利于参数复用、激活检查点和流水线并行。第三,相邻深度上的表示更接近,让共享参数承担的角色可能更一致。

最后一点仍是作者基于既有表示分析作出的解释,而不是被直接证明的机制。论文证明了现象,却还没有完全解释为什么这种循环顺序更有效。
Loopie 的核心配方分三步:先把存储层数减半;再让每一层执行两次;最后把节省出的激活显存换成更大的单卡 microbatch,并把真实吞吐收益重新投入模型宽度和容量。
以 Qwen3 风格的 30B-A3B 基线为例,它有 48 层、隐藏维度 2048。最初的循环种子模型把存储层减到 24 层,每层执行两次,因此有效层执行次数仍为 48,主干计算代理近似不变;但在论文的检查点实现下,主要激活内存跟存储深度而非执行深度走,于是内存代理降到一半。
有了这块余量,单卡 microbatch 可以从 1 提到 2,梯度累积步数相应减半,全局 batch 和每次更新的 token 数保持不变。更大的 microbatch 让 GPU 内核一次看到更多并行工作,减少反复启动和累积的开销。
作者随后搜索可行的宽度、深度和并行配置,最终得到 27 个存储层、隐藏维度 2304、循环两次的 Loopie-20B-A2B。它的理论主干工作代理是基线的 1.424 倍,却借助更高硬件利用率把单步时间压到近似相同。论文报告的最佳平均训练吞吐为 261.53 TFLOPS/s,基线为 189.65 TFLOPS/s。

它不是把循环当作“少算一点”,而是把少存的激活变成更大的 microbatch,再把吞吐红利花回模型能力。
在与复现版 Qwen3-30B-A3B 的对比中,Loopie 起初仍然落后,但约在 600B token 后反超,并在后续训练中保持优势。这种“前慢后快”的曲线,也提醒我们不能用短跑实验判断循环架构。
循环次数越多,单个固定模型的训练曲线通常越好;可一旦锁定总预算,更深循环就必须从模型宽度、存储层数或训练数据中拿走资源。
规模化实验也给出了积极信号。在四级 scaling ladder 中,普通 MoE 基线从 0.15B 活跃参数增长到 1B,对应的 Loopie 都按真实训练时间匹配,并在八项下游任务均值上分别领先 1.1、0.6、1.7、2.2 个百分点。差距没有随模型增大而消失。

论文比较了 2、3、4 次 layer-loop 与增加同倍存储层的方案,发现循环的边际收益在 R=2 时最大,继续增加会迅速衰减。因此,两次循环不是追求“思考越久越好”,而是选择了最小的非平凡递归:第一次做普通变换,第二次在本层局部修正。

消融实验则移除了 layer-loop,其他骨干、优化器、数据和 token 预算保持一致。结果显示,真正带来收益的不只是“多执行一些计算”,而是计算以什么顺序复用参数。
架构之外,Loopie 还使用了很重的训练配方。第一阶段在约 570B 个高质量独特 token 上重复四轮,共约 2.28T token;第二阶段再用约 1.26T token 的高质量混合数据退火,其中包括监督风格数据、STEM、代码、数学和合成网页数据。

更特别的是后训练。作者提出 Supervised Pre-Training,简称 SPT:损失仍像 SFT 一样,只计算目标回答 token;训练规模却像预训练,使用全局 batch 1024、最长 128K 上下文,以及总计 2T token。

普通 SFT 常用较小 batch 和较短上下文,多轮后容易快速专门化,甚至遗忘基础能力。SPT 每次更新聚合约 1.28 亿个名义 token 位置,约是典型 SFT 的千倍。论文报告,在约十轮训练中,损失持续平滑下降,推理指标和 MMLU、ARC-Challenge 等基础指标都没有出现退化。

不过,作者也明确承认:受算力限制,SPT 的消融还不够全面。因此,它更像一个很有吸引力的新训练区间,而不是已经被充分验证的通用定律。

SPT 之后,模型再依次进行数学和代码强化学习。算法基于 GSPO,加入非对称裁剪和动态样本过滤;上下文先用 32K,当截断率超过 10% 后切到 64K。最终的 Loopie Thinking,其实是架构、数据、监督训练与强化学习共同作用的结果。
在同类活跃参数规模的推理模型对比中,Loopie-20B-A2B 的 AIME 2024 得分为 92.09,AIME 2025 为 83.75,MMLU 为 81.28。论文强调,其结果表中预训练 token 数约为 3.5T,明显少于若干对手的 25T 或 36T。
更吸睛的是奥赛结果:在 2025 年 IMO 题目上,模型得到 35 分,达到论文采用的金牌线;在 IPhO 上得到 20.3 分,超过 19.7 分的金牌线。
但这不是一次裸模型、单次作答。IMO 使用了大规模 generate–verify–refine 流程:每题先生成 64 个候选解,每个候选再采样 64 次验证,最多迭代 16 轮,最后由 GPT-5.5 充当评审并重复评分三次。IPhO 同样使用了大量测试时计算。准确的说法是“无外部工具,但用了显著的推理时采样与自我验证”,而不是轻量单次推理。

还要注意两处边界。其一,论文没有系统比较推理延迟、KV 缓存和部署成本,训练时更高效不代表线上推理一定更便宜。其二,方法章节对预训练总量存在口径不完全一致:分项写的是 2.28T 加 1.26T,约为 3.54T;结果表写 3.5T;章节概览又写第一阶段 3T。本文采用分项与结果表中相互吻合的约 3.5T 口径。
Loopie 没有证明循环会取代堆参数。它证明的是一个更务实的命题:只要把循环位置、存储深度、microbatch 和硬件效率一起优化,循环深度可以成为大型 MoE 的有效扩展轴。
下一步的关键问题也很清楚:这种优势能否延伸到更大规模?能否和更先进的注意力、路由及记忆机制结合?推理时的速度、能耗与延迟是否划算?SPT 的收益究竟来自大 batch、长上下文、数据规模,还是它们的组合?
如果这些问题继续得到正面答案,大模型的增长方式就不再只有“横向变宽”和“纵向堆深”。它还可以在同一层里,多停留一步,把计算真正变成迭代。
如果你正在关注大模型 Agent、强化学习后训练、RLHF、DPO、GRPO、RLVR 等前沿方向,欢迎学习我最新上线的精品课程:
课程围绕 Agent 架构、强化学习基础、Reward 设计、策略优化、工具调用、多轮任务执行、Agentic Workflow 以及前沿论文与实战案例展开,帮助你建立从理论到应用的完整知识体系。
Agent RL 正在成为大模型能力提升与智能体系统演进中的重要方向。未来的 Agent 不只是会调用工具,而是要能规划任务、评估结果、修正策略,并在复杂环境中持续优化自己的行为。
现在系统学习 Agent RL,提前进入下一阶段 AI 应用开发的核心赛道。
🌟 关注“唐国梁TGLTommy”,一起持续追踪 AI 技术演进背后的长期趋势。