Fair Comparison Shows Looped Transformers Beat Standard Ones Under Matched Compute, Parameters, and KV Cache
A study by Tsinghua University and ByteDance Seed, detailed in the paper SMELT, provides the first fair comparison of looped transformers against standard ones by simultaneously matching FLOPs, parameter count, and KV cache across multiple model scales. The results show looped transformers can outperform standard models under these controlled budgets, with optimal looping of the middle 50% of layers. This addresses a long-standing question of whether looped architectures' benefits stem from the architecture itself or simply from increased compute.
Coverage timeline
机器之心机器之心
在大模型的发展中,提升能力的主要手段一直是 "做大"—— 更多参数、更多数据、更多算力。如今,另一条思路开始受到关注:与其不断堆叠新的层,不如让已有的层再跑一遍。这就是 Looped Transformer。普通 Transformer 的每一层只执行一次,而 Looped Transformer 会把其中一部分层重复执行,让模型在不增加参数的情况下获得更深的计算 。 这个想法在推理和数学等任务上已经展现出不小的潜力,但一个关键问题始终没有被正面回答:Looped Transformer 的收益,究竟是循环架构本身的优势,还是因为多算了几遍、实际上用了更多的算力?清华大学、字节跳动 Seed 等机构的研究团队在论文 SMELT 中正面回答了这个问题。他们 同时对齐算力、参数量和 KV cache,首次在多个模型尺度上进行了公平比较 。 论文链接:https://arxiv.org/abs/2609.01343 本文的第一作者为清华大学博士生王少文,师从李建教授,研究方向为大语言模型预训练,曾在 ICML、NeurIPS、ACL、EMNLP 等国际会议上发表多篇论文,并获 LIT@ICLR 2026 最佳论文奖。 预算匹配框架 公平比较需要同时控制三个变量:决定训练和推理成本的每 token FLOPs、约束知识容量的总参数量、以及限制可服务上下文长度的 KV cache。 论文利用 MoE 将参数量和计算量解耦,具体的匹配方式如下:1)缩窄或变浅模型来抵消 Loop 架构循环执行的计算,2)增加专家数来补全总参数量,3)再调整注意力配置(GQA Ratio / Head Dim)来匹配 KV cache。 图 1 (a)|SMELT 的核心做法:将中间 50% 的层重复执行两次,同时匹配计算量、参数量和 KV cache。 最优循环配方 按上述控制预算的规则,论文在小规模上依次搜索循环范围、执行深宽比和循环次数,得到了以下结论: 1)循环中间 50% 的层收益最大。 论文把循环层比例从 0%(不循环)一路调到 100%(全部循环)。结果显示,比例在 50% 左右时,验证损失最低。作者推测,模型首尾的层分别承担输入编码和输出预测等特殊功能。因此,这些层保留独立参数,可能比参与共享更有利。 表 3|循环中间约 50% 的层效果最好。 2)Looped 模型的最优执行深宽
