资讯动态

SMELT 把 MoE 中间一半层循环两遍:训练算力省 6.8% 到 18%,代码任务收益最大

发布时间:2026/9/3 8:59:13 来源:尧图企业网站定制
SMELT 把 MoE 中间一半层循环两遍训练算力省 6.8% 到 18%代码任务收益最大把模型中间一半的层原样再跑一遍按理说该更费算力但一篇 9 月初登上 Hugging Face 每日论文的研究发现在稀疏混合专家MoE模型上这么做反而能在训练算力上省下 6.8% 到 18%下游效果不仅没掉在代码类任务上还涨得最多。这篇论文名为 SMELTarXiv 2609.01343核心结论是在总参数量、每次前向算力、缓存占用三个口径都和基线对齐的前提下循环层结构仍然带来了实打实的训练收益。SMELT 的全称可以翻译成一句话中间层循环两遍的稀疏 MoE Transformer。它属于「循环型 Transformer」这一支研究这类结构通过反复使用同一批层来模拟更深的网络好处是权重更省代价是同一批参数要承担更多轮计算。过去这类研究多数在固定模型大小下做对比循环模型多跑的那几遍算力没有被算进成本里所以「循环到底有没有用」一直吵不清楚。一、循环层到底省不省先解决对比不公平要理解这篇论文先得知道它针对的问题。普通 Transformer 的每一层参数只用一次网络想变深就要一层层加新参数训练和存储成本跟着涨。循环型模型选择把一组共享层重复执行好几遍用「深度复用」代替「深度堆叠」这是它在内存和存储上的天然优势。问题出在评价方式上。过去很多对比让循环模型和普通模型用同样的层数、同样的参数规模然后说循环模型更好。可循环模型把层多跑了几遍每次前向的算力FLOPs明显更高。这就好比两个人比赛解题一个人多花了一倍时间赢了你却说「方法更优」显然不公平。论文明确指出这种对比把「架构优势」和「额外算力」混在了一起。所以这篇研究给自己立了一个更严的规矩循环模型和基线模型必须在三个账本上全部对齐。第一每个 token 前向计算的算力相当第二总参数量不含词嵌入相当第三推理时的 KV 缓存占用相当。只有在这样「算力对齐」的前提下跑出优势才能证明收益来自结构本身而不是来自偷偷多烧的算力。为什么偏偏选 MoE 模型来做这个实验因为 MoE 天生适合做这种「拆东墙补西墙」的账。MoE 把前馈网络拆成成百上千个「专家」每个 token 只激活其中一小部分专家参数量可以很大但单次算力并不大。循环层多出来的一次执行要烧算力就可以通过把隐层维度收窄来省回去而收窄隐层会缩小专家容量又可以通过加专家数量把参数量补回来。MoE 把「参数量」和「单次算力」解耦了对齐预算才有了操作空间。二、SMELT 的三条设计规则论文通过一系列消融实验把「怎么循环最划算」收敛成三条规则。第一条循环中间一半层而不是整叠层。把网络中间 50% 的层拿来执行两遍前后的层照常只跑一次。这样既增加了有效深度又不像整叠循环那样把所有层都重跑算力账更容易打平。第二条给循环模型一个更大的「深宽比」。循环模型的有效深度更深隐层宽度可以相对窄一些让网络形态更偏「深而窄」这在算力对齐的前提下对精度更友好。第三条循环两遍而不是三遍四遍。多加循环轮次会让收益边际递减两遍是性价比最高的点。这三条组合起来就是 SMELT 配方。用一个论文里的具体配置来说一个约 2 亿参数按激活规模算的模型稀疏度约 95%共 12 层中间 6 层循环两次实际执行 18 层为了让单 token 算力和基线打平隐层宽度从 1280 收到 1056为了把收窄导致的参数损失补回来每一层的专家数量相应调多循环残差做了 1/2 缩放注意力头改小、GQA 分组比例调高让多出来的层执行几乎不增加 KV 缓存占用。做完这套手术模型和未循环的基线在三个账本上基本对齐但结构完全不同。三、实验结果等算力下的训练成本账模型规模从 2 亿一直放到 540 亿非嵌入参数跨越四个规模档每个规模都在 85%、95%、97% 三档稀疏度下和基线对比再分别为两种架构单独拟合 Chinchilla 风格的扩展律。结论是 SMELT 的损失随算力下降得更快在「算力最优前沿」上可以省下 6.8% 到 18% 的训练算力。把省算力的幅度按预算拆开看趋势非常清晰。当总训练算力在 10 的 20 次方 FLOPs 量级时不同稀疏度下大约省 6.8% 到 10%当预算上到 10 的 21 次方时节省幅度扩大到 14.7% 到 18%继续往更大预算外推节省比例还能再往上走最高一档的实验区间达到 19.6% 到 23.5%。换句话说模型训练得越久、规模越大SMELT 相对基线的算力优势越明显这个差距不是恒定的而是会复利式拉大。训练算力预算稀疏度约 85%稀疏度约 95%稀疏度约 97%10 的 20 次方 FLOPs约 10.0%约 7.8%约 6.8%10 的 21 次方 FLOPs约 18.0%约 15.8%约 14.7%10 的 22 次方 FLOPs约 23.5%约 20.9%约 19.6%表里的数字代表同一个损失水平下SMELT 比未循环基线少花的训练算力。稀疏度越高专家激活比例越低绝对节省幅度略小但节省比例的增速不变。为什么稀疏度高的档位省得少一点论文解释是稀疏度项放大了基线和 SMELT 的差距影响了「节省幅度」的水平而不是影响它的增长速度。四、下游收益代码最强长样本更强验证损失更低只能说明训练阶段表现好还要看下游任务是否真的受益。论文的答案是不仅受益而且收益超出验证损失能预测的水平。在最高规模540 亿非嵌入参数、约 97% 稀疏度上SMELT 在五类 DCLM Core 评测加上 MMLU 一共六个方向的准确率全面领先未循环基线。更有意思的是收益的分布规律优势在代码类任务上最大而且随着样本变长、上下文里的示范样例变多SMELT 相对基线的优势还会继续扩大。这背后的逻辑很顺循环层给了模型更多轮「重新看一遍」的机会长文本和带多个示例的任务正好需要这种反复加工循环结构的收益在这种场景里最能兑现。论文还做了一层机制分析想看清「第二遍到底多做了什么事」。通过检查注意力权重的分布他们发现第二遍执行会压低一种叫 attention sink 的现象。attention sink 是模型学到的一种偷懒行为很多注意力头会把大量注意力分数堆在少数几个特殊 token 上而不是真正去关注内容相关的 token。第二遍循环把这种「注意力陷阱」压下去把注意力质量重新导向内容相关的 token这可能是循环结构带来收益的内在原因。五、意义与局限这篇论文给「循环型 Transformer」正了一次名。之前这类结构总被怀疑是拿算力换分数SMELT 在三个预算口径全部对齐的情况下仍然跑出 6.8% 到 18% 的训练算力节省说明深度复用本身是有价值的不是作弊。对大模型训练来说这给出一个可以直接抄的实操配方中间层循环两遍、收窄隐层、加专家、调小注意力头。训练成本每省下 10%在动辄上亿美元的预训练账单里都是真金白银。局限也要摆清楚。第一最高验证规模是 540 亿非嵌入参数离当前商用前沿的万亿级模型还差两个数量级扩展律外推本身有不确定性。第二收益集中在长样本、多示例场景对短 prompt、单轮问答类任务循环的额外价值有限。第三attention sink 的解释目前是机制层面的观察证据指向相关性但因果链条还需要更多实验锤实。第四循环结构会增加推理时的计算轮次训练省下的算力是否会在推理端以时延的形式还回去论文没有给端到端的部署结论。对做模型的人来说这篇论文最大的提醒是算力对齐是一种比「参数量对齐」严格得多的对比标准能在这种标准下跑出优势的架构改动才真正值得跟进。SMELT 用一次干净的实验给循环层这条老思路指出了一个新的可行方向。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价