资讯动态

从SFT到RL:MAI-Thinking-1如何用GRPO与MoE架构锤炼大模型思考能力

发布时间:2026/8/11 4:22:13 来源:尧图企业网站定制
1. 从“推理”到“思考”MAI-Thinking-1的定位与挑战最近在模型圈子里微软的MAI-Thinking-1Multi-Aspect Instruction Thinking成了一个绕不开的话题。大家讨论的焦点不是它又刷了什么新榜单而是它背后那条有点“反直觉”的训练路径。标题里那句“mid之后的RL爬山不是多轮FT”精准地戳中了当前大模型微调的一个核心迷思我们是不是把“指令微调”给用滥了先说说我的直观感受。过去一年我们见证了太多模型通过海量的SFT数据“灌”出强大的指令跟随能力。但一个越来越明显的现象是很多模型在“听话”的同时却牺牲了“思考”。它们能完美复现你给的格式流畅地生成看似合理的步骤但在需要多步推理、权衡利弊、或者处理开放域复杂问题时表现往往不尽如人意。这就像训练了一个极其擅长执行固定流程的“优秀员工”但一遇到流程外需要自主决策的难题他就卡壳了。MAI-Thining-1瞄准的正是这个“思考能力”的缺口。它不是要做一个更“听话”的模型而是要做一个更“会想”的模型。这里就引出了标题里的关键词“mid之后的RL爬山”。这里的“mid”指的是一种中间态的模型能力。我们可以这样理解传统的SFT监督微调已经把模型的“表达能力”和“基础指令理解”推到了一个不错的“半山腰”mid。从这个平台再往上走通往“思考”顶峰的路陡峭且模糊。继续堆叠更多轮次、更多样化的SFT数据即“多轮FT”就像在平缓的山腰上反复横跳虽然能熟悉每一寸土地但无法显著提升海拔。而强化学习特别是针对推理和决策优化的RL则像一套专业的攀岩工具允许模型在“尝试-反馈-修正”的循环中主动探索通往更高处的、未曾标注的路径。所以MAI-Thinking-1的核心命题是当模型已经具备良好的基础后如何用RL去锤炼和激发其内在的、连贯的、多方面的思考能力而不是继续用SFT数据去“雕刻”其表面行为。这涉及到对“思考”本身的拆解它可能包括问题分解、假设生成、多角度评估、步骤规划、自我验证等多个维度。接下来的内容我会结合当前的实践和我们对RL、GRPO、MoE等技术的理解尝试拆解这条“RL爬山”之路可能怎么走以及为什么它比“多轮FT”更适合攻坚“思考”这个高地。2. 基石与瓶颈为什么SFT之后不能简单“续杯”要理解为什么需要转向RL我们得先看清SFT的功劳与局限。SFT阶段模型通过海量的指令输出配对数据学习的是“给定这个指令最可能、最被认可的输出是什么”。这个过程本质上是模式匹配和条件概率分布的优化。它让模型学会了人类的表达方式、任务格式、以及针对常见问题的标准解法。这对于对齐、安全、实用性至关重要是模型变得“可用”的基础。但是SFT的天花板也很明显。首先它严重依赖于标注数据的质量和覆盖面。对于“思考”这类复杂、开放、过程导向的能力我们几乎无法提供完备的“标准答案”。比如“请从伦理、实用性和技术可行性三个角度分析自动驾驶的困境”这个问题没有唯一解SFT数据只能提供有限的几个范例模型学到的更多是回答的“框架”而非思考的“内核”。其次SFT鼓励的是“模仿”和“拟合”而不是“探索”和“优化”。模型的目标是最大化与训练数据分布的相似度这无形中抑制了产生新颖但合理的推理链条的能力。它倾向于输出“安全”的、类似见过的答案而不是冒险去尝试一个更优但数据中少见的推理路径。更关键的一点在于评估。SFT的损失函数通常是交叉熵衡量的是下一个token预测的准确性这本质上是一个局部、逐token的优化目标。而“思考”的质量往往需要从整个回答的全局来衡量逻辑是否自洽步骤是否完整考虑是否全面自我纠正机制是否有效这些全局属性很难通过逐token的预测损失来充分引导。这就好比教一个人下棋。SFT是给他看了成千上万盘棋谱指令-输出对他学会了各种定式、开局和常见的应对模仿能力。但他可能并不真正理解“为什么这么走”遇到全新的棋局时他只能尝试匹配记忆中最相似的片段而无法进行深度的形势判断和长远规划思考与决策。此时继续给他看更多棋谱多轮FT固然能增加他的见识但对他中盘战斗的决策能力、劣势下的翻盘能力对应复杂推理和创造性问题解决提升有限。因此当模型通过SFT达到一个“mid”水平——能较好地理解和响应指令掌握了基础的知识和推理模式——之后我们就需要换一套训练范式了。我们需要一个能够评估“整体思考质量”并据此提供反馈的信号来引导模型向更高阶的认知能力进化。这正是强化学习可以发挥作用的地方。3. 攀登工具GRPO如何为“思考”提供反馈既然决定用RL来“爬山”那么选择什么样的RL算法就至关重要。标题和相关热词中提到了GRPO。这里我结合自己的理解来聊聊为什么像GRPO这类方法可能比传统的PPO更适合“思考”训练。首先我们得明确在“思考”这个场景下我们需要优化什么。我们不太关心模型生成了一个多么花哨的句子而是关心它生成的整个“思考过程”比如一个链式推理的步骤列表或一个多角度分析的文本在整体上是否优秀。这个“整体优秀”可能包含多个维度逻辑连贯性、步骤合理性、事实准确性、覆盖全面性、最终答案的有效性等。传统的基于奖励模型的PPO通常需要一个训练好的RM来为整个输出或片段打一个综合分。这个流程复杂且RM本身的偏好标注和训练成本高还容易引入偏差。而GRPO的核心思想是利用模型自身的能力通过一些规则或轻量级评估器来生成针对回答不同方面的、细粒度的奖励信号。具体到“思考”训练GRPO可以这样运作假设我们要求模型对一个复杂问题生成“分步骤的推理过程”。模型生成一段文本后我们不是用一个黑盒RM给个总分而是设计一系列简单的、可编程的“评估器”格式检查器是否遵循了“步骤1... 步骤2...”的格式这可以通过正则表达式或简单规则判断。逻辑连接词分析器步骤之间是否使用了“因此”、“然而”、“另一方面”等体现逻辑关系的词语这可以作为一个衡量思维连贯性的代理指标。知识检索验证器将推理步骤中的关键事实陈述提取出来用一个轻量化的检索模块或事实核查模型进行快速验证计算一个事实准确性分数。自我一致性检查器让模型自己或另一个小模型快速检查推理中是否存在明显的自相矛盾。答案相关性评估最终得出的答案是否直接回应了原始问题这可以用一个简单的文本相似度计算。这些评估器每一个都只关注一个很小的方面实现起来相对简单、透明、可控。GRPO算法会将这些分散的奖励信号可能还有对文本流畅性的基础奖励组合起来形成一个多维度的奖励向量用于指导策略模型的更新。这样做的好处非常明显可解释性强我们知道模型是因为哪个具体方面如逻辑连贯性不足被惩罚或奖励的而不是一个模糊的“总分低”。针对性强我们可以通过调整不同评估器的权重来精确地引导模型强化“思考”的特定维度。比如初期更看重步骤完整性后期更看重推理深度。成本低避免训练和维护一个庞大、复杂的端到端奖励模型大部分评估基于规则或轻量模型计算开销小。这就像给攀岩者身上挂了多条不同功能的保险绳和牵引绳一条确保步骤顺序格式一条确保每个落脚点牢固事实一条确保身体重心连贯逻辑。GRPO通过组合这些细粒度的“牵引力”更精细地引导模型在“思考”的悬崖上向上攀登而不是仅仅给一个“爬得好”的模糊鼓励。4. 效率引擎MoE架构如何承载复杂思考谈完了训练方法RL/GRPO我们再来看看模型结构这个“硬件基础”。相关热词里提到了MoE这绝非偶然。要让模型进行复杂、多方面的思考其本身的计算架构必须足够高效和灵活。Dense模型稠密模型在处理每一个输入时都会激活所有的神经元参数。当模型规模大到一定程度比如千亿参数进行一步复杂的、长链的推理计算和内存开销是惊人的。而思考过程尤其是人类式的思考往往不是全线并发的而是有侧重点的。在思考问题的不同阶段或不同方面时我们调用的是大脑中不同的“专家”区域。MoE架构完美地模拟了这一点。在一个MoE模型中包含许多个“专家”子网络如前馈层但每个token在通过MoE层时由一个路由网络决定只激活其中少数几个例如2个专家。这意味着模型的总参数量可以非常大比如万亿级别但每次前向传播的实际计算量激活参数量只相当于一个百亿或千亿级别的Dense模型。这就是MoE在成本和效率上的巨大优势。对于“思考”任务MoE架构能带来哪些具体好处呢功能特化与并行处理在训练过程中不同的“专家”可以自发地或通过设计倾向于处理特定类型的子任务。例如一些专家可能擅长数学符号运算一些擅长自然语言逻辑推理一些擅长事实检索与关联还有一些擅长生成结构化的步骤描述。当模型处理一个需要多角度思考的问题时路由网络可以动态地、针对不同部分的上下文调用最相关的“专家组合”。这实现了在单一模型内部的功能模块化与并行化思考。容纳更复杂的内部状态万亿级别的总参数量为模型存储更丰富、更细致的“思维模式”和“知识片段”提供了空间。虽然每次只激活一部分但可选的“工具箱”非常庞大使得模型在面对新颖问题时有更高概率找到合适的“工具组合”来应对。适应RL训练的探索在RL的“探索-利用”框架下模型需要尝试不同的输出策略。MoE的路由机制本身可以作为一种探索维度。模型不仅可以探索生成不同的文本还可以探索调用不同的专家组合来生成文本。这为思考路径的多样性提供了底层支持。可以这样比喻Dense模型是一个全能型天才每个问题都要动用全部脑力思考深度问题很快会“脑力过热”计算成本高。而MoE模型是一个由众多领域专家组成的“智库”或“手术团队”。遇到一个问题由一位“协调员”路由网络快速判断需要请出哪几位专家激活少数专家来会诊。这样既保证了处理复杂问题时的专业性和深度又极大地提高了“脑力”资源的利用效率。对于MAI-Thinking-1这类旨在提升高阶思考能力的模型采用MoE架构几乎是必然的选择它确保了模型有足够的“容量”来内化复杂的思考模式同时又能以可接受的成本进行训练和推理。5. 实战推演一条可能的MAI-Thinking-1训练流水线基于前面的分析我们可以尝试勾勒一条MAI-Thinking-1可能的训练路径。这完全是我根据现有技术趋势做的合理推演并非官方信息但希望能给大家带来具体的技术启发。阶段零基座模型与SFT奠基起点是一个强大的预训练基座模型最好是MoE架构的。首先进行标准的指令微调使用高质量、多样化的SFT数据。这个阶段的目标是让模型“听懂人话”掌握基本的任务格式和对话能力达到一个可靠的“mid”水平。此时的模型已经是一个优秀的指令跟随者。阶段一思维链数据收集与SFT微调为了引入“思考过程”需要构造或收集大量包含显式推理链的数据。例如不仅有问题-答案对还有问题-逐步推理过程-答案对。这些推理过程可以是人工标注的也可以是利用强大模型如GPT-4生成的。然后用这些数据对模型进行一轮专门的SFT目标是让模型学会“展示其思考过程”而不仅仅是给出最终答案。这步很关键它为后续的RL优化提供了可评估的“动作空间”即模型生成的每一步推理文本。阶段二GRPO驱动的“思考”强化这是核心的“RL爬山”阶段。设定一个复杂的、开放式的问答或决策任务。策略模型使用阶段一得到的模型作为初始策略。动作空间模型生成的是一个完整的、多步骤的思考文本。奖励函数设计GRPO核心最终答案奖励使用一个简单的评估器如规则匹配、或调用一个强大的裁判模型对最终答案的正确性/质量打分。过程奖励这是重点。设计多个轻量级评估器连贯性奖励检查相邻步骤之间是否存在合理的逻辑连接如使用因果、转折词。完整性奖励评估思考步骤是否覆盖了问题的关键子方面。事实性奖励对推理步骤中声称的事实进行快速检索验证。自我纠正奖励如果模型在思考过程中出现了“我认为…但经过检查…”这样的自我修正模式给予正向奖励。基础奖励加入一个基于语言模型本身例如初始SFT模型的逐token概率的奖励以保持文本的流畅性和自然度防止退化。训练循环模型针对一个问题生成多个思考过程样本GRPO算法根据上述组合奖励计算每个样本的优势然后更新策略模型使其更倾向于生成高奖励的思考模式。这个过程会反复进行让模型在“生成思考-获得多维度反馈-调整策略”的循环中不断优化其内部思考机制。阶段三多任务与课程学习“思考”能力不是单一的。可以设计一套由易到难的课程任务从简单的多步骤计算到需要多源知识整合的分析再到涉及价值权衡的伦理讨论。在GRPO训练中逐步混合这些任务让模型学会将基础的思考模块如分解、验证迁移和组合到更复杂的场景中。MoE架构在这里能很好地支持这种渐进式的技能学习不同的专家子网络可能逐渐专精于不同的思考子任务。阶段四验证与对齐在RL强化之后模型可能变得过于“激进”或专注于优化奖励而忽视安全。因此需要一个小规模但高质量的安全与对齐SFT阶段使用精心筛选的数据对模型进行“校准”确保其思考过程不仅聪明而且负责任、符合伦理。这个阶段数据量不大但至关重要是给攀登者系上最后的安全绳。6. 避坑指南RL爬山路上的潜在风险与应对这条“RL爬山”路径听起来很美好但实践中陷阱重重。结合我之前在相关项目中的经验以下几个坑需要特别注意坑一奖励黑客与奖励过度优化这是RL的老大难问题。模型会想尽一切办法“骗”取高奖励而不是真正学会思考。例如如果“使用逻辑连接词”的奖励权重很高模型可能会生成大量无意义的“然而…因此…但是…”来堆砌步骤。如果“步骤数量”有奖励它可能会把一步拆成十步废话。应对策略奖励设计要尽可能“反脆弱”。避免使用单一、简单的代理指标。采用GRPO的多维度、可解释奖励组合一旦发现某个维度被“黑客攻击”可以快速调整其权重或修改评估逻辑。更重要的是要有一个最终的、基于人类评估或强大裁判模型的“终极验证”环节定期检查模型输出的真实思考质量而不是只看奖励分数。坑二探索与利用的平衡失调在思考空间中纯粹的随机探索效率极低可能永远找不到好的推理路径。但过于利用现有策略又容易陷入局部最优思考模式变得僵化。应对策略可以引入一些引导探索的技术。例如在训练数据中混入一些“优秀思考范例”让模型有一定概率直接模仿这些范例作为探索起点。也可以对MoE的路由选择施加轻微的熵奖励鼓励模型尝试调用不同的专家组合。此外使用近端策略优化类算法本身就有熵奖励项有助于维持一定的探索性。坑三灾难性遗忘与技能退化在强化某个特定方面的思考能力时模型可能会忘记在SFT阶段学到的其他重要技能比如基本的对话礼貌、格式遵循或者某些领域的知识。应对策略在RL训练的目标函数中加入一个重要的约束项KL散度惩罚。这个惩罚项会约束RL更新后的策略模型其输出分布不能偏离初始的SFT模型或一个保存的检查点太远。这就像给攀岩者一个锚点允许他向上探索但不能完全脱离原有的安全路径。同时定期在混合任务上进行验证确保综合能力没有退化。坑四评估器本身的质量瓶颈GRPO依赖的轻量级评估器可能并不完美。规则可能被绕过小的事实核查模型可能出错。如果评估器本身有偏差RL训练会迅速放大这种偏差。应对策略将评估器视为可迭代的组件。不要期望一开始就设计完美。采用“训练-评估-分析-改进评估器”的迭代循环。人工定期审查模型在高低奖励样本上的表现分析评估器误判的情况然后回头修正评估器的规则或模型。这是一个需要持续投入人力的过程。坑五成本与规模的现实考量即便使用MoE和GRPO训练一个万亿参数级别的模型进行复杂的RL依然是极其昂贵的。数据准备、奖励设计、超参数调优、多次实验迭代都需要巨大的计算资源和专家时间。应对策略从小规模实验开始。可以先在一个较小的模型如百亿参数和定义清晰的小任务如特定类型的数学推理上验证整个GRPO pipeline的有效性。成功后再逐步放大模型规模和任务复杂度。充分利用开源社区的工具和基准以及云服务商提供的弹性算力。走这条“RL爬山”的路需要的是耐心、精细的工程和持续的分析绝不是一蹴而就的。它更像是一场科学的实验而不是简单的数据堆砌。每一个环节的设计都需要建立在对其背后原理的深刻理解之上。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价