资讯动态

【AI大模型】RL反常识研究,直接给LLM喂答案比提供详细步骤更有用!

发布时间:2026/8/27 17:41:13 来源:尧图企业网站定制
前言❝一句话概括大模型学数学原来强化学习不是教它刷题而是教它怎么“开窍”和查资料给它标准答案的中间步骤有时还不如让它自己瞎琢磨。原论文题目见文末点击阅读原文可直接跳转至原文链接Published on arxiv on 05 Jun 2025 by University of Wisconsin-Madison, Salesforce AI Research亲爱的读者们沈公子的公众号agent和base model近期取得了重大突破今后公众号文章行文会更流畅处理公式和符号也完全达到人类专家水准会大幅减少出现错乱和显示异常的情况提升阅读体验。enjoying *第一阶段识别核心概念**论文的motivation分析*当前我们都知道用强化学习Reinforcement Learning, RL来“训练”大语言模型LLM进行数学推理效果非常好模型在各种数学竞赛榜单上刷出了惊人的高分。但是这里存在一个“知其然而不知其所以然”的问题。论文作者的动机正是源于此。他们发现大部分研究只是简单地报告模型在某个数据集上的准确率提升了多少比如从50%提升到了80%。这就像我们看到一个学生成绩变好了但我们并不知道他究竟是解题思路变清晰了、基础知识更扎实了还是审题能力变强了。这种只看最终分数的“黑箱式”评估无法告诉我们RL到底在哪个环节、以何种方式增强了模型的推理能力。因此这篇论文的核心动机是打开强化学习提升LLM推理能力的“黑箱”精细化地、可度量地分析出RL到底在哪些具体能力维度上带来了提升以及这些提升是如何发生的。*论文主要贡献点分析*提出SPARKLE分析框架这是论文最核心的贡献。它不再满足于单一的准确率指标而是从三个关键维度来“解剖”模型的推理过程规划遵循与执行Plan-following and execution模型是擅长自己规划解题步骤还是更擅长执行别人给定的计划知识运用Knowledge utilization模型是自己记忆的知识库不全还是有了知识比如公式、定理却不知道如何应用问题分解Problem decomposition模型能将一个复杂的大问题拆解成一系列小问题并逐一解决吗构建SPARKLE基准测试集为了让SPARKLE框架能落地作者们对现有的数学问题数据集进行了“增强”为每个问题都人工标注了上述三个维度的辅助信息高层解题计划、所需的背景知识、以及分解后的子问题序列。这创建了一个独一无二的、可用于精细化分析的“靶场”。提出多阶段RL训练策略基于对问题难度的分析作者设计了一种更高效的RL训练流程。它首先在大量不同难度的问题上进行普适性训练第一阶段然后在精选出的“难题”上进行专项攻坚训练第二阶段并且在训练难题时会给模型一些“提示”部分解题步骤以帮助模型从这些难题中有效学习。支撑创新的关键技术/方法SPARKLE框架通过设计三种不同的测试模式给计划/不给计划给知识/不给知识解完整问题/解子问题来隔离和评估模型在三个维度上的能力。多阶段RL训练采用了GRPO Group Relative Policy Optimization算法并结合了课程学习 Curriculum Learning的思想先易后难并对难题进行“增强”处理提供部分解题方案作为上下文。显著性的结果与意义这篇论文最重要的结果是一些反直觉但极具启发性的发现这些发现比单纯的SOTAState-of-the-Art分数更有价值“好心办坏事”的外部计划对于基础模型而言给它一个详细的解题计划反而会降低它的表现。这表明模型有自己的一套“思维定式”强行让它遵循外部逻辑会适得其反。而经过RL训练的模型则能更好地适应外部计划甚至从中受益展现出更高的“灵活性”。RL的核心是“学会如何学习”RL训练后的模型在得到外部知识如公式时性能提升非常显著。这说明RL不仅是让模型“记住”更多知识更是教会了模型一种“如何整合并运用新信息”的能力。“眼高手低”的子问题解决能力即使是强大的RL模型虽然能解决复杂的整体问题但在被要求按部就班地解决所有分解后的子问题时成功率却急剧下降。这揭示了当前模型推理能力的瓶颈它们可能依赖一种“直觉式”的整体性推理而非严谨的、步步为营的逻辑推演。*理解难点识别*核心概念SPARKLE分析框架的设计思想是理解整篇论文的钥匙。读者需要明白为什么这三个轴规划、知识、分解是关键以及作者是如何通过实验设计来独立评估每一个轴的。最具挑战性的部分最具挑战性的不是某个复杂的数学公式而是理解实验设计背后的逻辑。例如如何理解“给模型提供计划反而性能下降”这一现象背后的含义并将其与RL的作用联系起来。此外GRPO算法作为训练的核心其目标函数也需要一定的理解。需重点解释的核心概念我们将重点解释SPARKLE框架的三个分析维度并通过一个生动的比喻来阐释它们。同时我们将深入解析GRPO算法因为它是在幕后驱动模型进化的“引擎”。*概念依赖关系*切入点最佳的切入点是解释为什么需要SPARKLE框架即传统准确率评估的局限性。依赖关系理解了SPARKLE框架才能明白论文中各种图表如Figure 3, 4, 5的意义。SPARKLE框架揭示了模型的特定弱点如知识整合、难题处理。这些发现又启发了多阶段RL训练策略的设计该策略旨在有针对性地解决这些弱点。GRPO算法是实现这个训练策略的具体技术手段。 因此我们的解释顺序将是SPARKLE框架 - GRPO算法 - 多阶段训练流程。*第二阶段深入解释核心概念**设计生活化比喻*想象一下我们正在训练一位实习厨师Base LLM目标是让他成长为一位能独立制作顶级法式大餐如“惠灵顿牛排”的米其林大厨RL-tuned LLM。而我们就是那位经验丰富的烹饪教练RL训练过程。传统的评估方法就像是只品尝最终的成品牛排然后打一个“好吃”或“不好吃”的分数对应准确率。但作为教练我们想知道实习厨师到底在哪方面有欠缺以便因材施教。这时我们就引入了SPARKLE烹饪分析法从三个维度来“解剖”他的厨艺规划与执行能力 Plan-following测试A给他一张非常详细的菜谱外部计划让他严格照做。测试B只告诉他要做惠灵顿牛排让他凭借自己的理解和记忆去发挥内部计划。对比分析如果他照着菜谱反而手忙脚乱成品更差说明他还不适应或者不理解菜谱的逻辑更习惯于自己那套不成熟的流程。如果他能很好地执行菜谱说明他执行力强但缺乏规划能力。知识运用能力 Knowledge utilization在旁边放一本《烹饪术语大全》外部知识里面解释了什么是“美拉德反应”、“酥皮起酥原理”等。测试观察他在烹饪时是否会主动查阅、理解并应用这些知识来改进自己的操作。比如他是否理解了要高温快煎才能锁住肉汁美拉德反应。分析如果他有了这本书但做出来的牛排还是很柴说明他知识整合能力差。如果他能用好这本书说明他“会学习”。问题分解能力 Problem decomposition我们将制作惠灵ton牛排这道大菜分解成几个独立的子任务Subproblems1准备蘑菇酱2煎牛里脊3擀酥皮4包裹并烘烤。测试让他分别完成这四个子任务我们对每个半成品都进行品尝和打分。分析可能他蘑菇酱炒得完美牛排也煎得恰到好处但最后包裹时酥皮破了或者烘烤的火候不对。这说明他单个步骤可能没问题但将它们无缝衔接并完成最终目标的能力有欠缺。*建立比喻与实际技术的对应关系*比喻中的元素实际技术概念合理性解释实习厨师基础大语言模型 (Base LLM)初始状态能力有限需要训练和指导。米其林大厨经RL微调的模型 (RL-tuned LLM)经过大量实践和反馈能力得到显著提升。烹饪教练强化学习 (RL) 训练过程通过奖励好吃和惩罚难吃来指导模型优化。最终菜品味道最终答案的准确率这是最直接、但也是最粗糙的评价指标。详细菜谱外部规划 (Planning Skeleton)提供了解决问题的宏观步骤。《烹饪术语大全》外部知识 (Knowledge Components)提供了解决问题所需的定理、公式等背景知识。分步制作任务子问题链 (Chain of Subproblems)将一个复杂问题分解成多个可独立解决的小问题。教练的指导方法GRPO 算法这是教练用来指导厨师进步的具体、量化的方法论。*深入技术细节GRPO算法*现在我们来看看“烹饪教练”具体是如何指导“实习厨师”的。他用的方法就是GRPO。教练会让厨师对一个菜品一个数学问题做好几次尝试生成多个解法然后根据这些尝试的好坏来调整教学策略。其核心是优化以下目标函数其中的具体形式为这公式看起来吓人但用我们的比喻和自然语言替换一下就清晰多了符号替换版对模型进行优化的总目标综合考虑所有问题和所有尝试单个问题上所有尝试的平均提升单个问题上所有尝试的平均提升 对每一次尝试的每一个步骤进行评估 取以下两个值中较小的一个 “新模型的倾向性” × “这个步骤的优势”, “被限制在小范围内的倾向性” × “这个步骤的优势” -防止模型跑偏的惩罚项逐一解释π_θ(...) / π_{θ_old}(...)(新模型的倾向性)数学含义新模型π_θ生成某个步骤 的概率与旧模型 生成该步骤的概率之比。厨师比喻教练观察到实习厨师在某次尝试中“先放盐后放油”如果这个做法带来了很好的效果教练希望新一代的你新模型更倾向于“先放盐后放油”概率比值 1。Â_{i,t}(这个步骤的优势)数学含义Advantage estimate衡量在当前状态下采取某个动作生成某个词比平均水平好多少。如果一个解法最终得分很高那么它包含的每个步骤都会获得正向的“优势” credit。厨师比喻对于一次成功的烹饪其中“高温快煎”这个步骤被认为是关键。那么“高温快煎”这个操作就获得了很高的优势值。教练会重点表扬和强化这个行为。clip(...)(被限制在小范围内的倾向性)数学含义将概率比值限制在 这个小区间内。厨师比喻教练虽然鼓励创新但也怕实习厨师步子迈得太大扯着蛋。如果厨师某次尝试突然从法餐跳到分子料理即使效果惊艳教练也会说“很好但我们先别变得那么激进慢慢来。” 这可以防止模型更新过快导致性能崩溃。min(...)的作用就是采取保守策略当你想大步前进时clip项会把你拉回来让你走得更稳。β * D_KL[...](防止模型跑偏的惩罚项)数学含义KL散度衡量新模型π_θ的整体策略与一个可靠的参考模型 通常是训练前的SFT模型之间的差异。差异越大惩罚越大。厨师比喻教练允许厨师发展自己的风格但不能完全脱离法餐的基本法度。这个惩罚项就像是在说“你可以自由发挥但你做的菜必须还得能被认出是惠灵顿牛排不能变成一个完全不相干的东西。”*将技术细节与比喻相互映射*技术步骤在比喻中的体现整个GRPO过程就像教练RL算法让厨师LLM针对一个菜谱问题做次尝试。然后教练品尝每一份成品计算Reward并分析出哪些步骤是“神来之-比喻如何帮助理解技术细节比喻将抽象的数学符号如概率比、优势函数、KL散度转化为了具体的、有动机的行为如“鼓励好操作”、“防止跑偏”、“保持基本功”。这使得算法背后的设计哲学变得直观易懂。*总结*核心联系SPARKLE框架就像一套精密的诊断工具用来找出实习厨师的“能力短板”而GRPO算法则是教练手中那套行之有效的教学方法用来弥补这些短板并最终将实习厨师培养成米其林大厨。关键数学原理总结GRPO的精髓在于在鼓励探索基于优势 Advantage和保持稳定基于 clip 和 KL 散度之间找到一个最佳平衡点。它通过比较一组尝试的好坏来产生学习信号这比单一样本学习更稳定、更高效。*第三阶段详细说明流程步骤**流程一使用SPARKLE框架进行模型能力剖析*这个流程的目标是评估一个已经存在的LLM。首先向模型输入一个来自SPARKLE基准测试集的问题包含问题本身、标准答案、规划、知识、子问题。处理流程基准测试无辅助信息输入仅有问题描述让LLM生成解题思路和最终答案得到模型的原始解题性能作为基线。轴1评估规划遵循与执行能力输入问题描述和规划骨架让LLM在指引下解决问题。对比基线若性能提升则执行能力强若下降则外部计划有干扰。轴2评估知识运用能力输入问题描述和相关知识点。对比基线若性能大幅提升则瓶颈在知识否则在于应用能力。轴3评估问题分解能力这是一个序贯过程逐一输入子问题及其前序答案让模型逐步求解。最终计算子问题成功率SSR。对比基线若SSR远低于整体解决率说明模型不擅长分步式逻辑推理。最终输出一个关于该LLM在规划、知识、分解三个维度上的详细能力画像。*流程二多阶段RL训练流程*这个流程的目标是训练出一个更强大的推理模型。输入一个基础LLM如Qwen-2.5-Math-7B一个包含40K数学问题的大型训练集一个包含5.7K难题的增强训练集。处理流程分为两个阶段。阶段一通用能力RL微调在40K通用问题上进行训练。对每个问题模型生成个解法通过奖励函数打分并使用GRPO算法更新模型。此阶段旨在建立强大的基础推理能力输出模型SparkleRL-Stage 1。阶段二难题攻坚RL微调在5.7K难题上继续训练SparkleRL-Stage 1模型。这些难题被增强处理即输入时会随机附带0到4个解题“提示块”。训练过程与阶段一类似但会用更大的KL散度惩罚来防止模型“忘记”通用能力。此阶段旨在特别强化对高难度问题的解决能力输出最终模型SparkleRL-Stage 2-aug。*第四阶段实验设计与验证分析**主实验设计解读核心论点的验证*核心主张验证论文的核心主张是1 他们提出的多阶段RL训练是有效的能显著提升模型推理能力2 专门针对难题的增强训练Stage 2-aug能带来额外的性能提升。实验设计分析数据集作者选择了AIME24, AMC23, MATH500, GSM8K, OlympiadBench。这个选择非常合理因为这些数据集覆盖了从小学到国际奥赛的完整难度梯度这对于验证关于“难题”的假设至关重要。评价指标Avg8。即模型生成8个答案只要其中有一个是正确的就算通过。这个指标比单次尝试pass1更能衡量模型的核心推理能力是当前领域的公认标准。基线方法实验设置了Qwen-2.5-Math-7B-Base未经训练作为外部基线以及SparkleRL-Stage 1仅通用训练作为内部基线。这种设计可以非常清晰地剥离出每个训练阶段带来的具体性能增益。结果与结论Table 1的结果清晰地支撑了核心主张。SparkleRL-Stage 1相比Base模型在所有数据集上都有巨大提升平均从35.23%提升到65.01%证明了通用RL训练的有效性。更关键的是SparkleRL-Stage 2-aug模型在所有模型中取得了最佳的平均性能67.03%尤其是在最难的AIME24上达到了50.42%的惊人分数。这直接证明了论文的第二个核心主张使用带有部分解题提示的难题进行专项训练可以进一步压榨模型的性能潜力。*消融实验分析内部组件的贡献*这里的“消融实验”非常巧妙它是通过SPARKLE框架的三个分析轴来实现的可以称之为“分析性消融”即通过控制输入信息来“消融”模型在某个能力维度上的需求。消融组件1自主规划能力 (Figure 3)如何消融通过向模型提供一个完整的规划骨架来“移除”模型自己进行宏观规划的需要。结果与证明实验发现对于Base模型提供规划后性能反而普遍下降。这证明了自主规划是其固有推理路径的一部分外部干扰是有害的。而RL模型性能稳定说明RL训练出的模型规划能力更灵活、更强大能兼容甚至利用外部规划。这定量地证明了RL在“规划灵活性”上的巨大贡献。消融组件2知识检索能力 (Figure 4)如何消融通过向模型提供解题所需的全部知识点来“移除”模型自己回忆或检索知识的需要。结果与证明Base模型在获得知识后性能依然下降平均-5.4%而RL模型则性能显著提升平均4.2%。这个鲜明的对比有力地证明了RL训练的关键贡献之一是赋予了模型整合和应用外部知识的能力而不仅仅是记忆知识。这个模块知识整合能力是RL模型独有的、不可替代的优势。消融组件3整体推理能力 vs. 分步推理 (Figure 5)如何消融将问题分解成子问题链迫使模型一步一步解决从而“移除”其进行跳跃式、整体性推理的可能性。结果与证明所有模型包括最强的RL模型在解决所有子问题上的成功率SSR都远低于解决原始问题的成功率。这证明了模型的成功并非建立在完美的、可分解的逻辑链上。这揭示了模型能力的一个重要局限性证明了模型的“高层整合推理”是一个不可或缺的、但目前还很神秘的组件。*深度/创新性实验剖析洞察方法的内在特性*最巧妙的实验按难度分层的性能增益分析 (Figure 6)实验目的这个实验旨在回答一个更深层次的问题提供“规划”和“知识”这两种帮助在哪种难度的问题上最有效这能揭示模型在不同挑战水平下的核心瓶颈。实验设计作者将测试集按难度分为10个等级。然后对每个等级分别计算提供“规划”和“知识”后相较于无帮助时的性能变化pass1的增益或损失。这就像对不同水平的病人使用两种药物观察疗效。实验结论与价值规划的影响Figure 6a提供规划的帮助或伤害与问题难度关系不大曲线比较平坦。知识的影响Figure 6b提供知识的帮助随着问题难度的增加而急剧增大。在难度为10的问题上给RL模型提供知识能带来高达100%的性能增益深刻洞见这个结果揭示了一个至关重要的内在特性对于简单问题模型可能什么都知道但对于真正困难的问题模型的瓶颈不是“不知道怎么做规划”而是“缺少必要的知识”。这个发现对于未来的研究方向有极强的指导意义例如对于难题与其优化模型的规划能力不如为其配备一个强大的知识检索系统如RAG来得更有效。这个实验堪称神来之-深刻洞见这个结果揭示了一个至关重要的内在特性对于简单问题模型可能什么都知道但对于真正困难的问题模型的瓶颈不是“不知道怎么做规划”而是“缺少必要的知识”。这个发现对于未来的研究方向有极强的指导意义例如对于难题与其优化模型的规划能力不如为其配备一个强大的知识检索系统如RAG来得更有效。这个实验堪称神来之笔它将论文的分析从“是什么”提升到了“为什么”和“该怎么办”的层面。最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价