资讯动态

ICLR 2026|MathForge:用难题驱动强化学习,提升大模型数学推理

发布时间:2026/9/10 9:39:15 来源:尧图企业网站定制
来源机器之心 本文约3500字建议阅读5分钟 MathForge 真正回答了一个非常关键的问题在强化学习里哪些题最值得学在大模型数学推理的强化学习中一个看似简单、却长期没有被认真回答的问题是模型在训练时到底应该更重视哪些题目太容易的题模型往往已经掌握继续训练带来的收益有限完全不会的题在当前阶段又很难提供有效的正向学习信号。真正最值得投入训练预算的往往是那些更难但并非不可学的问题。围绕这一点中国人民大学高瓴人工智能学院联合阿里巴巴高德、厦门大学和大连理工大学的研究团队提出 MathForge从算法和数据两端同时发力让大模型在强化学习过程中更有效地攻克难题从而显著提升数学推理能力。论文题目Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation论文地址https://arxiv.org/abs/2601.20614代码仓库https://github.com/AMAP-ML/MathForge一、为什么现有方法还不够「重视难题」近年来基于可验证奖励的强化学习Reinforcement Learning with Verifiable Rewards, RLVR的方法已经成为提升大模型数学推理能力的重要路线。它不依赖额外训练奖励模型而是直接通过规则检查答案是否正确因此在数学这类“答案可验证”的任务上非常自然、也非常高效。但这篇工作指出现有方法对「难题」的忽视实际上来自两个层面。第一是算法层面。当前广泛使用的 GRPO本质上是在同一道题生成的一组回答之间做相对比较再决定更新方向和更新幅度。问题在于这种机制并不会天然让模型更关注难题。相反论文通过理论分析指出GRPO 的更新强度会更偏向中等难度题而对过难和过易题的更新反而会被压低。这意味着在同一个训练批次中那些真正能暴露模型短板、但又不是完全学不会的「难而可学」问题未必能得到足够大的训练信号。模型最该花精力去学的题不一定真的被重点学到了。第二是数据层面。已有的数学推理数据增强方法常见做法要么是从头生成新的题目和答案要么只是对原题做简单重述。前者往往很难保证答案质量尤其是高难度竞赛数学题后者虽然提升了表述多样性却没有真正提高了题目的内在难度。二、MathForge从算法和数据两端同时「锻造」模型为了解决上面这两个问题论文提出了一个双轮驱动框架 MathForge。它由两个核心部分组成DGPODifficulty-Aware Group Policy Optimization难度感知的组策略优化MQRMulti-Aspect Question Reformulation多方面问题改写一个解决「怎么学」一个解决「学什么」。1. DGPO让「更难但可学」的题真正被学到DGPO 的核心思想并不是一句简单的「给难题更高权重」而是一个非常清晰的两步过程先平衡再重加权。第一步是 DGAEDifficulty-balanced Group Advantage Estimation难度平衡的组优势估计。作者发现GRPO 中对优势的归一化方式会带来对不同难度问题的更新幅度的不平衡。具体来讲GRPO 的优化目标如下在不考虑梯度剪裁的情况下GRPO 的策略梯度如下把 GRPO 的梯度拆开来看会发现优势项的符号决定更新方向而优势项的绝对值决定更新幅度。所以一道题对参数更新的整体影响可以用组内所有回答优势绝对值之和来近似理解。其中最值得注意的是那些困难但可答对的题目它们正确率不高但并不是完全不会做。作者认为这类题其实最有训练价值因为它们恰好暴露了模型尚未掌握、但已经接近掌握的能力边界。为此DGAE 用平均绝对偏差MAD替代了原先的标准差归一化其组相关优势的计算方式如下作者在下方的定理 2 中证明在不依赖必须使用二值正确性奖励的情况下DGAE 对每道题的总更新幅度为相等的定值 。这让不同题目的更新幅度变得更加平衡不再天然偏向中等难度题。第二步是 DQWDifficulty-aware Question-level Weighting难度感知的问题级别加权。在更新幅度被拉平之后DQW 再根据题目当前的平均正确率来估计难度对那些更难、但仍有有效学习信号的问题赋予更高权重。具体的权重计算方式如下2. MQR把问题改得更难但答案不变如果说 DGPO 回答的是「怎么学」那么 MQR 回答的就是「学什么」。MQR 不满足于对原题做浅层重述而是系统性地从三个方向提升题目难度同时严格保持原始标准答案不变。核心指令如下第一种是 Background。给原题加入看似相关、但实际上会带来干扰的信息背景让模型必须在更复杂的叙述里抓住真正关键的数学条件。第二种是 Term。给题目中的核心概念引入新的抽象术语让模型不能只靠熟悉的表面表达来作答而必须真正理解定义和结构。第三种是 Sub-Problem。把原题中的一个关键数值条件改造成一个需要先求解的小问题再返回主问题。这会显著增加推理链条长度也更考验模型的多步推理和跨领域推理能力。构造数据时有一个严格的限制条件是所有改写后的题目都必须保持原始 gold answer 不变。这意味着MQR 不是在重新造一套不稳定的新题而是在尽量不破坏数学本质和标准答案的前提下系统性地把同一道题改得更难、更有挑战性。这样既保证了训练信号的可靠性也降低了额外数据构造的成本和难度。三、实验结果更难的训练带来更强、更稳、更泛化的推理实验结果非常清楚地说明了一点更难的问题确实更值得学。如表 1 所示在主实验设置下无论是只使用 DGPO还是只使用 MQR都能明显超过强基线 GRPO而当两者结合成完整的 MathForge 后效果进一步达到最好相比 GRPO 带来了超过 4.5 个点的平均提升。更重要的是这个优势并不是只在单一对比下成立而是在与多种已有强化学习优化方法比较时依然保持了最强的整体表现。进一步地如表 2 所示MathForge 在不同大小、不同类型的基础模型上都保持了稳定收益。从较小模型到 7B 级模型它都能带来大约 3 到 4.5 个点的平均提升。这说明它并不是依赖某一个特定 backbone 的「技巧性调参」而是一种更普适的训练原则。在算法分析上如表 3 所示DGPO 的两个关键设计也都被验证是必要的DGAE 负责先把不同难度问题的更新强度拉平DQW 再把训练重点推向更难但可学的问题两者是互补关系而不是可有可无的附加项。与此同时如表 4 所示DGPO 还可以与多种现有强化学习方法直接结合并继续带来额外收益说明它并不是一个封闭替代方案而更像是一种可插拔的通用增强机制。更值得注意的是这种「按难度组织学习」的思路并不只适用于文本数学任务。如表 5 所示论文还把 DGPO 应用到了多模态数学推理场景中结果同样比 GRPO 有超过 2 个点的提升。这说明 MathForge 所强调的并不是某个特定数据集上的偶然技巧而可能是一种更广泛适用的后训练思路不同问题不应该被一视同仁训练预算应该优先留给更难、但仍有学习价值的问题。从数据角度看MQR 的效果也并不只是「样本变多了」。如表 6 和表 7 所示论文专门控制了总训练量后发现使用 MQR 改写后的数据依然优于只用原始数据的训练版本三种改写策略单独使用时都有效组合起来效果最好。这意味着 MQR 真正带来的是更有价值的训练样本而不是简单的样本堆叠。更细致的难度分析还表明这三类改写后的问题整体都比原题更难其中把关键条件改造成子问题的方式最能拉高推理难度。在训练动态方面如图 1 所示对于 DGPO 来说模型不仅更准而且输出还更简短说明它学到的不是更冗长的推理而是更高效的推理路径。如图 2 所示对于 MQR 来说模型在训练阶段的准确率变得更低但最终测试表现却反而更好呈现出非常直观的「train harder, test better」现象。也就是说更难的数据确实在逼着模型形成更强的泛化能力而不是只在容易题上反复刷分。四、总结MathForge 真正回答了一个非常关键的问题在强化学习里哪些题最值得学答案不是最简单的题也不是完全不会的题而是那些更难、但仍然可学的问题。DGPO 负责让模型在训练中真正重视这类问题MQR 负责稳定地产生这类问题。两者结合最终把「更难的训练」转化成了「更强的推理」。从这个意义上说MathForge 的价值不只是把数学推理结果再往前推了一步更重要的是它提供了一种非常清晰的训练观不是所有样本都应该被平等对待真正高价值的学习往往发生在难而可学的边界地带。这也正是这篇工作的标题想表达的核心Harder Is Better。代彦琪个人主页https://yanqidai.github.io/现为人大高瓴四年级直博生、南洋理工大学访问学生师从卢志武教授与张含望教授主要研究方向为多模态大模型和强化学习。预计于 2027 年 6 月毕业目前正积极寻求工业界发展机会。编辑文婧关于我们数据派THU作为数据科学类公众号背靠清华大学大数据研究中心分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识努力建设数据人才聚集平台、打造中国大数据最强集团军。新浪微博数据派THU微信视频号数据派THU今日头条数据派THU

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价