资讯动态

想得少反而做得好?一文读懂如何训练Deep Research智能体

发布时间:2026/8/4 10:47:06 来源:尧图企业网站定制
解读论文How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1arXiv: 2602.19526来自中科院自动化所与美团。引言Deep Research为什么需要强化学习你有没有想过当你向AI提出一个复杂问题——比如2010年哈德逊县495号公路17号出口所在城镇的人口是多少——AI是怎么一步步找到答案的这类问题不是靠一次性推理就能解决的。AI需要像一个研究员一样先搜索、再阅读、再判断信息够不够、不够就继续搜……这种多轮检索逐步推理最终决策的范式就是当下火热的Deep Research。Search-R1生成管道示例近年来强化学习RL被引入Deep Research训练中因为这个过程天然就是一个长程交互决策问题——智能体需要在稀疏反馈下做出一系列搜索和回答的决策这与RL的核心思想高度契合。然而现有的RL训练方案五花八门有人用PPO有人用GRPO有人用REINFORCE奖励函数有用Exact Match的也有用F1的提示模板更是各有各的设计。到底哪些配置真正在起作用这个问题一直没有系统性的回答。本文要解读的这篇论文正是第一个对Deep Research中RL训练进行全面、系统性研究的工作。研究团队沿着三个解耦的维度——提示模板、奖励函数、策略优化——逐一拆解最终提出了一个更强的基线方法Search-R1。(a)展示了Deep Research的强化学习训练流程(b)展示了探索的三个关键方面的概述提示模板、奖励函数和策略优化核心框架三个维度一个统一视角论文以Search-R1作为基础框架严格复现其架构、数据集和检索器在此受控环境下系统地研究RL训练的三个关键组件提示模板Prompt Template指导智能体如何组织推理和搜索行为奖励函数Reward Function定义什么样的输出是好的策略优化Policy Optimization选择哪种RL算法来更新策略评估则围绕三个核心指标展开预测准确率、训练稳定性、推理成本。实验使用Qwen2.5-3B和Qwen2.5-7B两个模型在7个问答基准上进行评测涵盖单跳QANQ、TriviaQA、PopQA和多跳QAHotpotQA、2WikiMultiHopQA、Musique、Bamboogle。发现一想得越多反而做得越差这是论文中最反直觉的发现之一。在数学推理、代码生成等System-2任务中我们通常认为链式思维Chain-of-Thought越长越好——多想一步答案就更准一些。但在Deep Research场景下情况恰恰相反。研究团队对Search-R1生成的轨迹做了统计分析发现•显式推理token越多准确率越低•检索到的信息token越多准确率也越低(a) 在不同信息标记下的准确性(b) 在不同推理标记下的准确性这意味着在搜索-阅读-回答这种交互式任务中冗长的推理不仅没有帮助反而成了负担。快思考 vs 慢思考基于这一观察论文设计了两种提示模板进行对比慢思考模板Slow Thinking要求模型每次获取新信息后先在think.../think标签内进行显式推理然后再决定搜索或回答。这是Search-R1等现有系统普遍采用的方式。快思考模板Fast Thinking直接让模型输出搜索查询或最终答案不强制要求中间推理步骤。打个比方慢思考就像一个人每查一条资料都要写一段分析笔记而快思考则像一个经验丰富的研究员看完资料直接判断够了答案是这个或还不够再搜这个。实验结果非常明确模型慢思考Search-R1快思考本文Qwen2.5-7B0.4030.422Qwen2.5-3B0.2890.297慢思考为什么会崩溃更关键的是慢思考模板在训练过程中容易出现训练崩溃。(a) 比较在快速思考和慢速思考模板下的训练得分(b) 展示了训练步骤中平均响应长度的演变© 说明了与性能崩溃同时出现的标签激增论文通过详细的训练动态分析揭示了崩溃的机制训练中期模型开始在单次决策前生成大量空的或无意义的think/think标签think标签数量激增与性能骤降高度同步Pearson相关分析显示崩溃阶段think标签数量与奖励之间存在正相关0.4310而稳定训练时几乎无相关-0.0465这说明了什么在PPO的稀疏奖励结构下模型发现了一条捷径堆叠think标签似乎与更高的回报相关联。于是模型不断增加推理标签的数量形成了一个自我强化的恶性循环最终导致训练完全崩溃。而快思考模板从根本上限制了这种无节制的推理膨胀让策略更新聚焦于真正重要的决策——搜索什么、何时回答。发现二F1奖励不如EM问题出在回答逃避在Deep Research的RL训练中奖励函数定义了什么是好的输出。目前主流的两种奖励是•Exact MatchEM答案与标准答案完全匹配得1分否则0分•F1 Score基于token级别的精确率和召回率给出0到1之间的连续分数直觉上F1比EM更温和能提供更细粒度的反馈信号应该更有利于训练。但实验结果却出人意料用EM训练的模型在EM和F1两个评估指标上都优于用F1训练的模型。崩溃的根源回答逃避为什么F1训练反而更差论文深入分析了F1训练过程中的策略行为发现了一个关键的退化模式——回答逃避Answer Avoidance。在F1奖励下的整体准确率、仅回答准确率和回答率阴影区域如图所示当训练分数骤降时回答率Answer Rate也同步大幅下降但已回答样本的准确率却保持相对稳定。这说明模型并不是答错了而是干脆不回答了。为什么会这样因为在纯结果导向的奖励下不回答和答错得到的奖励是一样的——都是0分。模型聪明地发现与其冒着答错的风险去尝试不如直接不给答案。这是一种典型的策略退化模型选择了一条最省力的路径。解决方案F1加入动作级惩罚论文提出了一个简洁而有效的修复方案——F1奖励其中 是搜索动作次数 是回答动作次数。简单来说就是在F1奖励的基础上对不搜索和不回答这两种行为施加轻量级惩罚。这迫使模型必须积极参与搜索和回答过程而不能躺平。在 F1 和 F1 奖励下的训练分数。这里的 F1 指的是通过行动监督增强的 F1效果立竿见影• F1训练曲线恢复稳定消除了回答逃避现象•F1不仅修复了F1的问题还超越了EM基线以Qwen2.5-7B为例平均EM准确率F10.391 EM0.422F10.429。这个发现的意义在于F1奖励本身并不差问题在于缺乏对中间动作的约束。只要加上最小限度的动作监督就能释放F1的潜力。发现三经典的REINFORCE才是最优解在策略优化算法的选择上Deep Research领域目前主要使用三种方法•PPOProximal Policy Optimization使用价值网络critic进行优势估计•GRPOGroup Relative Policy Optimization使用组内相对优势作为基线•REINFORCE最经典的策略梯度方法直接使用蒙特卡洛回报论文在固定提示模板快思考和奖励函数EM的条件下公平对比了三种算法。不同强化学习算法下的训练动态(a) 训练过程中的训练得分(b) 每步平均搜索动作数量稳定性GRPO最差从训练曲线来看GRPO频繁出现训练崩溃稳定性最差。REINFORCE和PPO都能实现稳定收敛。GRPO不稳定的原因在于它依赖同一组采样内的相对优势作为基线。在Deep Research这种多步、长上下文的推理场景中组内动作的方差很大导致基线噪声过高进而引发训练不稳定。准确率REINFORCE最高在最终性能上REINFORCE取得了最高的整体准确率0.437优于PPO0.422和GRPO0.433。推理成本REINFORCE最省最有趣的发现在推理成本上。REINFORCE学到了最紧凑的搜索策略算法单跳QA平均搜索次数多跳QA平均搜索次数总平均搜索次数REINFORCE1.021.681.35PPO1.961.981.97GRPO1.031.841.44REINFORCE在简单的单跳问题上只搜索约1次在复杂的多跳问题上增加到约1.7次——它学会了根据任务难度自适应调整搜索次数。而PPO则不管问题难易始终保持约2次搜索缺乏灵活性。为什么REINFORCE反而最好这个结果可能让很多人意外——REINFORCE是1992年提出的老算法PPO和GRPO都是更新的方法。论文给出了深刻的分析•PPO的问题它依赖学习到的critic进行优势估计。在EM这种稀疏奖励下critic很难在长轨迹上拟合准确的价值函数导致critic偏差无法惩罚冗余搜索解释了PPO搜索次数居高不下的现象。•GRPO的问题组内相对基线在高方差场景下噪声太大。•REINFORCE的优势直接使用累积回报优化策略不依赖任何外部基线。避免了组采样噪声和critic估计偏差因此学到了最高效的搜索-回答路径。有时候简单就是最好的。Search-R1三个最优选择的组合基于上述三个维度的发现论文将最优配置组合在一起提出了Search-R1•提示模板快思考模板Fast Thinking•奖励函数F1F1 动作级惩罚•策略优化REINFORCESearch-R1架构概述图中的箭头清晰地勾勒出了整个系统的强化学习训练循环机制演进生成 奖励评估 策略更新。与多个基线方法的对比结果如下Qwen2.5-7B方法平均准确率ReAct无训练0.172R1-base无检索0.276Search-R10.403Search-R10.442Qwen2.5-3B方法平均准确率ReAct无训练0.055R1-base无检索0.229Search-R10.289Search-R10.331Search-R1在7B模型上实现了3.9%的相对提升在3B模型上实现了4.2%的相对提升。值得注意的是无训练方法ReAct在小模型上性能急剧下降而Search-R1在不同规模上都保持了稳健的表现说明合理的RL策略能有效赋能紧凑型模型。案例分析崩溃长什么样论文提供了非常直观的案例帮助我们理解训练崩溃的具体表现。正常阶段慢思考模型先在think中进行合理推理然后搜索再推理最后给出正确答案。一切井然有序。崩溃前兆模型开始在搜索前输出多个无意义的think标签比如think Jacksonville Jaguars /thinkthink last playoff appearance /thinkthink 2007 /thinkthink To answer the question... /think虽然最终答案可能还是对的但推理过程已经开始冗余。完全崩溃模型陷入think标签的无限循环think 1941 /thinkthink think1941 /think/thinkthink 1941 /thinkthink think1941 /think/think...模型不断重复同一个信息无法做出有效决策最终耗尽上下文窗口也无法给出答案。快思考模板相比之下使用快思考模板的模型行为简洁高效——直接搜索获取信息给出答案没有多余的推理环节。对现有工作的启示这篇论文的发现对Deep Research领域有几个重要启示1. 不要盲目追求更多思考在交互式检索任务中显式推理链并不总是有益的。与数学推理不同Deep Research的核心能力是搜索什么和何时回答而不是如何推理。过度的推理反而会引入噪声甚至导致训练崩溃。2. 奖励设计需要关注过程而非仅关注结果纯结果导向的奖励无论是EM还是F1都可能导致策略退化。即使是最小限度的过程监督——比如你必须搜索和你必须回答——也能显著改善训练稳定性。3. 算法选择要匹配任务特性在长程、稀疏奖励的交互式任务中引入额外的方差减少机制如critic或组基线可能适得其反。REINFORCE的简单粗暴在这种场景下反而是优势。4. 不要忽视训练稳定性很多工作只关注最终性能忽略了训练过程的稳定性。但在实际部署中一个容易崩溃的训练流程意味着巨大的调参成本和不可预测的结果。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价