资讯动态

OpenSeeker 论文解读:首个完全开源训练数据的前沿搜索 Agent,仅 11.7k 样本单次 SFT 即超越工业级系统

发布时间:2026/8/7 21:36:44 来源:尧图企业网站定制
OpenSeeker 论文解读首个完全开源训练数据的前沿搜索 Agent仅 11.7k 样本单次 SFT 即超越工业级系统一句话总结上海交大团队开源了 OpenSeeker——首个完全公开训练数据的搜索 Agent仅用 11.7k 合成样本、单次 SFT 训练就在 BrowseComp 等基准上超越了阿里通义 DeepResearch 等需要预训练SFTRL 的工业级系统彻底打破了搜索 Agent 领域的数据护城河。 论文信息标题OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data作者Yuwen Du, Rui Ye, Shuo Tang, Xinyu Zhu, Yijun Lu, Yuzhu Cai, Siheng Chen机构上海交通大学发布日期2026年3月16日开源资源 代码GitHub - OpenSeeker 数据HuggingFace - OpenSeeker-v1-Data 模型HuggingFace - OpenSeeker-v1-30B-SFT 一个灵魂拷问为什么搜索 Agent 的数据这么稀缺想象一下这个场景你想训练一个能像人类一样在网上深挖信息的 AI Agent——它需要能够多轮搜索、筛选信息、跨页面关联线索最终找到那个藏在互联网角落里的答案。听起来很酷对吧但问题来了数据从哪来传统的 QA 数据集比如 SQuAD、TriviaQA里的问题太简单了一次 Google 就能搞定。而真正需要深度搜索能力的问题——比如找到某部 1987 年电影中某个配角演员的出生地——这种数据根本不存在。更尴尬的是即使有人造出了这样的数据他们也不愿意公开。看看现在的玩家玩家模型开源数据开源OpenAI Deep Research❌❌Google Gemini Deep Research❌❌Kimi K2/K2.5✅❌通义 DeepResearch✅❌OpenSeeker✅✅大厂们都很默契地守着自己的数据护城河——模型可以开源反正也能重新训但数据门都没有。这就是 OpenSeeker 要解决的问题打破数据垄断让学术界也能玩得起搜索 Agent。图1OpenSeeker 的核心方法流程——左侧是事实驱动的 QA 合成通过网络图拓扑扩展和实体混淆生成高难度问题右侧是去噪轨迹合成通过非对称上下文训练让模型学会在噪声中提取关键信息 BrowseComp 是什么为什么它这么难在聊 OpenSeeker 的方法之前得先说说它的考场——BrowseComp。2025 年 4 月OpenAI 开源了 BrowseComp 基准测试包含 1266 道变态级信息检索题。这些题目有几个特点答案难找但易验证比如问某个 NBA 球员大学时期的室友现在在哪家公司工作答案可能只出现在某个小众论坛的一个帖子里需要多跳推理不是一次搜索就能搞定需要搜 A → 从 A 找到 B → 再从 B 找到 C信息分散答案的线索分布在互联网的多个角落当时 OpenAI 自己的 Deep Research Agent 在这个基准上拿了 51.5% 的准确率而普通的 LLM比如 GPT-4o只能拿到个位数。到了 2026 年 3 月这个基准的分数天花板已经被推到了 50% 以上。OpenSeeker 在 BrowseComp 的中文版BrowseComp-ZH上拿到了48.4%超过了通义 DeepResearch 的 46.7%。关键是——通义用了持续预训练 SFT RL 三阶段训练OpenSeeker 只用了单次 SFT。 核心创新一事实驱动的可扩展可控 QA 合成OpenSeeker 的第一个杀手锏是它的 QA 合成方法。简单说就是把互联网当成一张图在图上造题。为什么传统方法不行传统的 QA 合成有两个路子从现有数据集抽样问题太简单根本不需要深度搜索让 LLM 凭空生成容易产生幻觉生成的问题可能根本没有真实答案OpenSeeker 的思路不一样从真实的网页链接结构出发反向生成需要遍历这些链接才能回答的问题。具体怎么做想象互联网是一张巨大的有向图每个网页是一个节点超链接是边。OpenSeeker 的合成流程如下Step 1图扩展从一个种子页面比如某个维基百科词条出发沿着出边遍历形成一个局部子图。比如电影《泰坦尼克号》 → 导演詹姆斯·卡梅隆 → 他的另一部电影《阿凡达》 → 阿凡达的特效公司Step 2实体提取与子图重组把文本噪声去掉只保留关键实体和它们的关系形成一个实体子图泰坦尼克号 --导演-- 卡梅隆 --执导-- 阿凡达 --特效-- Weta DigitalStep 3基于子图生成问题让 LLM 根据这个实体子图生成问题要求问题必须遍历多条边才能回答《泰坦尼克号》导演执导的另一部科幻电影的特效是由哪家公司制作的 答案Weta DigitalStep 4实体混淆这一步最骚把问题里的具体实体替换成模糊的描述强迫 Agent 先消歧原问题《泰坦尼克号》导演执导的另一部科幻电影... 混淆后那部 1997 年获得 11 项奥斯卡奖的爱情灾难片的导演...这就像把詹姆斯·卡梅隆换成了那个拍过海底纪录片的导演——Agent 需要先搜索确认这个人是谁才能继续下一步。Step 5双重验证生成的 QA 必须同时满足两个条件难度验证基础模型闭卷答不出来确保需要搜索可解性验证给模型完整的子图内容它能答对确保问题有解图2事实驱动的 QA 合成流程——从网页图的拓扑扩展到实体混淆再到双重验证形成一套完整的高难度 QA 生产线这个方法为什么好特性说明事实性基于真实网页拓扑问题必有答案可扩展性互联网有 TB 级网页存档理论上可以无限生成可控性通过调整子图深度控制问题难度 核心创新二去噪轨迹合成有了高质量的 QA还需要高质量的解题过程轨迹来训练 Agent。但问题是真实网页充满噪声。打开任何一个网页你会看到广告、导航栏、侧边栏、评论区、推荐链接……真正有用的信息可能只占 10%。让 Agent 在这些噪声中学习正确的搜索策略简直是 mission impossible。OpenSeeker 的解法很巧妙合成时去噪训练时加回来。合成阶段给老师一个干净的环境在让教师模型比如 GPT-4o生成轨迹时OpenSeeker 用了一个总结历史 原始近期的协议上下文 [步骤1的摘要, 步骤2的摘要, ..., 步骤(t-1)的原始观察]也就是说历史步骤只保留关键信息的总结只有最近一步保留完整内容。这样教师模型能在一个相对干净的环境里生成高质量的黄金轨迹。训练阶段给学生一个嘈杂的环境但学生模型训练时OpenSeeker 把所有的总结都换回了原始的噪声内容训练上下文 [步骤1的原始观察, 步骤2的原始观察, ..., 步骤(t-1)的原始观察]这就像老师在安静的办公室里写出了标准答案学生被要求在嘈杂的食堂里照着这个答案学习为什么要这么折腾因为实际部署时Agent 面对的就是噪声满满的真实网页。如果训练时就用干净数据模型一上线就懵逼了。这种非对称训练强迫模型学会在噪声中提取关键信息然后做出正确决策。图3去噪轨迹合成的核心思想——教师模型在压缩的历史上下文中生成高质量动作学生模型在完整的噪声上下文中学习复现这些动作 实验结果11.7k 样本单次 SFT直接登顶实验设置基础模型Qwen3-30B-A3B-Thinking-250730B 参数3B 激活的 MoE 架构训练数据仅 11.7k 合成样本训练方法单次 SFT无数据过滤无超参数调优基准测试基准语言说明BrowseComp英文OpenAI 发布的深度搜索基准BrowseComp-ZH中文BrowseComp 的中文版xbench-DeepSearch混合多语言深度搜索评测WideSearch混合广度搜索能力评测主要结果结果一超越资源密集型工业基线模型训练方式BrowseComp-ZH通义 DeepResearchCPT SFT RL46.7%OpenSeeker仅 SFT48.4%通义用了三阶段训练管线持续预训练 监督微调 强化学习OpenSeeker 只用了 SFT。这说明什么数据质量 训练花样。结果二同参数量、同训练方式下的统治级表现在 ~30B 参数、仅 SFT 的模型中模型数据量BrowseComp-ZHWideSearchMiroThinker147k25.8%34.6%WebSailor-V2-SFT15k28.3%28.7%WebLeaper10k32.5%30.4%OpenSeeker11.7k48.4%45.3%MiroThinker 用了 147k 样本是 OpenSeeker 的 12 倍结果呢被吊打。结果三数据难度对比OpenSeeker 合成的数据有多难看一个指标——平均工具调用次数数据集平均工具调用数BrowseComp-ZH26.98OpenSeeker 合成数据46.35OpenSeeker 的训练数据比测试基准还难 70%这就是考试都没训练难的降维打击。图4BrowseComp-ZH 上的性能对比——OpenSeeker 在 ~30B 参数级别中遥遥领先甚至超过了使用更复杂训练流程的工业级系统图5数据复杂度对比——OpenSeeker 的合成数据在问题长度、轨迹长度、工具调用次数等维度上都远超现有基准 我的观点与启发1. 数据质量的胜利这篇论文最大的启示是在 Agent 训练中数据质量远比数量重要。MiroThinker 用 147k 样本被 11.7k 样本的 OpenSeeker 吊打。为什么因为 MiroThinker 的数据来自现有数据集的聚合问题难度不够而 OpenSeeker 从图拓扑出发定制化造题每道题都确保需要多轮搜索才能解。这给我们一个工程启示与其花时间清洗海量数据不如设计一套能生成高质量数据的方法论。2. 非对称训练是个好思路合成时去噪、训练时加噪这个设计非常巧妙。它解决了一个经典矛盾教师模型需要干净环境才能生成好轨迹学生模型需要在噪声环境中学习才能部署类似的思路其实在其他领域也有应用。比如语音识别中的clean teacher noisy student训练或者图像领域的数据增强。OpenSeeker 把这个范式迁移到了 Agent 训练中效果立竿见影。3. 学术界的逆袭说实话看到纯学术团队超越工业级系统这种新闻我是有点激动的。工业界一直有数据飞轮优势——用户交互产生数据数据训练更好模型更好模型吸引更多用户。学术界在这个循环里天然吃亏。但 OpenSeeker 证明了如果你能在数据合成方法上取得突破就可以绕过数据飞轮的限制。这给学术界做 Agent 研究提供了一个可行路径。4. 一些潜在问题当然这篇论文也不是完美的。我有几个疑问Q1图扩展的种子节点怎么选论文没有详细说明种子页面的选择策略。如果种子覆盖面有偏生成的 QA 分布也会有偏。Q2实体混淆会不会过度把詹姆斯·卡梅隆换成那个拍过海底纪录片的导演是很好的混淆。但如果换成某个知名导演可能就太模糊了导致问题有多个合理答案。混淆的度怎么把握Q3中英文数据分布如何论文提到在 BrowseComp-ZH中文上效果特别好那英文呢如果合成数据以中文为主在英文基准上的泛化性如何 与其他工作的对比工作团队性质模型开源数据开源训练方式BrowseComp-ZHOpenAI Deep Research工业❌❌未知-通义 DeepResearch工业✅❌CPTSFTRL46.7%REDSearcher工业学术✅部分Mid-trainingSFTRL26.8%OpenResearcher学术✅✅SFT-OpenSeeker学术✅✅仅 SFT48.4%OpenSeeker 是第一个三全的工作全开源模型数据、纯学术、SOTA 性能。 总结OpenSeeker 这篇论文给搜索 Agent 领域带来了几个重要贡献方法论创新事实驱动的图合成 QA 去噪轨迹合成提供了一套可复现的高质量数据生产线打破数据壁垒首次完全开源前沿搜索 Agent 的训练数据让学术界也能参与竞争效率标杆证明了仅用 11.7k 样本、单次 SFT 就能达到甚至超越复杂多阶段训练的效果对于想做搜索 Agent 的团队这篇论文的代码和数据是非常好的起点。对于关心 AI Agent 发展的读者这篇论文揭示了一个重要趋势合成数据的质量可能比真实数据的数量更重要。 参考文献OpenSeeker GitHub: https://github.com/rui-ye/OpenSeekerOpenSeeker 数据集: https://huggingface.co/datasets/OpenSeeker/OpenSeeker-v1-DataBrowseComp 基准: https://openai.com/research/browsecomp觉得有启发的话欢迎点赞、在看、转发。跟进最新AI前沿关注我的微信公众号机器懂语言

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价