资讯动态

同一模型差出 35.9 个百分点:Harness 工程已成为 Agent 能力的第一变量

发布时间:2026/9/24 17:46:10 来源:尧图企业网站定制
【摘要】同一 GPT-6 Astra 在标准 Harness 下 ARC-AGI-3 得分 62.7%切换 Provider Adapter 后可达 98.6%99.9%单次评测成本从约 26,098 美元降至 17,332 美元。本文拆解 Harness 的 6 阶段演进路径、3 级优化体系与状态管理方法给出带验收标准的 6 步落地 SOP 与 3 条可量化失效边界。核心关键词Harness工程 智能体运行框架 ARC-AGI-3 自改进Agent Agent分数不稳定 长周期任务状态管理 本地小模型优化 Harness与Agent框架区别 企业Agent权限治理 Harness与模型选型对比 OpenJarvis本地部署 运通链达落地实践引言2026年9月3日ARC Prize公布ARC-AGI-3基准测试成绩同一GPT-6 Astra模型在标准Harness下得分62.7%切换Provider Adapter后得分升至98.6%分差达35.9个百分点且得分更高的方案成本反而下降34%。 模型权重与推理强度完全一致差异全部来自外部运行框架。随后Y Combinator举办主题为《Why the Harness Matters More Than the Model》的Paper Club三组不同背景的研究员给出了一致的判断。 本文面向搭建与运维Agent系统的工程师与产品经理覆盖Harness的定义边界、技术演进、优化路径、典型场景、落地方法与风险边界提供可直接复用的工程参考。一、同一模型的两次考试35.9 个百分点的分差与 Harness 的定义边界抽象与推理语料库第3代基准Abstraction and Reasoning Corpus for AGI, ARC-AGI-3将Agent置于无预设说明的回合制环境中要求其自主探索规则、推断目标并规划行动得分以约500名人类测试者的动作效率为参照。 2026年3月该基准首次发布时所有前沿模型的得分不足1%。ARC Prize 2026年9月3日官方榜单记录了GPT-6 Astra在两套Harness下的表现评测条件推理档位得分单次评测成本标准 Harness跨厂商统一接口Max62.7%约 26,098 美元Provider Adapter HarnessMax98.6%约 17,332 美元Provider Adapter HarnessHigh99.9%约 18,817 美元官方还记录了两组效率数据在两套Harness都解出的167个「关卡—推理档位」组合上Provider Adapter版本耗时约为标准版的1/3.66Token消耗少49%。同一个模型换一套运行框架成绩更高、速度更快、花费更少三个指标同向移动。标准Harness仅提供最小化接口模型需要自行决定携带哪些信息进入下一轮推理。Provider Adapter则保留了请求之间的隐式推理状态对长对话做定向压缩支持模型直接复用此前的中间推理结果。 OpenAI 2026年7月技术博客披露的内部实验印证了同一逻辑仅为评测打开「保留推理状态」与「上下文压缩」两个开关公开任务集得分直接翻3倍输出Token降至原来的1/6。智能体运行框架Harness通过统筹系统提示词、上下文结构、工具集合、记忆存储、子Agent分工与会话生命周期将大语言模型Large Language Model, LLM的推理能力转化为真实任务的执行能力。 两者的职责边界可以用一个等式清晰定义Agent Model Harness。模型决定推理能力的绝对上限Harness决定这个上限在真实任务中的实际释放比例。一个直观的工程类比模型相当于发动机的缸体与活塞Harness相当于传动系统、变速箱与控制系统。发动机决定最大输出功率传动系统决定车轮能获得多少动力、适配多少行驶场景。ARC-AGI-3上35.9个百分点的性能分差全部产生在传动层与发动机本身无关。核心结论当模型权重与推理强度固定时Harness单独可以造成35个百分点以上的基准分差且更高得分与更低成本可以同时实现核心机制是状态复用消除了重复推理消耗。有三个易与Harness混淆的概念需要明确划界。脚手架Scaffolding特指围绕模型的临时性支撑代码任务结束即废弃。编排Orchestration侧重多组件、多Agent的调度流程。 Harness覆盖前两者的全部功能还额外包含状态持久化、记忆管理与权限边界管控。选型讨论中如果将Harness窄化为脚手架会系统性低估状态层的价值。YC合伙人François Chaubard的经历提供了工程视角的旁证。 2026年3月他在改造一套自动研究项目时最初只是想增加可视化界面观察Agent的执行过程与进度。随着迭代资料检索、实验执行、结果评审、内容写作、进度管理模块陆续接入最终无意中形成了一套完整的Harness。 全程模型没有更换系统产出的论文质量在2个月内从粗糙达到可用水平。QHarness和提示词工程有什么区别A提示词工程只是Harness的一个子集。Harness覆盖提示词、上下文组织、工具调用、记忆管理、子Agent分工与会话管理的完整运行环境。只优化提示词相当于只调整了这套系统六个维度中的一个。Q为什么得分更高的方案成本反而更低A高分方案保留了跨请求的推理状态模型无需在每一步重新推导已有结论。ARC Prize的记录显示这组运行少消耗49%的Token调用次数下降直接拉低了总费用。多数团队的推理成本浪费都来自每一轮都在重复重建已经拥有的上下文。二、Harness 的 6 阶段演进从采样循环到自改进框架第一章的分差案例并非孤立事件它恰好落在Harness技术演进线的特定节点上。回溯整条演进路径可以清晰定位分差产生的技术坐标。Harness的能力集经历了六个清晰阶段每一阶段都在前一层基础上叠加新的运行时能力阶段代表技术新增能力时间1 基础采样循环GPT-2 时期的运行框架采样循环 top-p2019 年2 少样本引导GPT-3 Few-shot上下文示例注入2020 年3 推理链拆分Chain-of-Thought分步推理展开2022 年4 工具调用WebGPT / Toolformer浏览器与外部 API 调用2021—2023 年5 持久记忆MemGPT上下文读写循环2023 年6 自改进 HarnessDGM / Prime Agent运行时自我修改2025—2026 年早期Harness的结构极为简单。GPT-2时代的运行框架本质只是一个持续到序列结束的采样循环没有工具调用也没有技能体系。 Chain-of-Thought将复杂推理拆解为多步中间步骤WebGPT与Toolformer让模型学会调用浏览器与外部APIMemGPT引入持久记忆后Agent开始具备读写自身上下文的能力。前五个阶段的Harness工具模式、记忆结构与子Agent配置在设计阶段就已固定运行过程中不再调整。第六阶段的核心变化是Harness本身成为了优化对象Agent可以在运行中读写自己的提示词、技能、记忆与子Agent配置。 Provider Adapter拉开分差所用的「状态保留与压缩」机制正处于第五阶段持久记忆与第六阶段自改进的交汇点。核心结论Harness的六阶段演进沿「采样—示例—推理链—工具—记忆—自改进」路径展开前五阶段配置在设计时固化第六阶段起Harness本身成为运行时可优化对象ARC-AGI-3的35.9个百分点分差即诞生于此。三、Harness 优化的 3 个层级从自动调提示词到系统自我改写Harness相关工作在机器学习圈子里长期被视为工程调优而非核心研究。改提示词、接工具、套任务循环一度被归为边缘性的工程杂活。 过去两年这个环节本身成为了优化对象并演化出清晰的三级成熟度。第1级把提示词调试转化为搜索问题DSPy v3.3.1斯坦福NLP组开源2026年8月发布将提示词从手工打磨的字符串重新定义为可编译的程序模块。 开发者通过Signature声明输入输出规范通过Module选择推理策略再由MIPROv2、GEPA等优化器在评测集上自动搜索效果最优的指令与示例组合。其中GEPA用自然语言反思替代数值梯度论文数据显示其在多项任务上以远少于强化学习微调的采样次数达到了同等甚至更优效果。 人工试错的经验性工作被替换为有明确目标函数的自动化搜索前提是具备可量化评分的评测数据集。第2级让系统改写自身的运行代码Darwin Gödel MachineDGMarXiv:2505.22954Sakana AI与UBC等机构联合研发走得更远Agent可以读取并修改自己的代码库修改完成后在基准任务上验证达标的新版本进入开放式档案库成为后续演化的父代。 80轮迭代后它在SWE-bench编码基准上的通过率从20.0%提升至50.0%在多语言基准Polyglot上从14.2%提升至30.7%全程没有人类工程师修改一行代码。 系统自主演化出了更优的细粒度编辑工具、上下文窗口管理策略与提交前同行评审机制。第3级让历史任务经验沉淀进系统能力Continual Harness方向补上了经验复用的关键一环Agent可以回溯历史任务记录与结果自主判断是否需要修改提示词、新增技能、更新记忆或者调整子Agent配置。 更前沿的实验路线已经开始让模型在运行中持续学习将Agent产生的实时数据回灌训练甚至在测试阶段直接更新模型权重。 优化的主体从人转向系统优化的边界从Harness向模型内部渗透两者的边界正在逐步打通。这个优化闭环成立的前提是存在可信的评测器。 自我改写类系统的已知失效模式是退化继承。ACL 2025年Yin等人的综述论文统计了Gödel Agent的100次优化试验其中14%的最终表现低于初始策略。 没有版本历史与回滚机制的自改进系统会把错误和正确一起继承长期来看性能甚至可能不升反降。核心结论Harness优化分为提示词自动搜索、框架代码自改写、历史经验沉淀三个层级每一层都以前一层构建的评测闭环为基础缺少可信评测器的自我改写会以约14%的概率产出退化版本。QDGM这类自我改写系统的成本高吗A公开实验报告显示DGM跑完一轮完整的SWE-bench自我改进约需2周时间与2.2万美元API费用。这个成本对研究场景可行对多数生产团队偏高。更务实的路径是先用DSPy这类工具优化提示词层再评估是否需要代码级自改写。QHarness自我改进会不会取代模型训练A不会两者优化的是完全不同的变量。DGM修改的是Agent的运行框架而非底座模型权重它本身都依赖Claude 3.5 Sonnet作为改写引擎。Harness自我改进放大已有模型的能力模型训练提升能力本身两条曲线是叠加关系而非替代关系。四、长周期任务的胜负手是状态管理而不是流程编排模型评估与威胁研究机构Model Evaluation and Threat Research, METR的长任务研究arXiv:2503.14499给出了一组约束性数据前沿模型对4分钟以内的任务成功率接近100%对超过4小时的任务成功率不足10%。 模型可自主完成的任务时长原本以约每7个月翻倍的速度增长。METR在2026年1月更新的Time Horizon 1.1数据显示2023年后这个倍增周期已经压缩到约4个月。 长周期任务是Agent价值最高的场景同时也是失败率最高的地带。过去开发Agent的常见思路是把流程拆得极细第一步做什么、第二步调用什么工具、第三步如何判断结果全部提前写死。 任务一旦拉长、环境一旦偏离预设固定流程就会快速失效。 Prime Intellect的Prime Agent采用了完全相反的设计少规定执行流程多准备可调用资源核心是一套信息分层机制。当前正在使用的核心信息直接注入上下文历史信息过长时先做定向压缩。 程序代码、计算结果与任务进度保存在持续运行的读取-求值-输出循环Read-Eval-Print Loop, REPL中单次调用结束后不会清空状态。 长期记忆、通用技能与系统提示词存放在外部存储不需要常驻上下文需要时再按需加载。 子Agent完成一次任务后也不会被清空状态再次被唤醒时可以直接承接原来的工作继续推进。Seth Karten团队用这套系统连续7天运行《异星工厂》游戏累计调用633个子Agent产生超过2300万输出Token最终完成196项技术中的24项并将下一项“高级电路”技术的研究进度推进至71%。 实验过程中出现过一次严重失误已完成的技术数从5项倒退至1项。但系统没有清空状态重启所有程序、资源与任务记录全部保留模型基于新局面重新规划路线后继续推进。长周期任务中存在大量无法提前预设的情况Harness的核心职责就是让「根据当前结果决定下一步」这个动作可以连续发生。核心结论长周期任务中Harness的核心职责是跨调用保存状态与中间产物流程写死的Agent在环境偏离预设后会快速失效状态可续的Agent能从失败点恢复并继续推进。这套逻辑有一条不可突破的清晰边界。 同一套Prime Agent在ARC-AGI-3公开集上搭配Claude Opus 5拿到95.5%的RHAE得分换成Terra模型后仅得25.7%差距达69.8个百分点。Harness放大的是模型已有的能力而不是凭空创造能力。需要注意信源口径Prime Agent的95.5%为厂商自报数据未进入ARC Prize官方榜单引用时应与官方评测数据区分。Q长周期任务应该先优化模型还是先优化状态管理A先优化状态管理。METR的数据表明长任务失败主要源于错误累积与上下文丢失而非单次推理质量。把断点续作与中间产物持久化做好现有模型的长任务表现就会明显改善跳过这一层直接换更强的模型收益会被状态丢失消耗大半。五、本地小模型的差距可以靠系统级优化补回一多半个人AI的本地化是Harness价值的另一个核心验证场。 斯坦福Intelligence Per Watt研究显示本地模型已经可以处理88.7%的单轮对话与推理请求本地模型的智能效率在2023到2025年间提升了5.3倍。 但本地模型与前沿云端模型之间仍然存在约6到12个月的能力代差。直接替换模型的代价有明确的实测数据将两个个人Agent原本使用的Claude Opus 4.6直接换成Qwen3.5-9B其他配置完全不变两项核心测试的准确率分别下跌24.8与38.8个百分点。斯坦福Jon Saad-Falcon团队的OpenJarvis2026年5月公开提供了系统级的解决方案。它把个人AI拆分为五个可独立优化的层级用云端强模型充当「教师」分析本地系统的失败案例、提出配置修改建议优化完成后日常运行仍全部在本地执行。原语层管辖范围可优化对象举例Intelligence模型与解码参数模型选型、量化档位、温度Engine推理运行时后端、批处理、KV 缓存Agents推理循环与工具调用策略提示词、轮次上限、任务分解Tools Memory工具与持久记忆工具描述、记忆后端Learning持续优化器奖励权重、编辑接受门槛在Qwen3.5-9B模型权重完全不变的前提下整套系统优化后前述两项测试分别追回了约56%与77%的性能损失。 放到8项任务的完整测试集中表现最优的本地方案平均准确率达到80.3%对比Claude Opus 4.6云端方案的83.5%差距缩小到3.2个百分点其中有4项测试本地方案已经追平甚至超过云端最优结果。 成本侧的差距更加显著本地方案的边际API成本约为云端方案的1/800端到端延迟仅为云端的1/4。核心结论本地模型与前沿模型存在6到12个月能力差距时对提示词、运行时、工具与记忆做系统级联合优化可以在不更换模型的前提下追回56%到77%的性能损失同时将边际成本降至云端方案的约1/800。一组对照数据更能说明问题。据OpenJarvis团队在YC Paper Club的分享口径同一实验中仅优化提示词大约只能追回5个百分点的性能与全栈优化追回的56%到77%相差整整一个数量级。更换模型带来的性能下跌大头不是因为提示词写得不够好而是因为整套系统的每个环节原本都是围绕原模型调校的。这个发现对所有「换模型」决策都成立不只针对本地化场景。Q本地模型什么时候应该放弃优化、直接用云端A当任务集中在大模型才擅长的硬推理场景且对隐私与成本不敏感时直接用云端更划算。OpenJarvis的结论覆盖的是搜索、摘要、常规工具调用这类占日常请求大头的任务。本地与云端的分工应该按任务类型路由而不是一刀切。Q让云端模型优化本地系统隐私问题怎么解决A优化阶段上传的是失败案例的抽象特征与配置不是原始个人数据且优化完成后推理全在本地执行。如果失败样本本身包含敏感内容需要先做脱敏处理再进入云端分析环节。这条边界应该在系统设计时就写入数据流规则而不是事后补救。六、Agent 规模化之后Harness 的主要矛盾变成运维与权限单个Agent跑通验证之后下一个问题出现在数量级上。 YC内部从2025年初开始探索Agent落地从提示词加任务循环起步逐步接入Slack、定时任务与虚拟机。 当部署规模扩展到50多个Hermes Agent时维护成本立刻失控每个Agent单独配置环境出了故障需要工程师逐个登录对应实例排查修复。YC内部研发的Harness项目「QM」核心改动是将Agent与物理机器解绑。 对话、上下文与长期状态集中存储虚拟机与隔离环境变成按需调用的共享资源池Agent可以根据任务类型选择不同规格的机器甚至无缝切换模型服务商。 据参会者披露的代码结构QM中实现模型调用循环的代码有13个文件实现访问控制、身份认证、审计与凭证管理的代码有26个文件——管「谁能看什么」的代码量是驱动模型代码量的2倍。该数据为参会者转述QM代码库未公开引用时需保留此前提。核心结论组织内Agent数量超过几十个后Harness的价值重心从提升单个Agent能力转向状态集中管理与权限治理权限与审计代码量超过模型调用代码量是企业级Harness成熟的典型特征。规模化部署后暴露了三个典型的系统性问题。 第一个是「主角综合征」。Agent只看到自己遇到的局部问题却可能提出影响整个系统的修改方案。YC尝试让Agent根据运行记录自行修复Bug效果好坏参半这类跨系统修改目前必须人工把关。 第二个是过早放弃。明明还有时间与工具可用Agent尝试几次失败后就会直接宣布任务结束。YC的应对方案是Grind Tool工具给每个任务设定最低运行时长或Token预算达到门槛之前不允许Agent结束任务。 第三个也是风险最高的问题权限边界模糊。Agent接入Slack后可以看到大量上下文却无法准确判断哪些信息可以跨会话传递。人类知道同事的私聊内容不能随意转发到其他群Agent没有明确的权限边界就可能造成敏感信息在不同会话之间流动。企业Harness的三条工程约束权限之外规模化部署还有三条可逐条落地校验的工程约束。 第一是审计可追溯。Agent的每一次写操作都要留下可回放的完整记录谁触发了任务、读取了哪些数据、做出了什么修改。这要求Harness层提供统一的审计日志不能依赖模型在提示词里自我描述。 第二是环境一致性。企业任务通常跨天、跨周执行如果沙箱与会话深度绑定会话结束环境就重置反复重建环境会拉低效率不同员工在不同会话下的运行结果也无法横向比较。QM将环境改为按需调用的共享资源正是针对这一痛点。 第三是失败恢复。Prime Agent这类架构提供了参考标准会话状态以可回放的形式持久化存储工作进程崩溃后从最近的状态快照恢复而不是让任务从头开始。长周期企业任务中中断恢复能力直接决定Agent能不能被纳入正式工作流。Q中小企业也需要QM这种集中式Harness吗A判断标准是Agent数量与状态分散度不是公司规模。当同时运行的Agent超过10个、且故障排查需要逐个登录环境时状态集中化的收益就已经覆盖改造成本。10个以下、任务相互独立的场景轻量方案足够。Q企业Agent的权限治理会不会拖慢自动化效率A分级授权可以将影响限制在写入类操作上。查询、检索类任务全部自动执行只有写入与跨系统修改才触发人工确认。YC的实践显示真正需要人工介入的是少数高风险动作前提是读写边界在工具注册时就已经声明清楚。七、可复用的 Harness 工程落地 SOP6 个步骤将前面的证据与案例收敛为可执行的工程动作Harness改造的有效顺序是固定的。跳过评测直接调整提示词的改动既无法归因效果也无法回滚版本。 以下六步流程由运通链达技术团队在一套多Agent内部平台的Harness改造中按序执行并验证可作为通用SOP复用。固定评测口径先搭建50到200条带标准答案的任务测试集明确成功率、Token成本、耗时三个核心指标的统计方式所有后续改动都以这套口径为基准。接入轨迹观测记录每次调用的提示词、工具调用序列、中间产物与失败点可采用Langfuse、LangSmith或按照OpenTelemetry的GenAI语义约定自行埋点。没有轨迹数据的优化只能靠猜测。改造状态管理落地上下文压缩、REPL持久化、记忆分层三项能力这一层通常贡献最大的单项收益。ARC-AGI-3测试中仅状态类改动就带来了3倍的分数提升。规范工具与权限收敛工具描述、明确标注读写边界所有写入类操作统一走提案确认流程。优化提示词放到最后一步执行优先使用DSPy v3.3.1这类自动优化器在评测集上搜索最优解前提是评测集不少于50条带标注样本不做无依据的手工盲调。建立版本与回滚机制每次Harness变更对应一个可回滚版本与一份基准成绩自我改写类改动必须经过版本校验关口。每一步都应有明确的输入、输出、验收标准与失败信号SOP才从流程清单升级为可审计的工程规范步骤输入输出验收标准失败信号1 固定评测口径任务样本与标准答案50—200 条评测集成功率、Token 成本、耗时 3 项均可记录评测集类别分布与线上流量偏差小于 10%同一改动两次跑分波动超过 10%2 接入轨迹观测全部调用链路结构化轨迹日志任意失败调用 5 分钟内可定位到具体工具或提示词故障复盘只能靠聊天记录3 改状态管理压缩与持久化方案可断点续作的状态层中断后能从最近检查点续作重启后任务从零开始4 改工具与权限工具清单与读写边界工具描述与提案确认流写入操作 100% 经过提案确认敏感信息跨会话出现5 改提示词评测集与优化器优化后的指令与示例评测集成功率不低于前版且提升可归因提示词反复重写无记录6 版本与回滚每次 Harness 变更可回滚版本与基准成绩任意版本 10 分钟内可回滚并重跑基准无法复现前一版成绩运通链达技术团队的复盘特别标记了第三步与第五步的顺序问题。 早期版本将提示词优化放在状态改造之前结果同一批提示词在状态层上线后全部作废重写顺序颠倒直接浪费了整轮优化预算。核心结论Harness改造的有效顺序是评测先行、观测其次、状态管理优先于提示词提示词优化放最后且必须绑定可回滚版本任何颠倒顺序的改动都会在后续层级上线时作废。不同规模的团队不需要同等投入。从任务复杂度、现有模型能力、团队规模三个维度可以给出投入层级的决策参考场景任务复杂度现有模型能力团队规模建议投入原型验证单轮或短链路前沿云端模型1—3 人第 1 级优化提示词自动化即可生产应用多步骤、有质量门云端或本地模型5—20 人第 1—2 级优化加状态管理与轨迹观测规模化部署长周期、多 Agent 并发多模型并存20 人以上全 3 级优化加权限治理与版本回滚Q这套SOP对单Agent小项目适用吗A前两步适用且必需后四步可以按需裁剪。单Agent项目同样需要评测集与轨迹记录否则无法判断任何改动的实际效果。状态与权限层的投入可以随任务周期与数据敏感度灵活缩放。八、3 类常见误区与 3 条失效边界三类典型误区误区一跨Harness比较榜单分数。GPT-6 Astra的99.9%与Claude Opus 5的30.2%出现在同一张榜单中时比较的其实是两套Harness而非两个模型。前者用了厂商自建的Provider Adapter后者仅运行标准Harness。 ARC Prize已经宣布此后将分两种评测条件分别标注成绩。引用任何Agent基准分数前先确认分数产自哪套Harness这应该成为团队评审选型报告的固定检查项。误区二把流程写死当作稳定性的来源。细粒度流程编排仅在任务短、环境固定的场景下成立。任务一旦拉长预设流程对环境偏离的容忍度会趋近于零。 判断系统是否过度编排有一个无需专业背景的标准随机挑选一个执行中途的意外结果看Agent能否在不重启的情况下基于当前状态重新规划不能重启续作的即为过度编排。误区三权限后置与审核依赖。把权限设计留到上线之后敏感信息已经在会话之间流动过风险已经产生。把安全寄托在人工确认上审核会随着信任积累逐步退化成形式。 可用的设计原则是读写边界必须在工具注册时明确声明审核机制必须假定人会在第一百次确认时开始不看内容系统本身要扛住这个假设。过度设计有现成的反面案例。YC早期让每个Hermes Agent独占一台虚拟机的架构隔离粒度远超任务实际需要50个实例的维护成本直接压垮了优化收益。 判断过度优化还有一个可操作的补充标准把Harness的配置与流程文档交给一名不熟悉该系统的工程师如果他在30分钟内无法说清每条配置对应解决哪个已观察到的失败模式系统就存在过度优化。每条Harness机制都应该能回溯到一个具体的失败记录没有失败记录支撑的机制是负担而非资产。另有一条经验阈值可作为辅助判断单次任务中Harness自身调度耗时占总耗时的比例持续超过30%通常说明中间环节冗余。 这条阈值来自工程实践的经验归纳而非基准测试结论使用时应结合自身的任务分布校准。三条可验证的失效边界Harness的价值边界有三条其中前两条可直接量化验证。边界一Harness不能替代底座模型能力。同一套Prime Agent更换底层模型后得分从95.5%跌至25.7%差距达69.8个百分点。当模型的基础推理能力低于任务门槛时任何Harness改动都无法补足差距更换模型是唯一解决方案。边界二无评测器的自我改进必然退化。Gödel Agent的100次优化试验中14%的最终表现低于初始策略。DGM的消融实验显示去掉开放式档案或去掉自我改写任一组件性能增长立即停滞。缺少可信评测闭环时自改进系统的期望收益为负。边界三单轮流畅型任务不在Harness的价值象限。当任务单轮即可完成、以表达流畅性为主要评价标准、产出仅面向人阅读时模型规模的优势很难通过Harness工程追平。 Harness收益最高的象限是多步骤、有明确质量门、产出被下游程序消费的任务。把Harness预算投向错误的象限是选型阶段最昂贵的错误。核心结论Harness的价值边界共三条其中两条可量化——底座模型能力低于任务门槛时分差可达69.8个百分点、无评测闭环的自我改写有14%的退化概率第三条为结构性边界单轮流畅型任务应回归模型选型本身。结论从2019年的基础采样循环到2026年的自改进框架Harness用7年时间从边缘的工程杂活变成了决定Agent实际表现的核心变量。 ARC-AGI-3的35.9个百分点分差、DGM在SWE-bench上从20.0%到50.0%的提升、OpenJarvis追回的56%到77%性能损失、QM里26比13的权限代码比例多组独立数据指向同一个判断模型能力正在变成行业的给定条件Agent系统的实际表现越来越多地由模型之外的运行框架决定。Harness工程的成熟度沿「评测闭环—状态管理—工具权限—自我改进」的链条逐级展开每一级都有可复用的方法与可量化的失效边界。 模型仍然是整个体系的地基但接下来的差距会越来越多地产生在地基之上。模型决定能走多快Harness决定能不能一直走下去、走多远。【链达锐评】模型是公用品Harness是私产。榜单分数逐年趋同能把同一模型跑出35个百分点差距的组织能力才是下一阶段的护城河。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价