资讯动态

小白程序员必看:Agent Harness 工程详解,助力大模型落地实战

发布时间:2026/8/5 15:44:45 来源:尧图企业网站定制
本文介绍了由CMU、Yale等联合出品的《Agent Harness Engineering: A Survey》论文系统阐述了Agent运行时外部工程系统的关键要素。文章指出Agent效能提升的关键不仅在于模型更在于执行环境、工具接口、上下文管理、生命周期编排、可观测性、验证评估和安全治理等工程系统。论文提出了ETCLOVG七层框架并强调可观测性和治理的重要性指出Agent评估不能只看成功率需关注完整执行轨迹。随着模型能力提升Harness需适时简化控制Agent的下一场竞争将是模型外面的工程外壳即Harness能力。最新Agent Harness分享目前看到最系统、也最工程化的一篇 Agent Harness 综述CMU、Yale、JHU、Virginia Tech、Amazon 等联合出品《Agent Harness Engineering: A Survey》。论文主页地址https://picrew.github.io/LLM-Harness/这篇论文把 Agent 真正跑起来时包在模型外面的那层工程系统讲透了。它用 ETCLOVG 七层框架拆解 Agent Harness覆盖执行环境、工具接口、上下文管理、生命周期编排、可观测性、验证评估和安全治理。同时梳理了 170 个开源 Agent Harness 项目串起从 Prompt Engineering、Context Engineering 到 Harness Engineering 的工程演进。我们在不改变原意的情况下做了如下整理。光换模型可能不是 Agent 最有效的升级论文开头就提出了一个判断学术界长期把 Agent 研究重点放在模型上。模型能不能规划能不能调用工具能不能记住上下文能不能和其他 Agent 协作这些当然重要。但问题是当 Agent 开始进入长任务、真工具、真实环境之后失败往往不是因为模型“不够聪明”而是因为系统没把它管好。论文列了几组结果有研究只改了编辑工具格式和周边 harness不改模型本身编码 benchmark 上最高带来 10 倍提升。还有一个固定的 GPT-5.2-Codex Agent通过重构系统 prompt、加入中间件上下文注入、自验证 hooks在 Terminal-Bench 2.0 上从 52.8% 提升到 66.5%。Meta-Harness 则通过自动优化 harness在 Terminal-Bench-2 上做到 76.4%超过手工设计方案。这些数字当然还要看具体实验设置但它们指向同一个现象同一个模型换一套执行外壳表现可以完全不一样。很多团队还在把问题归因于“模型不够强”。真实情况可能是模型已经够强了是你的工具接口、上下文、沙箱、验证和权限系统太弱。Agent 工程经历了三次迁移这篇综述有一个很适合中文读者理解的框架Agent 工程从 2022 到 2026大概经历了三个阶段。第一阶段是 Prompt Engineering。那时大家主要卷提示词。怎么写 system prompt怎么放 few-shot怎么让模型按步骤推理。工程对象很窄就是把一段输入文本调好。第二阶段是 Context Engineering。Agent 开始跑更长的任务后问题变成模型每一步到底该看见什么不是所有资料都塞进去而是要决定哪些信息该进上下文哪些记忆要检索哪些工具结果要压缩窗口满了怎么办长期任务中哪些状态要保留。第三阶段就是 Harness Engineering。当模型已经能处理更复杂任务时瓶颈转到模型外部谁来维护状态谁来调工具谁来限制权限谁来注入反馈谁来验证进度谁来记录 trace谁来在失败后恢复Prompt Engineering 解决的是“怎么跟模型说话”。Context Engineering 解决的是“模型该看见什么”。Harness Engineering 解决的是“怎么让模型在真实世界里可靠干活”。一个 Harness 到底包括什么论文提出了一个七层分类叫 ETCLOVG。名字有点拗口但拆开看很实用。Execution执行环境。Agent 在哪里跑本地、容器、浏览器、桌面、远程沙箱边界在哪里Tooling工具接口。工具怎么描述怎么发现怎么调用怎么防止模型乱选工具Context上下文和记忆。短期上下文、会话状态、长期记忆怎么管理Lifecycle生命周期和编排。一个 Agent 是单轮执行还是多轮循环是一个 Agent 干到底还是 planner、executor、reviewer 分工Observability可观测性。每次模型调用、工具调用、检索、报错、重试、token 成本、延迟都要能追踪。Verification验证和评估。结果对不对失败到底是模型错了、工具错了、上下文错了还是测试环境错了Governance治理和安全。Agent 有什么权限能不能发邮件、改代码、调 API、读私有数据谁来审批谁来审计这七层合在一起才是一个能跑长任务的 Agent 系统。很多人理解 Agent还停在“模型 工具调用”这一层。但论文的意思很明确工具调用只是其中一层。真正的 Agent 产品要有执行环境、上下文、编排、监控、验证和治理。否则它很容易变成一个会动的 demo。能演示不等于能上线。能跑一次不等于能长期稳定跑。为什么可观测性和治理要单独拿出来这篇综述一个重要贡献是把 Observability 和 Governance 从“附属功能”里拎出来作为独立层。过去很多 Agent 框架会把日志、监控、权限、审计当成周边功能。先把 Agent 跑起来再补一点 logging再加一点 approval。但真实生产里这两件事不是装饰。Agent 会调用工具、执行 shell 命令、修改代码、读写数据库、发邮件、访问第三方 API。它不是普通聊天机器人。它在行动。一旦 Agent 开始行动你就必须知道两件事第一它到底做了什么。第二它到底被允许做什么。前者是可观测性后者是治理。没有可观测性Agent 失败了你不知道为什么。没有治理Agent 成功了你也不一定敢用。有了HarnessAgent 的评价方式也要变这篇论文还有一个判断很值得写进文章Agent 评估不能只看最终成功率。过去我们习惯看 benchmark这个模型 pass rate 多少那个 Agent 排名第几SWE-bench 上涨了几个点但对长任务 Agent 来说这还不够。因为一个 Agent 的最终结果背后混着很多变量模型、提示词、工具、上下文、沙箱、测试、重试策略、权限、评估器。同样一个成功率可能代表完全不同的系统质量。一个 Agent 可能靠疯狂重试刷过任务成本很高一个 Agent 可能走了危险路径最后结果对了但过程不合规一个 Agent 可能 benchmark 过了却是利用了测试漏洞一个 Agent 可能失败了但失败原因是环境缺包不是模型不会。所以论文主张评估要 trace-native。也就是把完整执行轨迹作为评估对象。要记录模型输出、工具调用、工具返回、环境状态变化、上下文快照、错误、重试、恢复动作、token 使用、延迟和成本。然后再判断三件事结果是否正确路径是否合理评估器本身是否可信。这会把 Agent 评估从“排行榜机制”拉回“质量控制机制”。排行榜回答的是谁分高质量控制回答的是为什么失败该改哪一层生产 Agent 最大的矛盾能力越强控制越难这篇综述还把几个跨层矛盾说得很清楚。第一个是成本、质量、速度三角。你想让 Agent 更安全就要更强的沙箱、更细的权限、更完整的 trace。你想让它更可靠就要更多验证、更复杂回归测试、更长上下文。但这些都会增加成本和延迟。第二个是能力和控制的矛盾。你给 Agent 更多工具它能做更多事但也更容易选错工具prompt injection 面也更大。你给它长期记忆它能连续工作但也会带来隐私、过期信息、来源不明的问题。你给它更开放的执行环境它更有用但失控半径也更大。第三个是 harness coupling外壳耦合问题。Harness 的每一层不是独立的。工具描述会占上下文窗口影响模型行为执行环境会影响评估结果因为包版本、重置机制、延迟都不一样可观测性 trace 如果没有记录身份和权限状态就不能成为治理证据。所以改 prompt、改工具、改 memory、改 sandbox、改 verifier都不是局部优化。它们可能改变整个系统行为。从 Agent Framework 到 Agent Platform如果只看工具生态这篇论文也给出一个趋势判断Agent 正在从 framework 走向 platform。Framework 解决的是局部抽象agent、tool、memory、loop。Platform 要解决的是完整生产系统durable workspace、managed sandbox、identity、billing、observability、evaluation、governance、human handoff。早期大家拼的是谁能最快搭一个 Agent loop。现在拼的是谁能让这个 loop 长期可靠运行。所以 Agent 平台的竞争可能不会只发生在模型层也不会只发生在开发框架层而会发生在整套 harness 能力上。谁的执行环境更稳谁的工具协议更清晰谁的上下文更不容易漂谁的 trace 更好用谁的验证更接近真实任务谁的权限和审计更可控谁就更可能把 Agent 送进真实生产流程。下一阶段Agent 要学会“少加脚手架”不过这篇论文并不是简单鼓励大家给 Agent 套更多东西。随着模型变强Harness 也要重新评估。每一个 wrapper、reset、verifier、planner、memory rule、permission gate本质上都代表一个假设模型自己做不好所以我在外面加一层控制。但如果模型能力变了这些控制可能就不再必要甚至会拖后腿。论文提到 Anthropic 的一个例子在长时间应用开发任务中某些 context reset 对旧模型有用但对更强模型已经可以去掉去掉之后成本下降质量没有变差。这其实说明Agent 工程不是越复杂越好。好 Harness 不只是会加控制还要知道什么时候删控制。结语Agent 的下一场竞争是模型外面的工程外壳如果用一句话概括这篇 71 页综述Agent 的下一场竞争不只是模型能力而是模型外面的工程外壳。过去几年我们先学会了写 prompt。后来开始学会管理 context。现在真正要补的是 harness。因为 Agent 一旦从聊天框走向真实任务它就不再是一个“会回答问题的模型”。它变成一个会读上下文、调工具、改环境、执行动作、留下痕迹、接受验收的系统。系统就需要系统工程。对开发者来说别再只问“哪个模型更强”。你还要问它在哪个环境里跑工具接口是不是为 Agent 设计的上下文会不会漂状态能不能跨轮次恢复失败能不能从 trace 里定位结果有没有 verifier权限、身份、审计有没有闭环Prompt Engineering 是把模型叫醒。Context Engineering 是让模型看见正确的信息。Harness Engineering 是让模型在真实世界里可靠行动。Agent 要从玩具变成基础设施差的就是这层外壳。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价