资讯动态

奇点智能大会Harness 工程实战:构建 Coding Agent 的评测闭环

发布时间:2026/8/21 3:45:34 来源:尧图企业网站定制
摘要从 Prompt 工程到 Harness 工程AI Coding 方法论最大的进步是“把感觉变成数据”每次改提示词、换模型、调工具都通过一个可复现的评测闭环回答“是升是降”。本文用一套可直接复用的配置与代码拆解 Harness 工程的三块基石——任务描述规范、验证信号设计、评测集维护并分享从“拍脑袋调优”到“数据驱动”的转型案例。关键词Harness 工程、Coding Agent、评测闭环、Prompt 工程、Agent 评测、验证信号、代码评测、AI 原生研发、智能体测试、奇点智能大会一、没有评测闭环一切调优都是玄学这是绝大多数 AI Coding 团队的现状提示词改了一版Agent 好像变聪明了又好像没有模型升级了线上表现忽好忽坏说不出为什么。本质原因是缺少“评测闭环”——没有一个可复现的流程能对 Agent 的能力做客观、定量的评估。没有评测调优就只能靠“感觉”而感觉在 Agent 这种高方差系统面前极不可靠。我们观察过一个团队三个月里他们改了 20 多版提示词每次都是“我试了感觉好多了”但拿真实任务一跑只有 6 版真的有提升其余 14 版纯属自我感觉良好。搭起评测闭环后这类“无效调优”被直接消灭——改完先跑评测数据说话不过就回滚。评测闭环不是“锦上添花的工具”而是 AI Coding 工程化的地基。二、任务描述规范把需求写成 Agent 能执行的样子Harness 的第一个组成部分是“任务描述规范”——Agent 的输入。写得越清晰Agent 表现越稳定。我们的经验是要包含五要素目标要达成什么状态、范围改哪些文件、不碰哪些文件、约束性能要求、兼容性要求、编码规范、验证方式怎么判断完成单测构建、交付物产出什么格式。Plain Text# 任务描述模板可直接复制使用 任务目标: 将订单模块的查询接口从同步改为带超时的异步 范围: 仅 orders/ 目录下 3 个文件禁止改动数据库 schema 约束: - 保持对外接口签名不变 - 超时时间 2s超时返回错误码 504 - 遵循仓库现有错误处理规范 验证方式: - 新增单测通过: orders/tests/test_async_query.py - 全量构建通过: make build 交付物: 代码 diff 变更说明一个实测同样的任务用“五要素”写清描述后Agent 的一次通过率从 34% 升到 62%返工次数减半。任务描述不是“写清楚需求”而是“写清楚验收标准”——验收标准是 Agent 不敢偷懒的底线。描述里写“做个查询接口”和写“超时 2s、错误码 504、不动 schema”是两个完全不同的 Agent。三、验证信号设计让 Agent 每一步都有反馈Harness 的第二个组成部分是“验证信号”——Agent 执行过程中的反馈。前文讲过一个核心规律Agent 做得好不好与反馈密度正相关。验证信号设计的目标就是把任务从“不可验证的开放问题”变成“每一步都可验证的闭环”。三个层级编译与静态检查最廉价的信号写错就报错、单元测试与契约测试行为级信号逻辑错就暴露、集成验证与性能基线系统级信号回归和退化就报警。工程要点是“信号要快”Agent 是迭代式的反馈越慢迭代越慢。我们把 CI 的编译反馈压到 3 分钟以内后Agent 的修复轮次明显变短端到端任务完成时间缩短了 40%。另一个要点是“信号要准”验证脚本自身的 flaky不稳定会误导 Agent——如果一个测试 10% 概率随机失败Agent 会陷入“修一个不存在的错”的循环。验证信号的质量直接决定 Agent 的收敛质量。四、评测集维护让 Agent 的能力可追踪Harness 的第三个组成部分是“评测集”——一组固定的、代表真实业务分布的任务每次 Agent 升级都跑一遍看分数是升是降。评测集不是一次性建设而是持续维护的资产每次线上发现 Agent 的新失败模式就把该任务沉淀进评测集每次新功能上线就把新类型任务补充进评测集。维护评测集有三条纪律。第一“只加不删”的基准集核心任务一旦入选就不删保证历史可对比真的不合适的可以移到扩展集但基准集要稳第二防过拟合评测集任务要定期从真实 backlog 里刷新避免 Agent 记住评测题第三分层报告评测结果按“任务类型”分桶报告bug 修复、单测生成、重构、新功能不要只看总分——总分涨了可能是简单任务涨了难题可能还在退步。五、从“拍脑袋调优”到“数据驱动”的转型案例把 Harness 落到团队里的过程本质是一次工作方式的转型。某团队转型前Agent 配置在个人手里每个人自己的提示词、自己的工具组合结果五花八门无法对比转型后统一 Harness统一任务模板、统一验证、统一评测集所有 Agent 变更走“先评测、后上线”的流程。效果数据Agent 一次通过率提升 28 个百分点提示词“回滚率”改了又改回去的比例从 40% 降到 8%。转型的关键不是工具是“流程纪律”评测不过不准上线、每次改动必须留评测记录、评测集由团队共同维护而不是个人私有。有了纪律Harness 才能从“一个工具”变成“一套制度”。六、给团队的启动路线两周搭起最小 Harness别把 Harness 想得太重最小闭环两周内能搭起来。第一周选定 20-30 个代表性任务写成五要素格式的任务描述配上最简单的验证编译 单测跑通“任务—Agent—验证—打分”的最小循环第二周补评测报告按任务类型分桶把流程固化到日常——任何 Agent 配置变更必须跑评测。第三周开始进入持续优化按评测数据调提示词、补验证信号、扩展评测集。两周后你得到的不是“完美的 Harness”而是一个“能回答’改没改好’的系统”——这已经比 90% 的团队领先了。从 Prompt 工程到 Harness 工程再到 Loop 工程方法论演进的主线始终是“把模糊变清晰、把感觉变数据”。想系统学习 Harness 工程与评测闭环的完整方法论11 月 20-21 日奇点智能技术大会《AI 原生软件研发从 Harness 到 Loop》专题将有构建过成熟 Agent 评测体系的一线专家现场拆解全套实践。 点击大会海报免费领取大会 PPT 资料奇点智能大会 2026 将于 2026 年 11 月 20-21 日在北京万达文华酒店举办由奇点智能研究院与 CSDN 联合主办。旗下奇点智能技术大会SITS与 C及系统软件技术大会CPP-Summit双会并行第一天上午 Keynote 主会场四场主题演讲与圆桌论坛两天六大分会场覆盖 18 个前沿技术主题70 位技术专家、1000 行业精英同场交流。点击上方大会海报扫码即可免费领取大会全套 PPT 资料抢先解锁 70 专家的完整议题与干货内容。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价