资讯动态

美团:元Harness优化长程智能体设计

发布时间:2026/8/24 14:46:05 来源:尧图企业网站定制
标题AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design来源arXiv, 2608.13560v1️文章简介研究问题如何将多模态源转化为结构化输出时使系统能像人类设计师一样积累可复用经验并实现递归自我改进而非仅进行静态的孤立编辑主要贡献论文提出AutoDesign框架通过元Harness优化器引导代码智能体基于 rollout 反馈递归改进设计Harness并在论文转海报任务中超越商业系统。重点思路双层循环架构内层循环为设计Harness负责将源内容转化为可编辑工件并根据批评反馈迭代修订外层循环为元Harness通过分析多次执行的轨迹和评估分数识别 recurrent failures 并更新设计Harness。组件化有界更新将设计Harness分解为上下文记忆、工具规范、执行运行时、编排逻辑、评估反馈五个功能组件。每次优化仅针对其中一个组件提出修改建议确保归因清晰且避免过度拟合。严格接受门控机制引入独立开发集作为防过拟合屏障。只有当候选Harness在训练集上性能提升且在开发集上性能不下降时才接受该更新否则保留原Harness并记录优化历史以供后续参考。人机协同优化支持可选的人类介入。当自动优化陷入局部最优或评估器存在系统性偏差时人类可通过自然语言指导重定向搜索方向或修正评估器但不过度干预具体代码实现。分析总结性能显著领先在PosterBench主赛道上AutoDesign取得78.32的最高分比闭源商业系统Claude Design高出7.45分。在七种受控配置中集成学习到的DesignHarness平均得分从54.99提升至67.39增幅达12.4%。通用性与成本效益该方法适用于不同模型和代码智能体组合最大提升幅度达19.6分。在全自动长程循环中生成一张会议级质量海报仅需40分钟、少于3美元且无需人工干预。人类偏好一致在系统盲测中AutoDesign获得最高的人类偏好概率64.0%。实验还表明PosterBench自动评分与人类判断具有正相关性且分差越大自动评估与人类偏好的一致性越高。个人观点论文将优化目标从模型权重转移到了围绕模型的“操作系统的Harness”上将短暂的反馈信号转化为持久的系统设计先验。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价