资讯动态

揭秘 PenguinHarness 自我进化引擎:Benchmark 评估到自动优化的完整闭环

发布时间:2026/10/4 18:49:33 来源:尧图企业网站定制
揭秘 PenguinHarness 自我进化引擎Benchmark 评估到自动优化的完整闭环【免费下载链接】penguin-harness Unified and Stable RSI Platform项目地址: https://gitcode.com/gh_mirrors/pe/penguin-harnessPenguinHarness 是一个开源的本地优先 AI Agent 开发平台内置的自我进化引擎能让 Agent 自己跑Benchmark 评估、诊断失分原因、执行自动优化并重新测试直到分数真正提升才保留改动。对新手来说你不需要手写任何调优脚本——评估、优化、回滚全部由平台上的四个技能自动完成。这篇文章带你完整看懂这条越用越强的闭环。为什么 Agent 需要自我进化传统的做法是你手动改提示词、手动调参数凭感觉判断是不是变好了。问题是——没有量化分数就没有真正的改进。PenguinHarness 的做法不同Agent 的能力被一套可复现的 Benchmark量化成 0–100 分优化者Optimizer拿着分数和运行轨迹做证据 → 假设 → 候选改动 → 复测 → 接受或回滚的科学循环。这套能力来自内置的agent-tuning插件源码见 plugins/agent-tuning/。完整闭环四个技能各司其职整个引擎由四个技能Skill组成每个技能只负责闭环的一个环节技能职责对应路径agent-initialization从一句话需求初始化 Agentskills/agent-initialization/benchmark-design设计、校准并冻结 Benchmarkskills/benchmark-design/agent-evaluation隔离执行单个 Case 并私密打分skills/agent-evaluation/agent-optimization基于分数自动优化并回滚skills/agent-optimization/第一步设计并冻结一套 Benchmarkbenchmark-design技能会把一套题目Case逐个试跑一遍来校准难度——被测 Agent 只能看到公开的题目statement/而评分细则rubric/和参考答案始终保密。校准达标后Benchmark 被冻结status从draft变为published并记录一份正式的基线分数Formal Baseline。冻结的意义在于后续所有优化轮次都用同一套题、同一模型配置考试分数才具备可比性。第二步隔离执行私密评分agent-evaluation技能像一个考场管理员为每次考试创建独立工作区被测 Agent 看不到评分细则用指定的模型对 Agent 执行一次任务全程记录 Trace私密打分后只返回分数、成本、耗时等协议化结果。第三步自动优化循环agent-optimization技能是闭环的大脑每一轮只做四件事诊断对比每个 Case 的分数与运行轨迹找出稳定的失分模式假设提出一个可验证的改动改AGENTS.md、新增 Skill 等复测让agent-evaluation在冻结题集上完整跑一遍决策只有分数严格高于当前最优版本才接受否则回滚到上一版绝不劣化。每次优化只针对可见行为做通用改动而不是背题——这正是它区别于刷分的关键。第四步快照、回滚与记分牌快照每轮改动前自动保存当前 Agent 状态snapshots/v版本.tar.gz随时可回退记分牌每个被接受的版本都会追加到scoreboard.yaml形成版本、分数、成本、耗时齐全的进化档案全程可观测每次考试的原始请求都能在 Trace 视图里回放。实战案例本地模型两轮自我进化仓库里提供了一个零云依赖的可运行示例 examples/self-improving-agent/一个本地开放权重模型在 AMD GPU 上完成给自己打分 → 改自己的规则文件 → 重新考试的全过程详见 examples/self-improving-agent/README.md。任务设计很巧妙报告要符合一条只写在AGENTS.md里的团队格式规范模型无法从题目本身推断因此基线稳定失分阶段平均分发生了什么N基线4.80 / 10空白AGENTS.md格式分全丢N1结构学会6.60 / 10Agent 从一份合格样例推断出报告结构并写入自己文件N2常量锁定9.80 / 10多份样例共享的部分被锁定为固定常量关键细节脚本从不写任何规则它只提供失败信号和合格样例——学习与落笔改文件的是 Agent 自己。这就是递归自我进化的最小可运行版本入口脚本为 self-evolve-recursive.ts。三重保障让进化不失控新手最常担心的自我进化会不会跑偏在这套引擎里有明确的工程答案黑盒反馈优化者永远看不到评分细则和参考答案只能靠公开行为改进只升不降候选版本分数必须严格更高才被接受否则自动回滚全程留痕分数、成本、会话 ID 全部记入记分牌Trace 可回放每个版本的来龙去脉可审计。快速上手新手只需三步初始化对 Agent 说一句话需求如一个回答 X 问题的专家agent-initialization会写好身份与规则建 Benchmark指定目标能力与期望基线分benchmark-design出题、校准、冻结交给优化者给出目标分数与轮次上限agent-optimization开始自动循环达标即停。在 Web App 的评估中心里上述每一步都只需一次点击提示词已由平台替你写好。评估中心的设计说明见 changelog/0.2.13/2026-09-02-evaluation-center.zh.md引擎背后的产品理念可阅读 introducing-penguinharness.zh.md。总结PenguinHarness 的自我进化引擎把评估 → 诊断 → 优化 → 复测变成了一条开箱即用的闭环Benchmark 负责量化评分保持黑盒优化只接受严格提升快照与 Trace 兜底安全。无论你是想量化自己 Agent 的能力还是希望它随使用持续变强这条闭环都是当前开源平台里最完整的实现路径。【免费下载链接】penguin-harness Unified and Stable RSI Platform项目地址: https://gitcode.com/gh_mirrors/pe/penguin-harness创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑