资讯动态

可执行自治研究循环实战:以 Agent-Skills-for-Context-Engineering 的 THREAD.md 工作流为蓝本

发布时间:2026/9/14 3:23:47 来源:尧图企业网站定制
可执行自治研究循环实战以 Agent-Skills-for-Context-Engineering 的 THREAD.md 工作流为蓝本【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering导读本文以仓库中一次真实研究运行20260515-035228-executable-autonomous-research-frameworks的THREAD.md为核心完整拆解可执行自治研究框架从初始化、检索、评估、提案到关闭的生命周期。你将掌握如何用文件即状态file-based state组织一个不依赖 LLM 即可运行的自治研究循环理解锁定面Locked Surfaces与可编辑面Editable Surfaces的边界设计并学会通过research_loop.py的十余个 CLI 子命令驱动研究到技能提案的流水线。一次研究运行的解剖THREAD.md 是什么在researcher/runs/20260515-035228-executable-autonomous-research-frameworks/这个运行目录中THREAD.md 是该研究运行的中枢文档。它的设计目标是即使运行被中断、模型被替换、上下文被压缩任何后继 Agent 或人类只凭这份文件就能完整恢复运行状态。这正是runbook中Handover交接要求的物化形态。一份规范的 THREAD.md 至少包含以下区块区块作用Mission记录目标、范围、启动时间、归属所有者与当前状态Locked Surfaces运行期间不可编辑的评审面rubrics、机制注册表、清单、验证脚本Editable Surfaces运行期间允许写入的产物目录sources、proposals、reportsSource Queue待处理与已检索的源队列及下一步动作Decisions带时间戳与证据的决策日志Experiments And Evaluations实验/评估产物与所用 rubric、结果Open Questions未决问题Handover Summary交接摘要最佳候选、被拒候选、未决风险、下一步动作本次运行的 Mission 是Executable autonomous research frameworks可执行自治研究框架由autonomous-research-loop于 2026-05-15T03:52:2800:00 启动评估候选源并产出可评审的技能提案。run-state.json中的记录显示该运行最终以closedreference-only状态收尾其原始证据与 THREAD.md 被保留为自治循环生命周期的工作示例worked example。边界设计Locked Surfaces 与 Editable SurfacesTHREAD.md 中最关键的设计是明确划分谁可以改、谁不能动。本次运行声明了 7 项锁定面researcher/rubrics/content-curation.mdresearcher/rubrics/skill-change.mdresearcher/rubrics/harness-change.mdresearcher/mechanisms/registry.jsonl.claude-plugin/marketplace.json.plugin/plugin.jsonresearcher/scripts/validate_repo.py合并策略Agent 可以准备 PR但 push 与 merge 必须由人类批准这一设计在源码中有直接印证research_loop.py 中硬编码了LOCKED_SURFACES列表任何init新运行都会自动继承这份边界清单run-state.json 则把锁定面与可编辑面一并持久化。可编辑面被限定在运行目录内部.../sources/原始证据、摘要、评估草稿.../proposals/技能提案与机制提案.../reports/验证报告与关闭报告这种评审面冻结、产物面开放的结构从机制上杜绝了运行过程中私自篡改评分规则或注册表的风险——评分时改规则、发现重复后悄悄改注册表都会破坏整个研究的可信度。状态机驱动run-state.json 与 research_loop.pyTHREAD.md 之外运行目录还维护着机器可读的状态文件run-state.json。本次运行的完整状态历史为initializedT00:00research_loop.py init创建运行目录与持久化状态retrievedT04:12原始 deep research 证据落入sources/evidence/raw/closedT05:19:20以reference-only理由关闭证据指向reports/closure.json。状态流转由 research_loop.py 的 CLI 子命令强制驱动全部为确定性操作不调用 LLM# 初始化一次研究运行创建运行目录、run-state.json、队列等 python researcher/scripts/research_loop.py init --title ... --url ... # 记录已检索的源证据 python researcher/scripts/research_loop.py retrieve --run-dir run ... # 标记运行已完成源评估 python researcher/scripts/research_loop.py evaluate --run-dir run # 标记运行已产出提案 python researcher/scripts/research_loop.py propose --run-dir run # 运行新颖性检查并持久化结果 python researcher/scripts/research_loop.py novelty --run-dir run # 验证运行是否达到可发布状态 python researcher/scripts/research_loop.py validate-run --run-dir run # 写入 PR 就绪说明 python researcher/scripts/research_loop.py pr-ready --run-dir run # 以 accepted / rejected / reference-only / abandoned 之一关闭运行 python researcher/scripts/research_loop.py close --run-dir run --status reference-only --reason ... # 运行通过后将已评审的机制提案提升进注册表 python researcher/scripts/research_loop.py promote-mechanisms --run-dir run关闭状态枚举{accepted, rejected, reference-only, abandoned}同样在 research_loop.py 中做了常量约束。这套命令驱动状态机的价值在于任何一步都可以被验证、被重放运行不会因为只写在对话里而丢失进度。从提案的 mechanism-proposal.jsonl 中可以看到本次运行还沉淀出一条候选机制researcher-run-state-machine——研究到技能循环需要可强制执行的显式状态流转而非仅仅靠文字日志这正指向该状态机设计本身。源队列一次一个候选源记录状态与下一步THREAD.md 的 Source Queue 表格记录了本次运行的唯一候选源 S001IDSourceStatusNext ActionS001Parallel Deep Research 运行trun_64f5be03055a4b52adf17481e4b865bcretrievedmap follow-up changes机器可读版本存在于 queue.jsonl字段包括id、url、title、author_or_org、source_type、retrieval_status本次为partial与candidate_reason。值得注意队列中retrieval_status是partial而非completed。runbook autonomous-research-loop.md 明确规定Fetch primary sources whenever available and record them withresearch_loop.py retrieve、Record retrieval status before evaluating。先记录检索状态、再进入评估是硬性纪律——未经检索的源不得被引用为证据提案模板中甚至专门声明Only include evidence from retrieved sources. If a source was discovered but not fetched, record it under gaps instead of citing it.决策日志带证据的不可变记录THREAD.md 的 Decisions 区块用带时间戳的代码块记录关键决策本次运行有三条T00:00 decision: run initialized reason: file-based research loop created durable state evidence: researcher/runs/20260515-035228-executable-autonomous-research-frameworks next: fill source evaluation and skill proposal T05:16 decision: deep research result captured reason: Parallel returned implementable framework patterns for deterministic validation, durable scratchpads, novelty gates, pairwise skill evaluation, and auto-PR governance evidence: sources/evidence/deep-research-summary.md next: implement novelty and pairwise revision gates in a later loop 2026-05-15T05:19:2000:00 decision: closed as reference-only reason: Seed run captured the deep-research evidence that bootstrapped the harness-engineering skill, the mechanism registry, and the researcher OS. ... evidence: researcher/runs/.../reports/closure.json next: stop run每条决策都遵循同一模式时间 决策 原因 证据路径 下一步。这使整条运行历史可以被审计、被追溯也恰好呼应了 THREAD.md 自身的交接要求——Files to read first:THREAD.md,sources/evidence/deep-research-summary.md,reports/validation-report.md。关闭决策的机器可读版本在 closure.json由release-team评审状态为reference-only。评估与实验rubric 门控下的证据捕获Experiments And Evaluations 表格记录了实验 E001IDArtifactRubricResultNotesE001sources/evidence/deep-research-summary.mdcontent-curationevidence captured完整评估仍是草稿摘要提供了实施积压清单评估产物 source-evaluation-draft.json 展示了评分脚手架的结构先过门禁Gatekeeper再行维度打分最后给决策。门禁来自 content-curation.md 的四个关卡门禁通过标准失败标准G1 机制特异性定义了具体机制/模式/指标/工作流/架构只有改进提示词之类的模糊建议G2 可落地产物包含代码、schema、提示模板、API 契约、配置或足够详细的过程纯评论、无产物无流程G3 超越基础覆盖高级上下文/框架/记忆/工具/评估/多智能体/研究运营模式仅入门内容G4 源可验证性作者或组织可识别且技术可信匿名、不可验证或纯营销来源任一门禁失败即REJECT并停止。全部通过后进入四维打分D1 技术深度与可执行性权重 35%、D2 仓库相关性30%、D3 证据严谨度20%、D4 新颖性与洞察15%加权公式为weighted_total D1*0.35 D2*0.30 D3*0.20 D4*0.15。 1.4判APPROVE0.9 ~ 1.4判HUMAN_REVIEW低于 0.9 或任何门禁失败判REJECT另有四条强制覆写规则如 D10 或 D20 直接 REJECT。本运行的评估草稿当前是HUMAN_REVIEW状态justification明确写着 Draft scaffold. Complete gates and scoring after retrieval.——即在检索完成前评估只允许是草稿这展示了评估管道的诚实性约束宁可不打分也不要在证据不足时假装通过。证据摘要五个可落地的框架模式本次运行捕获的核心证据是 deep-research-summary.md它把 Parallel deep research 的结果收敛为五个可落地模式这些模式与仓库现有实现一一对应确定性验证优先Deterministic validation first在引入模型评判门禁之前先冻结仓库结构检查与 schema 验证——对应validate_repo.py与验证报告0 errors, 0 warnings的确定性输出持久化运行目录Durable run directories每个研究循环都应创建含THREAD.md、源队列、评估、提案、报告、日志的目录——正是本运行目录的结构新颖性门禁Novelty gate起草前将拟议技能增量与已接受机制、既有技能、fixtures 与已拒绝想法比较——对应novelty_check.py与机制注册表成对修订Pairwise revisions两份技能草稿竞争时用同一 rubric、同一源证据评估并以简洁性作为平局决胜——对应compare_skill_revisions.py与pairwise-skill-revision.md人类控制的合并Human-controlled mergeAgent 可在检查通过后准备 PR 内容但合并权保留在自治循环之外。摘要还列出了候选后续变更其中机制注册表与成对技能修订脚本这两项已在当前仓库落地验证了研究 → 提案 → 落地的闭环确实发生。原始证据 JSON 保存在sources/evidence/raw/下遵守 runbook 的硬性要求原始源导出只存运行目录绝不放到仓库根目录。提案与新颖性检查从证据到技能变更运行目录中的 skill-proposal.md 是模板化的提案骨架包含 Source源信息与检索状态、Mechanism3-6 句机制描述、Skill Target、Novelty Check、Evidence 表格、Proposed DeltaYAML 变更清单、Quality Checks8 项勾选、Risks And Gaps、Recommendation 等区块。Recommendation 必须是五个值之一publish-new-skill/update-existing-skill/add-reference-only/human-review/reject。新颖性检查的推荐命令为python researcher/scripts/novelty_check.py --file \ researcher/runs/20260515-035228-executable-autonomous-research-frameworks/proposals/skill-proposal.md \ --jsonrunbook 强调起草新技能前必须对照已接受机制与既有技能边界用novelty_check.py做快速机制重叠门禁再用人类或 LLM 判断语义新颖性机制注册表重叠是主要的重复信号。同时一个提案若新增多条规则或概念必须做修剪pruning pass——删除任何不改变行为的条目。本运行的机制提案 mechanism-proposal.jsonl 记录了researcher-run-state-machine机制其activation_scenario、behavior_change、failure_modes如未完成的运行看起来可发布丢失转移历史无证据的 PR 就绪、evidence_claim_ids与status_recommendation: candidate字段构成了机制注册的完整要素。关闭与交接reference-only 的正确姿势本次运行的最终关闭理由值得完整引述Seed run captured the deep-research evidence that bootstrapped the harness-engineering skill, the mechanism registry, and the researcher OS. Closed as reference-only: its raw evidence and THREAD.md remain as a worked example of the autonomous-loop lifecycle. The skill change itself was already published; no further PR derives from this run.这段文字说明了三个要点一是该运行作为种子运行seed run已经完成了它的使命把 deep-research 证据转化为技能与注册表二是虽然不再派生新 PR其原始证据与 THREAD.md 作为生命周期的工作示例保留三是关闭前验证已通过——validation-report.md 显示 Validation passed: 0 errors, 0 warningsJSON 版记录skill_count: 14、findings: []。Handover Summary 则是关闭前一刻的运行快照最佳候选确定性验证 持久化运行目录被拒候选暂无未决风险源评估在 rubric 字段补全前仍是草稿优先阅读文件THREAD.md、deep-research-summary.md、validation-report.md下一步动作在后续循环中实现新颖性与成对修订门禁完整的自治循环从 runbook 到日常操作将上述机制串联起来就得到 autonomous-research-loop.md 定义的完整循环初始化 → 读源注册表选源类 → 读机制注册表 → 读 rubric → 声明锁定面/可编辑面 → 循环发现 → 检索 → 记录状态 → 应用 content-curation rubric → 立即拒绝失败源 → 提取机制 → 应用 skill/harness rubric → 起草提案 → 新颖性检查 → 成对修订 → 准备仓库变更 → 确定性验证 → 准备 PR 但不得合并→ 关闭运行。runbook 还提供了失败处理表是运行中最实用的决策速查失败场景动作源获取失败用备选 URL 重试一次然后记录partial或failedJSON 评估无效保存原始输出并转人工评审证据弱但相关转人工评审不自动发布技能草稿超过 500 行细节移入 references 或拒绝草稿清单同步不确定在 PR 前停止并请求人工评审源相互冲突同时记录双方主张解决前不发布任何变更PR 准备政策同样严格只有内容与技能/框架 rubric 通过、确定性检查通过、变更中引用的每个源都已检索、PR 正文包含未决风险、且 PR 声明合并需人工批准Agent 才可准备 PR。runbook 最后重申硬约束do not push anything to GitHub without explicit approval.结语把研究循环当作可验证的工程系统从这份 THREAD.md 中可以看到一个核心理念自治研究不是让模型自由探索而是一个由文件、命令、rubric 与状态机共同约束的工程系统。锁定面守住评审纪律可编辑面提供创作空间决策日志保证可审计状态机保证可恢复rubric 门禁保证证据质量人类合并权保证最终控制权。对于任何希望建设研究 → 提案 → 技能发布流水线的团队researcher/runs/下的这份运行记录与 autonomous-research-loop.md 运行手册是一份可以直接照抄、复用的工作蓝本。【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价