资讯动态

让“能不能复现“从口头承诺变成可计算指标 —— 一个科研计算可复现性验证智能体

发布时间:2026/10/4 7:14:01 来源:尧图企业网站定制
这是 agi队南京理工大学B4 赛道的作品给定一个科研计算仓库 论文宣称的期望数值智能体自动完成「构建隔离环境 → 跑两次 → 逐项比对期望值 → 定位根因 → 最小修复并沙箱验证」输出带置信度的可复现性诊断报告。为什么做该项目科研代码最常见的事故不是崩溃而是静默地算错——依赖写错照样跑通、随机数没固定两次结果不同、单位换算错了数值只是偏离。传统复现只看 exit code这些全部漏掉。方案要点基于 Agnes HarnessAGHagent repro-diagnosisskill repro-tools7 个确定性 MCP 工具inspect_repo / build_env / run_repo / compare_numbers / diagnose / get_source / verify_fix。6 步闭环中模型只负责推理不出数字——所有判定证据来自工具链的确定性输出评测环节judge、边界测试同样无模型指标可复现。实测结果19 变体基准集15 缺陷 4 对照。指标朴素脚本 B1大模型看报错 B2本方案 B3判定准确率4/1914/1919/19根因定位0/1914/1919/19对照组pristine误报000依赖缺陷检出0/41/44/4把 ground truth缺陷答案文件移出诊断目录后重跑19/19 结论与原跑完全一致——诊断环节确实看不见答案零泄露。严谨性声明评测数字全部由确定性脚本产出基准集做了答案隔离defect.json / mapping 移出 eval 目录后再跑复现 19/19边界测试空仓库/缺依赖清单/缺入口0 崩溃且裁决正确证据缺失时工具拒绝下结论、上报未知而非误判可复现证据齐全时正常路径不受影响已做双向验证。另有一条负结果会话工具链故障时 agent 会退回静态推断——我们因此给批量运行加了显式工具链预检。完整代码、19 份诊断报告与全部评测产物见 GitHub 仓库GitHub - yunni-123/-: 本作品面向科研计算的可复现性危机构建了一个基于 Agnes Harness 编排的可复现性诊断智能体。给定一个科研计算仓库与论文宣称的期望数值它自动完成环境构建、双次执行、数值比对、根因定位与沙箱修复验证输出带置信度的诊断报告。 · GitHub 提交包evidence/同步归档。模型使用声明最终运行全部由竞赛 Key 的agnes-3.0-flash在 AGH 内产出开发期使用过其他模型辅助编码/调试不参与任何最终运行已向组委会确认该口径。欢迎交流

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑