资讯动态

GAIA 评估结果提交指南:从 HelloAgents 评估报告到官方排行榜的完整流程

发布时间:2026/9/19 12:51:53 来源:尧图企业网站定制
GAIA 评估结果提交指南从 HelloAgents 评估报告到官方排行榜的完整流程【免费下载链接】hello-agents 《从零开始构建智能体》——从零开始的智能体原理与实践教程项目地址: https://gitcode.com/datawhalechina/hello-agents本文基于 Datawhale hello-agents 仓库第十二章「智能体性能评估」配套的 GAIA 评估产出物code/chapter12/template_output/evaluation_results/gaia_official/下的提交指南与结果文件编写完整还原从运行 GAIA 评估、导出官方 JSONL 结果、到提交官方排行榜的每一步操作并结合仓库中的一键评估源码、真实结果样例与评估报告给出可复制、可校验、可复现的实战方案。读完本文你将掌握 GAIA 结果文件的字段规范、答案格式约束、提交表单的填写要点以及如何解读匹配率并针对性优化智能体。GAIA 评估结果摘要一次真实运行的产出物在 HelloAgents 框架中使用GAIAEvaluationTool完成一次评估后会自动生成三类文件GAIA 官方格式结果文件gaia_level1_result_*.jsonl可直接提交到 GAIA 官方排行榜提交指南文件SUBMISSION_GUIDE_*.md即本文档包含详细提交步骤、格式说明与注意事项评估报告文件gaia_report_*.md包含评估概览、分级指标、样本详情与可视化。仓库中保留了一份真实运行示例其评估摘要为项目数值模型名称TestAgent评估级别Level 1总样本数2精确匹配数0精确匹配率0.00%这份摘要对应的是提交文件 SUBMISSION_GUIDE_20251011_015731.md 生成时2025-10-11 01:57:31的那次运行结果而同目录下更早生成的评估报告 gaia_report_20251011_012648.md01:26:48显示的则是另一次运行的 50.00% 精确匹配率。同一智能体在不同运行批次中得分存在波动这也侧面说明小样本评估结果仅用于流程验证不能代表智能体的真实水平正式结论应建立在更大样本的完整评估之上这一点在后面的「注意事项」和「结果解读」小节还会展开。提交文件说明JSONL 中装了什么评估完成后提交到排行榜的核心文件是结果文件gaia_level1_result_20251011_015731.jsonl该文件为 JSONLJSON Lines格式每一行是一个独立的 JSON 对象包含三个字段task_id任务 ID与 GAIA 数据集中的样本一一对应model_answer模型给出的最终答案reasoning_trace模型的推理轨迹可选字段。仓库中该文件的真实内容如下每行一个样本{task_id: e1fc63a2-da7a-432f-be78-7c4a95598703, model_answer: 17000, reasoning_trace: To solve this problem, we need to follow these steps:\n\n1. **Determine the distance from Earth to the Moon at its closest approach (perigee):**\n ...} {task_id: 8e867cd7-cff9-4e6c-867a-ff5ddc2550be, model_answer: 5, reasoning_trace: To determine how many studio albums Mercedes Sosa published between 2000 and 2009, ...}可见model_answer是去除了推理过程的最终答案而reasoning_trace完整保留了模型的思考链条——这是评估可审计、可复盘的关键信息。需要说明的是提交指南中记录的本地绝对路径形如D:\code\multiAgentBok\...\gaia_level1_result_*.jsonl只是生成该文件时的本机路径实际使用时应以自己环境中的相对路径为准。这些文件从哪里来GAIA 一键评估要理解提交文件的来源需要回到评估的起点。在仓库的 05_gaia_quick_start.py 中HelloAgents 用几行代码即可完成一次 GAIA 评估import os from hello_agents import SimpleAgent, HelloAgentsLLM from hello_agents.tools import GAIAEvaluationTool # GAIA官方系统提示词必须使用 GAIA_SYSTEM_PROMPT You are a general AI assistant. I will ask you a question. Report your thoughts, and finish your answer with the following template: FINAL ANSWER: [YOUR FINAL ANSWER]. YOUR FINAL ANSWER should be a number OR as few words as possible OR a comma separated list of numbers and/or strings. If you are asked for a number, dont use comma to write your number neither use units such as $ or percent sign unless specified otherwise. If you are asked for a string, dont use articles, neither abbreviations (e.g. for cities), and write the digits in plain text unless specified otherwise. If you are asked for a comma separated list, apply the above rules depending of whether the element to be put in the list is a number or a string. llm HelloAgentsLLM() agent SimpleAgent( nameTestAgent, llmllm, system_promptGAIA_SYSTEM_PROMPT # 必须使用官方提示词 ) gaia_tool GAIAEvaluationTool() results gaia_tool.run( agentagent, level1, # 评估级别1简单2中等3困难 max_samples2, # 评估样本数0表示全部 export_resultsTrue, # 导出结果到GAIA官方格式 generate_reportTrue # 生成详细报告 )关键参数说明level评估难度级别GAIA 数据集按推理复杂度划分为 Level 1/2/3 三个级别max_samples评估样本数0表示评估全部样本小样本如 2用于快速验证流程export_resultsTrue将结果导出为 GAIA 官方格式的 JSONL 文件generate_reportTrue同时生成 Markdown 格式的详细评估报告。gaia_tool.run会依次完成加载 GAIA 数据集数据源gaia-benchmark/GAIA分割validation→ 运行智能体逐样本作答 → 计算精确匹配率与部分匹配率 → 导出结果文件与报告。脚本注释中给出的预期输出为「精确匹配率 100.00%、正确数 2/2」说明该一键评估流程在链路畅通时可以达到满分而前面提到的真实仓库产物得分为 0%/50%属于运行环境、模型能力或随机性导致的正常波动也正说明需要结合评估报告定位问题。运行前提GAIA 是Gated Dataset受限数据集需要先在 Hugging Face 数据集页面对gaia-benchmark/GAIA申请访问权限审核通过通常 12 天后设置HF_TOKEN环境变量评估脚本才能下载数据集。环境准备细节可参考 code/chapter12/README.md 与文档 Chapter12-Agent-Performance-Evaluation.md。如何提交到 GAIA 排行榜步骤 1访问 GAIA 排行榜打开浏览器访问 GAIA 官方排行榜页面位于 Hugging Face Spaces空间名为gaia-benchmark/leaderboard。步骤 2准备提交信息在提交表单中填写以下信息Model Name模型名称如TestAgentModel Family模型家族如GPT、Claude、Qwen等Model Type模型类型Open-source开源Proprietary专有Results File结果文件上传gaia_level1_result_20251011_015731.jsonl。步骤 3上传结果文件点击 Choose File 按钮选择本地生成的gaia_level1_result_*.jsonl文件注意使用自己环境中的实际路径确认文件格式为.jsonl。步骤 4提交检查所有信息是否正确点击 Submit 按钮等待评估结果通常需要几分钟。结果文件格式说明GAIA 要求的 JSONL 格式每行一个 JSON 对象{task_id: xxx, model_answer: 答案, reasoning_trace: 推理过程}字段说明task_id任务 ID与 GAIA 数据集对应model_answer模型的最终答案reasoning_trace模型的推理过程可选。提交前建议先本地校验文件。仓库文档给出了逐行解析的校验脚本思路可参考 Chapter12-Agent-Performance-Evaluation.mdimport json # 读取结果文件 with open(evaluation_results/gaia_official/gaia_level1_result_*.jsonl, r) as f: for line in f: result json.loads(line) print(fTask ID: {result[task_id]}) print(fAnswer: {result[model_answer]}) print(fReasoning: {result[reasoning_trace]}) print(- * 50)如果json.loads逐行都能正常解析且三个字段均存在文件格式即为合规。注意事项1. 答案格式最容易出错的地方GAIA 对答案格式有严格约束这也是其官方系统提示词见前文GAIA_SYSTEM_PROMPT反复强调的内容数字不使用逗号分隔符不使用单位符号如$、%。例如答案是「一万七千」应写17000而非17,000字符串不使用冠词使用小写不使用缩写。例如地名不要写成NYC而要写成完整拼写的小写形式列表逗号分隔按字母顺序排列。仓库中的真实结果文件即体现了这一规范数值答案17000、5均以纯数字形式给出。值得注意的是报告中任务e1fc63a2-...的正确答案为17而提交文件中的模型答案写成了17000——模型给出了合规的格式但答案本身错误计算得到 17159.86 小时、四舍五入到千位这正是 GAIA 任务考察的多步推理与事实检索能力。2. 文件大小确保文件不超过10MB如果文件过大考虑移除reasoning_trace字段该字段是可选的仅影响可审计性不影响排行榜评分。3. 提交频率建议先在小样本上测试如max_samples2确认结果正确后再提交完整评估避免在流程未验证时直接跑全量 466 个样本既浪费 API 调用成本也容易因格式错误导致整体重跑。关于评估成本仓库 README 给出了估算参考GAIA 每个样本约 15 次 API 调用取决于任务复杂度完整评估466 样本的成本区间可在 code/chapter12/README.md 中查看正式评估前应做好预算规划。评估结果解读与改进方向提交排行榜前更值得做的是先读懂评估报告。仓库中真实生成的 gaia_report_20251011_012648.md 展示了报告结构评估概览精确/部分匹配率、分级准确率、逐样本详情表、可视化条以及改进建议。报告给出的改进建议是「建议检查工具使用和多步推理能力」这与 GAIA 的评估定位一致——GAIA 任务需要多步推理 工具使用 信息检索的综合能力。参考 06_gaia_best_practices.py 中的结果解读标准不同级别的改进重点不同Level 1简单任务精确匹配率 ≥ 0.6 为优秀。若较差优先检查系统提示词是否包含 GAIA 官方格式要求、答案提取逻辑是否正确、LLM 模型是否足够强大Level 2中等任务≥ 0.4 为优秀。若较差需增强多步推理能力、增加工具使用能力、优化推理链构建Level 3困难任务≥ 0.2 为优秀。若较差需增强复杂推理、长上下文处理能力并优化工具链的组合使用。同时建议采用分级递进评估策略参考 06_gaia_best_practices.py先评估 Level 1若精确匹配率 0.6 再升级 Level 2Level 2 表现良好 0.4再挑战 Level 3并在升级前对每个级别做 2 个样本的快速测试。此外还应检查难度递进是否正常若出现 Level 2 得分 ≥ Level 1 的异常情况可能意味着数据集偏差或智能体特性需要单独排查。获取帮助如果提交过程中遇到问题可依次排查查看 GAIA 官方文档与数据集说明页Hugging Face 上的gaia-benchmark组织空间在 Hugging Face 官方论坛提问附上具体的错误信息重点检查结果文件格式是否正确JSONL 是否逐行合法、task_id是否与数据集对应、model_answer是否满足答案格式规范。也可以回到仓库对照验证查看 05_gaia_quick_start.py 与 06_gaia_best_practices.py 的完整实现以及文档 Chapter12-Agent-Performance-Evaluation.md 中 12.3 节对 GAIA 数据集结构、Quasi Exact Match 评估算法和核心组件GAIADataset、GAIAEvaluator的详细讲解。生成时间2025-10-11 01:57:31工具版本HelloAgents GAIA Evaluation Tool v1.0以上元信息说明该文件由评估工具自动生成。掌握「运行评估 → 校验 JSONL → 规范提交 → 解读报告 → 迭代优化」这条完整链路后你就能在 GAIA 基准上与全球智能体站在同一把尺子下接受检验。【免费下载链接】hello-agents 《从零开始构建智能体》——从零开始的智能体原理与实践教程项目地址: https://gitcode.com/datawhalechina/hello-agents创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价