资讯动态

ClawWork 的 LLM 评估 Meta-Prompt 生成体系:为 gdpval 44 个职业类别构建 0-10 分制评估提示词

发布时间:2026/10/9 1:53:54 来源:尧图企业网站定制
人工智能AI AgentAgent 评测模型评测工具调用后端前端【免费下载链接】ClawWorkClawWork: OpenClaw as Your AI Coworker - $15K earned in 11 Hours项目地址https://gitcode.com/gh_mirrors/cl/ClawWork点击查看免费下载本文档围绕 ClawWork 仓库中 eval/README.md 所述的「LLM 评估元提示词Meta-Prompt生成」方案展开如何用 GPT 系列模型为 gdpval 数据集的 44 个任务类别职业批量生成类别级评估提示词让评估 LLM 在0-10 分制下对 Agent 产出的文件型产物进行打分并对缺失、不完整交付物施加「最高 2 分」的强制惩罚。读完本文你将掌握这套生成脚本的完整运行方式、评分规则的设计动机、生成产物的 JSON 结构以及运行时 LLM 评估器如何消费这些元提示词完成评分与付款结算。一、为什么需要「类别级」评估元提示词在 ClawWork / LiveBench 这类让 AI Agent 真实办公产出 Excel、Word、PDF、PPTX 等文件产物的体系中评估环节面临一个核心矛盾任务千差万别通用评估 prompt 无法判断这份报表到底算不算合格。解决方案是把评估标准下沉到职业类别occupation粒度gdpval 数据集覆盖了 44 个职业类别如 Accountants and Auditors、Lawyers、Software Developers、Real Estate Brokers 等每个类别内部的产物形态财务报表、法律文书、代码、房源估值单高度相似。因此为每个类别预生成一份评估元提示词meta-prompt其中包含该类别的评估框架、加权 rubric、文件检查清单和常见失败模式再由评估 LLM 结合具体任务 prompt 与实际产物执行打分。这正是 eval/README.md 描述的核心思想Generate evaluation prompts for 44 task categories in the gdpval dataset。从仓库产物看eval/meta_prompts/ 目录下已按类别落地了 44 份{category}.json文件与一份 generation_summary.json 汇总报告运行时的消费端 livebench/work/llm_evaluator.py 会在每次评估时按职业名称加载对应 JSON 作为评估准则。整条链路是生成期离线批量造 rubric→ 运行期在线按类别加载 rubric 打分。二、快速开始三步跑通全流程eval/README.md给出了开箱即用的三条命令全部基于 Python 与 OpenAI API# 1. Setup环境准备 export OPENAI_API_KEYyour-key pip install pandas pyarrow openai # 2. Test single category单类别测试约 30 秒~$0.05 python test_single_category.py # 3. Generate all 44 categories全量生成约 90-120 分钟~$1-2 python generate_meta_prompts.py # Note: Script automatically skips already-generated categories # Safe to re-run if interrupted - it will resume where it left off三个要点值得展开先测试、后全量单类别测试只需约 30 秒、成本约 $0.05README 估算值用于在正式批量生成前验证 API Key、数据路径、输出格式是否正常断点续跑两个脚本都会在启动时检查输出目录中是否已存在同名 JSON。generate_meta_prompts.py中对已生成类别会打SKIPPING - already generated日志并直接跳过因此中途中断后重跑是安全的会从上次未完成的类别继续成本与耗时README 标注全量 44 类别约 90–120 分钟、$1–2此外 generate_meta_prompts.py 的generate_summary_report()中还有一个更细的粗估公式estimated_cost_usd (total_tokens / 1000000) * 5.0按每百万 token 5 美元粗估并把总 token 消耗写入汇总报告方便事后核对真实花费。2.1 单类别测试脚本的细节test_single_category.py 支持两种调用方式# 不带参数默认取第一个类别 python test_single_category.py # 带类别参数只测指定类别 python test_single_category.py Accountants and Auditors它的行为要点对应源码实现启动即检查OPENAI_API_KEY是否设置未设置直接报错退出调用load_gdpval_data()加载 parquet并打印全部 44 个可用类别清单按指定类别过滤数据复用 generate_meta_prompts.py 中的generate_meta_prompt_for_category()完成一次真实生成结果写入eval/meta_prompts/test/{类别名}_test.json目录下已有一个 Accountants_and_Auditors_test.json 作为样例随后打印 token 用量、模型、生成时间以及evaluation_prompt前 500 字符的预览方便肉眼核对质量任何异常都会打印完整 traceback 并以非零退出码结束便于在 CI 或本地快速定位问题。三、全量生成脚本的机制拆解generate_meta_prompts.py 是整套流水线的核心其main()的执行流程可以从源码结构完整还原环境校验未设置OPENAI_API_KEY时直接raise ValueError加载数据集load_gdpval_data()读取../gdpval/data/train-00000-of-00001.parquet源码中的DATA_PATH常量并统计任务总数与职业类别数df[occupation].nunique()遍历类别对sorted(df[occupation].unique())逐一处理先检查是否已生成category_already_generated()按文件名是否存在判断已存在则加载旧结果计入汇总并跳过构造生成请求create_meta_prompt_generation_request()接收类别名、所属 sector、该类全部任务 prompt并取前 3 条样本任务含 prompt 与 reference_files作为上下文让 GPT 理解该类别的产物形态调用 LLM以chat.completions.create()请求生成response_format{type: json_object}强制 JSON 输出并把metadata类别、sector、类别内任务数、生成时间、模型、三种 token 用量附加到结果上保存与限速save_meta_prompt()按安全文件名空格→下划线、逗号删除写入eval/meta_prompts/{category}.json每两次请求之间time.sleep(2)做限速避免触发 API 频率限制汇总报告全部类别处理完后generate_summary_report()生成 generation_summary.json记录每类别的任务数与 token 消耗、总 token、粗估成本。关于模型版本的事实说明README 与脚本 docstring 中提到的生成模型为 GPT-4o但当前源码第 26 行的常量MODEL gpt-5.2且仓库内已生成的 generation_summary.json 记录model_used: gpt-5.2。因此当前仓库实际落盘产物由 gpt-5.2 生成README 描述的是该流水线早期的模型配置——以源码与汇总报告为准。四、0-10 评分量表与缺失即低分铁律eval/README.md定义的评分量表是这套评估体系的基石原文完整继承如下分数段含义典型情形9-10Excellent完整、准确、专业质量7-8Good质量良好仅有小问题5-6Acceptable可接受存在明显缺口3-4Poor较差存在重大问题0-2Unacceptable产物缺失或严重不完整核心铁律README 原文加粗强调Missing required output files automatic score ≤2——只要必需输出文件缺失无论其余部分质量多高总分一律压到 0-2 分。这条规则在生成请求中被描述为non-negotiable并被原样写进每一份生成的元提示词中。4.1 加权评估维度40 / 30 / 20 / 10从生成请求generate_meta_prompts.py 的create_meta_prompt_generation_request()与已落盘的 Accountants_and_Auditors.json 可以看到rubric 固定为四个维度并带权重Completeness完整性权重 0.40所有必需输出文件存在、所有需求被覆盖——被标记为MOST IMPORTANTCorrectness正确性权重 0.30数据、计算、信息与逻辑的准确性Quality质量权重 0.20专业排版、清晰度、组织结构Domain Standards领域标准权重 0.10该职业的行业最佳实践。最终分值的计算方式摘自 Accountants and Auditors 示例的scoring_guidelines.overall_approachScore each dimension 0–10, compute weighted average: completeness (40%), correctness (30%), quality (20%), domain_standards (10%).CRITICAL OVERRIDE: If any required output file is missing OR deliverables are severely incomplete …, set overall score to 0–2 regardless of the weighted result.即先加权平均再执行关键覆盖规则CRITICAL OVERRIDE——一旦触发缺失/严重不完整条件直接无视加权结果改为 0-2 分。4.2 自动低分触发条件同一份 JSON 中的automatic_low_score_triggers列出了运行时评估器应判 0-2 的具体情形以会计审计类别为例任何必需输出文件/产物缺失输出文件无法打开、损坏或被密码锁定必需的 sheet/标签页/主要章节缺失如缺少汇总页、工作底稿页、明细排程页关键必需计算未执行单元格为空白/占位符而非结果工作内容与 prompt 严重不对应交付了错误文档类型或无关分析。五、生成的 Meta-Prompt JSON 结构每份eval/meta_prompts/{category}.json都是一个结构化评估包。以 Accountants_and_Auditors.json136 行为例顶层字段包括category类别名如Accountants and Auditorsevaluation_prompt一段完整、可直接下发给评估 LLM 的指令文本包含文件型评估FILE-BASED原则、7 步评估流程识别必需交付物 → 结构完整性门禁检查 → 数据溯源 → 重算交叉验证 → 需求清单核对 → 专业质量 → 打分与覆盖规则evaluation_rubric四维度加权 rubric 对象每维度含weight、description、criteria具体检查项数组与scoring_guidance各分数段指导语file_inspection_checklist运行时逐项执行的检查清单如存在性检查参考数据 tie-out至少取 10 个追踪点算术完整性subtotals/totals 勾稽关键计算重算边缘情况处理对账reconciliation审计轨迹等common_failure_modes该类别高频失败模式列表如只交付叙述文字而缺少要求的 Excel 工作簿存在 workbook 但缺少必需标签页占位符未填充方差/百分比计算口径错误总计不勾稽公式硬编码无法复算等scoring_guidelines含overall_approach加权覆盖规则、score_scale、automatic_low_score_triggers、excellent_output_characteristics、poor_output_characteristicsexample_evaluation_questions评估 LLM 应自问的具体问题清单如能否独立重算关键指标并一致余额能否逐期与 GL 对账吻合metadata生成元信息——类别、sector、类别内任务数、generated_at、model、prompt_tokens/completion_tokens/total_tokens示例中该类别共 6678 tokens。六、运行期LLMEvaluator 如何消费这些元提示词元提示词的真正价值在运行期兑现。livebench/work/llm_evaluator.py 中的LLMEvaluator是消费端关键逻辑如下按类别加载_load_meta_prompt()把任务的occupation字段做规范化空格→下划线、删除逗号后去eval/meta_prompts/目录找{normalized}.json并带内存缓存找不到对应文件时直接抛错、无回退no fallback因为 LLM evaluation requires category-specific rubrics多模态产物支持_read_artifacts_with_images()对图片png/jpg/gif/webp做 base64 内联、对 docx/xlsx 做文本提取段落表格、对 pdf 用read_pdf_as_images转图、对 pptx 用read_pptx_as_images逐页转图随后_build_multimodal_evaluation_content()组装成 OpenAI 多模态消息图片detail: high缺件显式声明任务声明的产物路径中不存在的文件会被收集进missing_artifacts在请求中醒目列出分数解析与换算_extract_score()用正则从评估文本中抓OVERALL SCORE: X等模式默认 5.0随后normalized_score score / 10.0把 0-10 换算成 0.0-1.0再按payment normalized_score * max_payment结算付款——评估分数直接决定 Agent 的薪酬这正是缺失产物低分低薪激励闭环的实现点独立评估环境变量评估客户端支持与主 Agent 分离的密钥/端点/模型——优先级为EVALUATION_API_KEYOPENAI_API_KEY、EVALUATION_API_BASEOPENAI_API_BASE并可用EVALUATION_MODEL覆盖默认模型。配置链路的上游在 livebench/work/evaluator.py构造LLMEvaluator(meta_prompts_dir...)与 livebench/main.py从配置的evaluation段读取use_llm_evaluation、meta_prompts_dir默认./eval/meta_prompts可据此确认只需把新生成的元提示词 JSON 放进eval/meta_prompts/运行期评估器即可自动按职业类别启用对应 rubric。七、输出产物与运维建议完整跑完生成后仓库会得到三类产物产物路径说明类别评估文件eval/meta_prompts/{category}.json44 份类别级评估包汇总报告eval/meta_prompts/generation_summary.json类别清单、任务数、token 消耗与粗估成本详细日志eval/meta_prompt_generation.log每类别生成进度、跳过记录、错误堆栈实际运维建议结合源码行为先跑test_single_category.py验证环境再启动全量任务避免一次性烧掉 API 额度才发现路径配置错误放心重跑脚本按文件存在性跳过已生成类别中断续跑无需清理核对成本生成结束后检查 generation_summary.json 中的total_tokens_used与estimated_cost_usdREADME 给出的 $1-2 全量成本与脚本公式的估算口径一致注意成本随所选模型与类别样本规模浮动新类别接入若 gdpval 数据新增职业类别直接重跑生成脚本即可增量补齐对应 JSON运行期无需改代码。八、适用前提与限制依赖环境需要可访问的 OpenAI APIOPENAI_API_KEY、Python 依赖pandas pyarrow openai以及包含 44 个职业类别的 gdpval parquet 数据源码中DATA_PATH ../gdpval/data/train-00000-of-00001.parquet即该数据集需位于仓库上一级目录的gdpval/data/下评估端依赖运行期若启用 LLM 评估use_llm_evaluation: True评估器要求eval/meta_prompts/中存在对应职业的 JSON且 pdf/pptx 转图需要poppler-utils、LibreOffice 与pdf2image、Pillow详见 llm_evaluator.py 的报错提示设计取向该体系刻意只做文件型、基于类别的评估缺失产物一律 0-2 分、评估失败不降级回退——这是为了保证评分与激励的一致性也意味着对产物路径不存在文件损坏等情况必须零容忍处理。赞分享人工智能AI AgentAgent 评测模型评测工具调用后端前端【免费下载链接】ClawWorkClawWork: OpenClaw as Your AI Coworker - $15K earned in 11 Hours项目地址https://gitcode.com/gh_mirrors/cl/ClawWork点击查看免费下载相关推荐arizeai/phoenix-evals用 TypeScript 构建 LLM 评估器与分类指标评估体系arizeai/phoenix evals用 TypeScript 构建 LLM 评估器与分类指标评估体系 本指南围绕 Phoenix 开源仓库中的 Typ可观测性AI 评测LLMOpsAI 应用人工智能如何从零构建AI提示词评分体系GitHub精选项目的完整质量评估指南如何从零构建AI提示词评分体系GitHub精选项目的完整质量评估指南 在人工智能快速发展的今天高质量的提示词Prompt已成为提升AI模型性能的关键因素人工智能提示工程AI编程质量革命andrej-karpathy-skills如何让代码助手写出简洁高效的代码AI编程质量革命andrej karpathy skills如何让代码助手写出简洁高效的代码 在AI编程时代开发者面临一个普遍困境代码助手倾向于过度工程化AI 技能提示工程上一篇WhisperLive终极实时语音转文本解决方案完整指南下一篇Summernote - 超级简单的所见即所得富文本编辑器创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑