EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions作者Jincheng Zhong, Weizhi Wang, Che Jiang, Kai Tian, Zhenzhao Yuan, Junlin Yang, Dianqiao Lei, Kaiyan Zhang核心发表机构Frontis.AI论文链接arXiv:2606.23654v1发布于arXiv 预印本cs.CL二、研究背景与动机 / Background Motivation企业级 agent 正在越来越多地直接运行在工作区workspace内部它们需要读取异构格式的输入文件、调用各种工具、在持久化 Linux 工作空间中操作并交付可供业务人员直接使用的工件artifact例如校准后的 Excel 报表、HTML 页面、演示文稿、项目文档等。这种部署形态与传统的“单轮问答”截然不同最终答案不再是一段文本而是一个需要满足业务约束、格式要求与语义准确性的文件产物。然而现有评估体系远远没有跟上这一变化。论文从三个具体差距gap出发定位自己的工作。第一个差距是企业真实性与可扩展任务构建之间的张力。已有的工作区类基准如 Workspace-Bench、WorkArena、TheAgentCompany、EnterpriseBench、EntWorld 等虽然把评估场景搬进了企业环境但任务大多由人工编写、在模拟环境中生成或基于公开数据集构造缺少自然发生的、带有真实企业语义的任务形态。真实企业会话中包含大量噪声——群聊时间戳、账号哈希、引用消息块、多轮追加指令、脱敏的 URL 与文件路径、跨文件对比需求等——这些都是人工构造任务难以复现的。论文试图从真实工作场所会话中直接恢复可复现的任务从而弥合“真实发生”与“可用于评测”之间的鸿沟。第二个差距是多维评估的缺失。现有基准往往只报告一个综合正确率或任务成功率。但企业 agent 的实际部署者需要回答的问题要复杂得多同一模型在不同 harness 下表现能差多少产物是否真的交付成功视觉上是否合格运行一次要花多少钱、多少时间技能注入能否带来可迁移的提升为此论文在定位上与 WildClawBench报告 harness 效应、ClawBench强调环境与状态接地执行、Claw-SWE-Bench扩展到仓库级代码修复和 AgenticVBench引入多模态生产任务保持对话但明确提出企业 agent 评估应联合报告 hm 组合、多模态判定、工件交付质量、成本与时间。第三个差距是任务类级技能评估的缺失。已有基准要么完全不适合技能评估要么只能在单个任务项上评估技能无法回答“从一个任务类中提取的技能能否提升该类中保留任务的表现”。论文将企业技能视为“迁移单元”通过保留任务上的交叉迁移实验来测量技能的泛化能力。这一设计直接支撑了“技能注入是高方差过程”这一重要结论。表 1 给出了论文与六个代表性基准的定位对比。EnterpriseClawBench 在任务数量852 个完整任务 / 120 个 Lite 任务、真实来源Real-source、多模态工件、显式技能评估、成本/时间报告和 hm 组合数量32 个上均处于领先位置。它的独特之处在于任务全部来自真实使用痕迹而非为基准撰写成功与否通过交付文件工件定义并且显式支持技能迁移实验。四、实验 / Experiments4.1 数据集与评估指标 / Datasets MetricsEnterpriseClawBench 包含两个评测集合完整集包含 852 个自动构建的可复现任务Lite 集是经过人工审计的 120 任务子集。主排行榜在 Lite 集上运行用于保证评分的人工可审计性完整集用于可扩展性检查验证自动管道构建的任务是否能够保持 Lite 集上的模型排序。数据集的统计特征呈现高度企业异质性。7 个角色类别覆盖产品/项目、工程/IT、HR/行政、高管/管理、销售/客户、市场/营销、财务/运营。输入文件类型与输出工件模态均高度异构输入包括 Excel、DOCX 转录稿、PDF、录音文件、代码、日志、图片等交付物包括校准后的电子表格、HTML 页面、PPTX 演示文稿、业务报告、PRD 文档、JSON 等。期望交付物计数总和大于 852因为部分任务要求多个文件或多种输出类型。每个任务附带六类元数据恢复后的 fixtures、重写后的 prompts、角色类别、技能子类、硬规则、语义 rubrics。由于会话包含企业内部内容数据不公开发布可复用的是构建与评测协议。评估指标分为两层。第一层是硬规则通过情况包括文件类型、数量、非空性、可打开性、traceback 与占位符检查。第二层是语义评分由文本或视觉判题器在五个维度上给出 0–1 之间的分数。除得分外评测 runner 还系统记录运行时间、token 使用、成本、工具调用次数与证据警告作为多维评估的组成部分。判题器可信度通过两类一致性指标衡量LLM–LLM 一致性不同判题器模型在同一批工件上的 Spearman 秩相关与 LLM–人类一致性判题器与人类评分者的 MAE 与 Spearman 相关。4.2 主实验结果 / Main Results主排行榜在 Lite 集上评测了 32 个 harness–model 组合判题器使用 Sonnet 4.6文本与视觉。图 4 展示了完整排行榜。最高得分是 Codex GPT-5.5 的 0.663没有任何组合接近饱和。论文强调这一结果说明企业工件类任务对当前最强系统而言仍远未解决。一个最清晰的模式来自 harness–model 交互效应Claude 模型族在 Hermes harness 下性能显著下降。Sonnet 4.6 在 Claude Code、DeepAgents、OpenClaw 下得分稳定在 0.62–0.64但在 Hermes 下骤降至 0.458Opus 4.6 与 Haiku 4.5 呈现相同趋势。痕迹分析揭示了原因Claude 模型通常依赖主动环境探测、脚本执行和多步修复而 Hermes harness 更频繁地通过批准检查approval checks阻断这些行为、将受阻步骤路由为委托子任务、并返回过长的执行痕迹导致文件写出循环在完成前被截断。结果是会话可能在/workspace/outputs下没有稳定交付文件就结束。同一模型在 Claude Code 或 DeepAgents 下通常能完成任务说明这是 hm 兼容性问题而非模型单独能力差距。成本与得分的关系呈非线性正相关。图 9 的散点图显示从极低成本系统到中等成本系统分数增益显著超过中档后额外成本的改善递减整体呈“对数形状”。显著的异常值是 Hermes/Claude 族组合——高模型成本未转化为高分数这进一步印证了 hm 交互问题对成本效益的破坏性。按角色类别分解图 5GPT-5.5 是最稳健的通才在多个角色类别上领先。最难的类别是营销marketing和财务/运营finance/operations。人工检查表明这些任务结合了重文档理解与生成、公司特定场景与约定以及公共训练数据中较少见的业务惯例这部分解释了得分偏低的原因。按预期交付物类型分解图 6GPT-5.5 在 HTML、代码/JSON 和多个交付物密集类中最强Opus 4.6 在电子表格上最强。实验同时观察到在视觉判定下电子表格和演示文稿类工具有系统性的分数膨胀与纯文本交付物相比。该模式在判题器消融研究中重现说明当前多模态 LLM 判题器对细粒度企业工件的校准能力弱于文本判题器。Rubric 五维语义诊断图 7显示当前系统普遍在 communication quality 和 task relevance 上优于 grounded accuracy。原因在于企业任务要求阅读大型输入文件并将证据带入业务工件agent 经常无法在大型上传文件中定位用户要求的关键信息或在长时执行过程中丢失这些信息。这一维度的系统性短板指向了企业 agent 落地的核心瓶颈不是表达而是证据保持。全集可扩展性检查在自动构建的 852 个任务上运行了 4 个 DeepAgents 组合表 2。GPT-5.5 得分为 0.766Sonnet 4.6 为 0.749Haiku 4.5 为 0.632GPT-4.1-mini 为 0.336。排序与主排行榜完全一致GPT-5.5 Sonnet 4.6 Haiku 4.5 GPT-4.1-mini且即使最强模型也未饱和。这表明自动管道构建的完整基准能够保留人审 Lite 子集的排序区分度支持管道有效性。主实验部分还提供了一个完整的单案例拆解展示判题器如何区分“部分成功”与“完全完成”。任务要求对两个 Excel 文件其中一个含大量Err:504单元格做跨文件校准与现金流分析交付一个表格文件。ClaudeCode/Haiku 4.5 的最终聊天回复声称“全部通过、准确无误”并给出了总收入、总成本、总毛利等统计。但视觉判题器将电子表格渲染为页面图像后发现异常值未被明确处理且任务要求的现金流分析完全缺失。该案例最终得分为 0.66总体评语指出“输出在校准和分析方面有一定深度但未完全覆盖任务要求的现金流分析”。这说明对产物的视觉/语义核验能有效识别 agent 自我报告的过度自信。4.3 消融实验 / Ablation Study4.3.1 判题器可靠性消融判题器是 EnterpriseClawBench 评分体系的核心因此论文对其可靠性做了密集的消融验证。LLM–LLM 一致性在 Lite 集上重新评分 32 个 hm 组合的工件。GPT-5.4-text 与 Sonnet 4.6 文本判题器之间的 Spearmanρ 0.918 \rho 0.918ρ0.918n 1,853GPT-5.4-visual 与 Sonnet 4.6 视觉判题器之间的ρ 0.866 \rho 0.866ρ0.866n 1,428。这表明有能力的判题器之间能保持大致排序。LLM–人类一致性48 个样本包文本/视觉各半由人类评分者独立评分表 3。文本路由上Sonnet 4.6 与人类评分的 MAE 为 0.134Spearmanρ 0.790 \rho 0.790ρ0.790对齐良好。视觉路由上MAE 扩大到 0.303Spearman 为−0.259出现负秩相关。也就是说在视觉工件上判题器对哪份产物更好的人类判断几乎没有预测能力且系统性地比人类更保守。论文明确指出多模态工件评估尚未成熟这是基准暴露的关键问题。附录中的判题器消融补充图 10从两个视角进一步展开。水平视角显示不同判题器使用不同的绝对分数尺度强模型通常更保守较弱的判题器给出的分数更高因此不同判题器的分数不能混入同一排行榜。垂直视角显示有能力的判题器保持主排行榜的大致排序但中部排名的不稳定性最大且视觉工件比文本工件更明显。图 10 的热力图按 Sonnet 4.6-main 分数排序同时呈现文本路线与视觉路线的分数分布直观展示了判题器模型选择对评测结论的影响。4.3.2 技能注入消融正迁移与负迁移技能迁移实验揭示了技能注入的高方差特性。论文以“会员等级皇冠图标 HTML 页面”这一保留任务为例详细展示了正负两种可能。正迁移案例中无技能注入时 agent 生成了membership_crowns.html判题器评语为“交付物基本完成任务要求三等级皇冠颜色区分明确、页面布局清晰但 Q 萌 3D 风格实现深度不足配饰精细度递进不够显著。”此时得分为 0.756。注入一段通用的前端页面实现技能后定义全局 CSS 变量、按骨架逐页实现、检查图标配置、验证 grid 对齐、确保浏览器直接渲染等agent 生成了membership_crown_icons.html判题器评语变为“交付物完整实现了三等级皇冠图标展示颜色差异化和配饰递进明确整体质量良好但 3D 立体深度略显不足。”得分提升至 0.844。数值关系为S 无技能 0.756 → 注入技能 S 有技能 0.844 , Δ skill 0.088 S_{\text{无技能}}0.756 \xrightarrow{\text{注入技能}} S_{\text{有技能}}0.844, \quad \Delta_{\text{skill}}0.088S无技能0.756注入技能S有技能0.844,Δskill0.088负迁移案例使用同一个 held-out 任务。无技能注入时评语为“页面完整展示三等级皇冠图标且差异化明确但基础皇冠造型偏离皇冠标准形态、3D 深度有限整体质量中等偏上。”注入偏向“交付形态和设计系统”的技能后得分不仅没有提升反而从 0.756 降至 0.555S 无技能 0.756 → 注入技能 S 有技能 0.555 , Δ skill − 0.201 S_{\text{无技能}}0.756 \xrightarrow{\text{注入技能}} S_{\text{有技能}}0.555, \quad \Delta_{\text{skill}}-0.201S无技能0.756注入技能S有技能0.555,Δskill−0.201注入后评语为“页面布局和等级标注完成度较好但皇冠图标造型偏离皇冠参考形态且3D精细度不足核心视觉交付物质量有限。”也就是说技能改善了布局与标注但核心视觉交付物皇冠图标的形态准确性与 3D 精细度反而受损。两相对照说明技能注入可能引导 agent 优先遵循通用交付规范而牺牲针对当前任务细粒度要求的视觉质量。4.3.3 消费者–创建者矩阵在更系统的层面论文报告了技能迁移矩阵图 8。实验覆盖多个消费者 agent 与三个技能创建者每个矩阵单元报告“无技能分数 → 注入后分数”及 delta。GPT-5.5 是最强创建者平均迁移 delta 为 0.0681且未出现负向迁移。Kimi K2.6 次之平均 delta 0.0518增益集中在强消费者如 Codex/GPT-5.5和 OpenClaw/Kimi K2.6 上。Haiku 4.5 是最弱创建者平均 delta 为 −0.0941且对 OpenClaw/Kimi K2.6 产生显著退化。一个重要发现是创建能力与消费能力不对齐。Haiku 4.5 虽然是弱创建者但 DeepAgents/Haiku 4.5 作为消费者时能力不错3 个注入技能中有 2 个改善基线。而强消费者也可能对创建者选择敏感Codex/GPT-5.5 在所有三个创建者下均获益但 Hermes/Kimi K2.6 与 OpenClaw/Kimi K2.6 被 Haiku 创建的技能伤害。论文据此得出结论技能注入是高方差过程取决于创建者质量、消费者行为、创建者–消费者适配和消费者基线分数因此必须以消费者–创建者矩阵在任务类级别评估技能而非报告单一平均值。六、局限性与展望 / Limitations Future WorkEnterpriseClawBench 的局限性首先来自数据来源的单一性。所有任务来自一家 AI 初创公司在三个月内的内部会话企业规模、行业属性、agent 平台约定和员工使用习惯都会在任务分布中留下印记。论文明确承认单一企业部署的结果可能不具普遍代表性。不同行业如金融、医疗、制造业的文档类型、合规要求和业务约定很可能产生完全不同的任务分布与难度曲线。未来需要来自多家企业、多个平台的会话数据来验证构建协议的可迁移性。第二个局限是数据不可发布。由于会话包含内部内容、附件、工具痕迹与业务工件完整数据集无法公开这限制了第三方在完全一致的 task 上直接复现结果。论文的应对是将“可复现性”定义为在发布协议与代码框架下可重建而非直接获取数据。但即便如此重建过程仍依赖原始专有会话外部研究者无法独立验证构建管道的每一步对最终任务集合的影响。一个更可取的未来方向是发布足够大的脱敏后样本或者提供一个模拟会话生成的合成版本使研究社区能在不接触敏感数据的前提下进行方法学复现。第三个局限来自判题器本身尤其是视觉判题器。LLM–人类一致性实验中文本路由的 Spearman 达 0.790但视觉路由出现负秩相关−0.259且 MAE 高达 0.303。这意味着在电子表格、PPT、HTML 渲染图像等多模态工件上当前最强 LLM 判题器对“哪个产物更好”的判断与人类几乎不一致。这是一个必须严肃对待的评测学问题如果评测器本身不可靠那么主排行榜的视觉相关结论就存在不确定性。论文对此的立场是透明的——在报告主结果的同时强制附带判题器消融与人类相关性校准但这不能替代一个本质上更可靠的视觉判定方法。未来需要专门针对企业工件的多模态判题器训练数据或者引入更细粒度的可验证中间表征如表格结构解析、渲染差异检测来辅助判定。第四个局限是门控造成的覆盖范围偏差。fixture 缺失、脱敏不可恢复、URL 不可达、任务目标模糊如“****自动投递”这类原始 agent 都无法消歧的指令都会被排除在基准之外。这保证了基准内任务的机械可复现性但也意味着基准不评测 agent 处理数据缺失类失败和完全模糊指令的能力——而这些恰恰是真实企业部署中常见的运营挑战。未来可以考虑单独构建“失败恢复”任务类专门评测 agent 在信息不足时的澄清策略与降级行为。第五个局限是技能迁移评估的覆盖范围有限。目前技能实验仅聚焦于“前端页面生成”一个任务子类且保留任务只有 5 个统计功效有限。消费者–创建者矩阵揭示了显著的高方差现象但样本量不足以支撑更细粒度的归因分析——例如什么样的技能内容特征导致负迁移创建者模型在什么条件下能稳定生成可迁移技能未来应扩展到更多任务子类并增加保留任务数量使技能迁移的效应量估计更加可靠。此外主排行榜上的 32 个 hm 组合虽已覆盖 5 个 harness 与 9 个模型但模型版本迭代极快。论文的评测协议天然支持未来扩展但如何让排行榜随时间演化而不失真仍是一个开放问题。成本与运行时间的度量虽然被记录但论文未给出这些维度的完整表格——这同样是一个值得后续版本补充的内容。七、总结 / ConclusionEnterpriseClawBench 从真实企业工作区会话出发构建了一个包含 852 个可复现任务的企业 agent 基准。它的核心贡献不是发布一组静态数据而是提供一整套可复用的构建与评估协议从带噪会话中恢复可复现任务的多级门控流水线由硬规则与语义判定构成的两层评分体系联合 harness–model 组合、工件交付、成本、运行时间与技能迁移行为的多维评估框架以及以消费者–创建者矩阵为核心的任务类级技能迁移评估协议。实证结果展示了企业 agent 评测的复杂面貌。最佳配置 Codex GPT-5.5 仅得到 0.663 分说明这一任务领域远未饱和Claude 模型族在 Hermes harness 下的显著降级揭示了 harness 与模型的深刻交互视觉判题器与人类评分的负秩相关暴露了多模态企业工件评估方法的滞后技能注入实验在同一任务上同时产生了 0.088 的正迁移和 −0.201 的负迁移证实了技能迁移的高方差本质。这些发现共同支撑了论文的核心主张企业 agent 评测必须报告 harness–model 组合、工件交付、视觉质量、成本、运行时间和技能迁移行为而不是把性能压缩成一个单一分数。原文摘要:Enterprise agents increasingly operate inside workspaces: they read heterogeneous files, invoke tools, and deliver business artifacts. We introduce EnterpriseClawBench, an enterprise agent benchmark constructed from proprietary, real-world agent sessions. Starting from a large archive of workplace sessions, the EnterpriseClawBench produces 852 reproducible tasks, each paired with recovered fixtures, rewritten prompts, role classes, skill subclasses, hard rules, and semantic rubrics. Because the sessions contain internal enterprise content, we do not release the benchmark data; instead, our reusable contribution is the construction and evaluation protocol. On EnterpriseClawBench, the best configuration reaches only 0.663 (Codex with GPT-5.5). These results show that enterprise agent evaluation must report harness–model combinations, artifact delivery, visual quality, cost, runtime, and skill-transfer behavior, rather than collapsing performance into a single score. Code: https://github.com/FrontisAI/EnterpriseClawBenchPDF链接:https://arxiv.org/pdf/2606.23654v1部分平台可能图片显示异常请以我的博客内容为准