资讯动态

Era‑by‑Eon:面向企业智能体的隐藏知识能力评测基准

发布时间:2026/9/27 2:26:46 来源:尧图企业网站定制
Era‑by‑Eon面向企业智能体的隐藏知识能力评测基准arXiv编号arXiv:2609.30055v1摘要在Era‑by‑Eon基准原有可计算问题中问题的全部推理规则均在题干或企业文档内显式给出当智能体支持代码执行能力时四款最强模型在27道可计算问题上答对22‑25题模型之间区分度很低。本文为该基准新增8道依赖隐藏知识的问题模板隐藏事实不会出现在任何题干与文档中表面记录展示的是其它信息必须通过多源数据交叉推导得出真实事实。例如CRM记录显示客户放弃采购原因为时间因素但销售通话录音揭示真实诱因是服务宕机。基准代码可以为每一份生成的虚构企业数据集填充模板并计算标准答案全程不依赖大模型。本文一共评测12组智能体6个大模型 × 2套智能体执行程序每个问题执行3轮测试。最优智能体在24次尝试中答对18题6个模型中有4个无论搭配哪套智能体程序24次尝试最多仅答对6题。最难的题目要求在多条高度相似记录中甄别正确条目例如客户签署的三份续约报价中识别实际生效的那一份全部智能体合计84次尝试仅1次答对该类问题。关键词企业智能体Agent评测隐藏知识多源数据推理业务数字孪生Era‑by‑EonMCP协议目录引言背景Era‑by‑Eon基准介绍原有可计算问题的能力天花板隐藏知识的定义与约束条件新增隐藏知识问题模板数据集与问题生成流程实验设置实验结果与失败分析讨论结论参考文献附录A 问题模板样例附录B 完整实验原始数据1 引言大语言模型智能体可以调用工具访问企业业务数据完成业务查询任务。一个智能体由大模型基座智能体执行程序两部分组成执行程序提供工具工具调用企业系统API模型输出工具调用执行程序运行工具并返回结果模型整合输出最终答案。部分执行程序还允许模型在沙箱中自主编写运行Python代码。现有企业智能体基准CRMArena、τ‑bench、TheAgentCompany、WorkArena、Era‑by‑Eon大多使用可计算问题解答问题所需要全部规则、条件全部显式写在题干或者知识库文档中。Era‑by‑Eon会生成虚构企业使用业务应用模拟器对外提供数据代码直接生成标准答案。在原有可计算问题集合上当智能体支持代码运行顶尖模型得分高度接近基准区分能力不足。现实企业业务场景存在大量隐藏知识事实不会显式存储在单一系统需要跨多个异构业务系统、跨记录交叉推断。示例场景CRM将客户放弃扩购商机原因标记为「时间因素明年重新评估」但销售通话录音记录客户董事会因为服务宕机取消本次扩购宕机证据来自客户在此商机关闭前提交的最高优先级紧急工单。只读取CRM会得到错误结论必须结合通话记录、工单系统交叉推导。本文主要贡献定义隐藏知识划分三类隐藏知识给出依赖隐藏知识的问题存在唯一标准答案的四项约束条件。为Era‑by‑Eon基准新增8套隐藏知识问题模板基准可基于随机种子生成企业数据集自动填充模板并计算标准答案全程不需要LLM参与。评测12组智能体6模型×2套执行程序分析智能体在隐藏知识任务上的失败模式揭示跨系统交叉推断是当前企业智能体的显著短板。2 背景Era‑by‑Eon基准介绍Era‑by‑Eon由Eon公司开发生成虚构企业并模拟各类真实业务软件。输入规格包含五项行业、企业规模微型‑超大型、商业模式、业务应用列表、随机种子生成过程具备确定性相同规格输出完全一致。核心产出实体图entity graph存储员工、客户、商机、工单、通话记录、聊天消息、文档等全部业务实体。每套业务系统由模拟器实现对外提供两套接口REST API程序调用接口MCPModel Context Protocol服务大模型工具调用标准接口。模拟系统包含Salesforce/HubSpot CRM、Zendesk工单、Jira工程任务、Gong销售通话记录、Slack聊天、S3文件存储。全部模拟器读取同一实体图部分场景刻意制造不同系统记录出现信息分歧用于构造隐藏知识题目。智能体只有只读权限。评判器直接基于模拟器返回的数据通过代码计算标准答案key将智能体输出与key对比打分不使用LLM做评判。项目资源地址https://console.era.eon.io业务术语说明Account客户企业Contact客户企业联系人Deal商机潜在销售机会流转于不同阶段最终赢单或丢单Contract签署合同Renewal合同续约Proposal续约报价方案TicketZendesk支持工单优先级Highest / High / Medium / LowPipeline全部未结商机。本文实验使用一套固定随机种子生成的大型金融科技B2B企业员工规模1000人40位系统用户工程17人、客服13人、销售8人、售前2人包含250客户账户、4190联系人、198合同、2500商机、3000工单、3506通话记录、9880 Jira Issue、1918 Slack消息、2367份文档。HubSpot存有部分Salesforce商机副本部分副本的金额、关闭日期存在不一致。3 原有可计算问题的能力天花板可计算问题定义解答该问题需要的全部规则全部显式写在题干或者企业内部文档。本文使用两套智能体执行程序Era原生程序不支持运行代码支持MCP REST API单轮最大165轮次、165次工具调用工具返回最大32000字符。LangGraph程序基于LangGraph构建工具集合和Era程序保持一致额外增加沙箱Python代码执行工具沙箱无外网脚本只能通过外层程序转发请求访问模拟器API最大150轮次。评测6个模型Claude Fable 5.1、Claude Sonnet 5、GPT‑6 Astra、GPT‑5.6 Sol、GPT‑5.6 Luna、DeepSeek‑V3.2。27道可计算问题每道题目运行1次。模型Era程序不可运行代码LangGraph程序沙箱代码执行Claude Fable 5.1未运行25Claude Sonnet 5未运行25GPT‑6 Astra824GPT‑5.6 Sol122GPT‑5.6 Luna08DeepSeek‑V3.210现象开启代码沙箱之后四款最强模型答对22‑25题原有可计算任务对顶尖智能体区分度极低。因此需要引入依赖隐藏知识的题目提升基准难度。4 隐藏知识的定义与约束条件隐藏知识Hidden Knowledge事实不在任何题干、文档、单条业务记录中显式存在必须综合多条来自不同系统的记录交叉推导得到。三类隐藏知识冲突式隐藏知识不同系统记录对同一事件给出不一致描述真实事实需要甄别。如CRM标记丢单原因为时间通话录音揭示宕机才是根因间接关联隐藏知识多条记录通过实体ID、时间、人名做间接链接合并之后才得到结论。多候选甄别隐藏知识多条高度相似候选记录依靠时间、状态等细微约束筛选出唯一正确条目。具备唯一标准答案的四项前提条件全部用于推导的原始记录可以通过只读工具访问推导逻辑可以完全由确定性代码实现不需要主观推测实体之间关联链路完整不存在关键记录缺失存在可判定的真值不需要外部常识。5 新增隐藏知识问题模板新增8套问题模板固定问题句式与推导规则基准程序从生成企业数据选取实体填入模板自动计算标准答案。更换随机种子实体实例、标准答案随之改变。示例类型商机丢单真实根因识别CRM记录与通话记录冲突结合工单佐证识别客户实际签署生效的续约报价多份报价依靠签署日期、报价有效期筛选跨系统识别客户投诉事件的真实触发源销售行为的交叉校验CRM记录与通话记录不一致工单‑商机关联推导6‑8. 其它多源交叉甄别类任务。其中多候选甄别类题目难度最高例如三份续约报价只有一份在客户签署当日仍处于有效期需要筛选得到客户实际签署版本。6 数据集与问题生成流程基于固定随机种子生成完整金融科技企业实体图8套模板选取对应业务实体填充生成问题确定性Python代码读取模拟器数据计算标准答案不调用LLM每道题目允许智能体最多3轮尝试。7 实验设置被测对象6个基座模型 × 2套执行程序Era无代码 / LangGraph带Python沙箱合计12组智能体。评测题目8道隐藏知识题目每题运行3次每组智能体一共24次尝试。环境Era‑by‑Eon模拟器评判器为确定性代码评判不使用LLM judge。限制条件Era程序最多165轮次LangGraph最多150轮次工具返回字符上限沿用基准配置。8 实验结果与失败分析主要实验结果最优智能体24次尝试答对18题。表现最好两个模型Claude Fable 5.1、GPT‑6 Astra对于这两个模型开启代码沙箱并没有带来明显正确率提升。6个模型中有4个无论搭配哪套执行程序24次尝试最多答对6题。最难的多候选甄别题目全部12组智能体合计84次尝试仅1次答对。典型失败模式只依赖单一系统记录优先读取CRM等主系统忽略通话、工单等其它异构数据源直接采信表面字段识别信息冲突但不去追溯佐证记录发现两份记录矛盾无法继续检索第三方证据多条相似候选记录无法做精细过滤拿到多条候选无法应用时间、有效期等细粒度约束筛选唯一正确记录代码沙箱虽然擅长聚合统计但很难驱动多步跨系统的假设验证与冲突甄别。关键现象可计算任务上代码沙箱带来巨大收益但在隐藏知识冲突甄别任务代码执行能力本身不足以解决问题难点在于智能体需要主动意识到存在冲突、主动去检索补充数据源而不是数据拿到手之后的聚合计算。9 讨论原有Era‑by‑Eon可计算任务对强模型区分度过低新增隐藏知识题目有效拉开模型与智能体程序之间差距。代码沙箱擅长聚合、join、统计但是无法解决“不知道需要读取哪些系统”的问题。隐藏知识任务瓶颈是工具检索规划而不是拿到数据之后的计算。多候选甄别类任务难度极高现有企业智能体普遍存在短板。局限性实验仅使用一套固定种子生成的企业数据集不同企业数据分布难度会发生变化。全部任务为只读查询任务不涉及数据修改、写操作。题目全部为人工设计模板真实企业业务的隐藏事实模式更加多样复杂。未来方向扩充更多隐藏知识模板拓展多企业种子做大规模评测研究提升智能体跨系统冲突识别、假设验证检索能力。10 结论原有Era‑by‑Eon基准的可计算问题在智能体具备代码执行能力之后顶尖模型得分趋同区分度不足。本文新增8道依赖隐藏知识的评测题目事实不能从单份记录直接读取需要跨多业务系统交叉推导。12组智能体评测结果显示当前企业智能体在冲突甄别、多源证据交叉推理任务存在显著短板即使有Python沙箱代码执行能力也无法弥补检索规划层面的缺陷多相似候选甄别类任务几乎全部智能体都很难答对。该套扩充题目提升Era‑by‑Eon基准对企业智能体的区分能力。11 参考文献完整参考文献查阅原始arXiv网页https://arxiv.org/html/2609.30055v1附录简要说明附录A隐藏知识完整问题模板样例输入输出示例。附录B全部12组智能体24次尝试原始对错统计表失败案例采样。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑