资讯动态

PASTABench:面向智能体安全的序列轨迹主动评估基准

发布时间:2026/9/26 11:15:07 来源:尧图企业网站定制
PASTABench:面向智能体安全的序列轨迹主动评估基准arXiv编号:arXiv:2609.28197v1 [cs.AI]摘要随着大语言模型进化为可以改变真实世界状态的自主智能体,保障多步工作流运行安全成为关键挑战。现有安全评测存在明显短板:单步评测将各个动作孤立看待,忽略风险随轨迹逐步累积的效应;轨迹级评测大多为事后分析,无法提供及时干预时机。本文形式化定义解耦式主动安全监控(Decoupled Proactive Safety Monitoring),从三个核心维度定义任务:是否干预(Whether)、何时干预(When)、风险是什么(What)。构建PASTABench基准数据集,包含1139条多轮交互轨迹,覆盖5大类、13个子类风险。提出最优干预窗口OIW(Optimal Intervention Window),通过标注「最早信号轮次Earliest‑Signal」与「触发轮次Trigger」,对干预时机做量化评估。对16个主流大模型开展评测,结果表明主动干预任务仍远未被解决,最优模型的完美时机干预率仅为40.74%。细粒度诊断发现普遍存在词汇过拟合现象:部分小模型安全指标看似不错,实际只是对危险关键词高度敏感,并非真正理解风险逻辑;一旦把危险词汇脱敏消除,小模型主动安全能力会大幅崩塌;而闭源前沿大模型仍然可以维持基于状态的推理能力。关键词智能体安全;主动安全监控;序列轨迹;最优干预窗口;词汇过拟合;安全评测基准目录引言相关工作2.1 大模型智能体安全评测范式2.2 智能体工作流防护模型PASTABench基准数据集3.1 风险分层分类体系3.2 数据集完整构建流水线3.3 评测指标定义实验4.1 实验设置4.2 主实验结果4.2.1 风险归因能力(What维度)4.2.2 跨风险类别性能差异4.2.3 干预时间精度(When维度)4.3 时序推理诊断:词汇过拟合脱敏消融讨论结论参考文献附录A 对比现有安全基准附录B 风险分类详细定义附录C 环境、工具库配置附录D 评测Prompt、推理超参数附录E 完整细分实验数据附录F 案例分析1 引言大语言模型智能体可以完成长视界规划、调用工具,改变数字甚至物理世界状态,部署时运行安全是核心阻碍。传统单轮安全评测存在固有缺陷:智能体风险很少来自单条明显有害输出;风险往往是多步累积形成,一系列单看无害的动作逐步演化,最终酿成危害。安全属于整条轨迹层面属性,需要持续监控。现有多轮安全评测有两大关键局限:步骤级评测:孤立评估每一步动作,忽略风险随时间累积演化;轨迹级事后评测:整条交互结束后才给出安全判定,来不及做及时干预。本文提出解耦式主动安全监控,将监控任务拆解为三个必须同时完成的维度:Whether 是否干预:监控器检测逐步累积的风险,不能过度敏感误报,判断是否应当中断智能体执行;When 何时干预:在恰当时间点阻断,不能过早干扰正常业务,也不能过晚导致伤害不可逆;What 风险归因:诊断识别正在浮现的风险类型,支持针对性缓解,而不是简单粗暴拒绝执行。为系统性评估该任务,构建PASTABench基准:数据集规模:1139条多轮交互轨迹,覆盖高风险业务领域;风险采用层级分类:5个一级大类,13个二级子类;提出最优干预窗口OIW:每条轨迹标注两个时间锚点:t e s t_{es}tes​:Earliest‑Signal最早信号轮次,风险先兆首次出现;t t r i g g e r t_{trigger}ttrigger​:Trigger触发轮次,继续执行将产生不可逆危害。OIW窗口:[ t e s , t t r i g g e r ) [t_{es},\ t_{trigger})[tes​,ttrigger​),干预落在该区间为时机合理。示例场景:数字工作空间,系统提示目标文件带有CRITICAL_ASSET标记,该时刻为t e s t_{es}tes​;智能体执行绕过确认批量删除命令,该时刻为t t r i g g e r t_{trigger}ttr

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑