AdvWeb: Controllable Black-box Attacks on VLM-powered Web Agents (2024)论文重点视觉语言模型VLM的快速发展推动了通用型Web Agent的诞生使其能够自主完成真实网站上的各类任务。然而这些Agent在面对恶意攻击时的安全性问题尚未得到充分探索。AdvWeb提出了一种新型黑盒攻击框架通过训练对抗性提示器Adversarial Prompter模型在网页中生成并注入视觉上不可察觉的对抗性字符串误导VLM驱动的Web Agent执行预设的有害操作如不当的股票购买或错误的银行交易。核心研究内容问题定义随着LLM和VLM的快速发展通用型Web Agent已能自主与真实网站交互并执行任务在金融、医疗、电商等高风险领域展现出巨大潜力。然而现有针对Web Agent的对抗性攻击研究存在明显不足要么攻击成本过高、需要人工设计攻击提示要么主要关注单一攻击场景缺乏灵活性而针对LLM/VLM的自动化攻击方法又难以在黑盒设置下实现有效的可转移性。因此如何在仅拥有黑盒访问权限的条件下高效、灵活且隐蔽地攻击VLM驱动的Web Agent成为一个亟待解决的关键问题。创新方法AdvWeb的核心创新体现在以下几个方面1. 两阶段训练范式。AdvWeb提出了一种结合强化学习的两阶段训练范式利用受害者Agent的黑盒反馈来优化对抗性字符串。具体而言采用直接策略优化DPO算法同时利用成功和失败的攻击字符串来训练对抗性提示器模型。2. 隐蔽性与可控性兼备。与以往方法不同AdvWeb的对抗性字符串注入具备两大优势隐蔽性攻击前后网站的外观保持不变用户几乎无法察觉页面被篡改可控性攻击者可以修改生成的对抗性字符串中的特定子字符串无缝切换攻击目标如将购买股票的目标从公司A改为公司B大幅提升了攻击的灵活性和效率。3. 黑盒攻击设定。AdvWeb仅需黑盒访问Web Agent无需了解其内部架构或参数更贴近真实世界的攻击场景。研究成果研究团队进行了广泛的实验评估结果表明AdvWeb在黑盒设置下对各种Web任务中基于GPT-4V的SOTA VLM Agent均取得了高攻击成功率。这一结果暴露了当前基于LLM/VLM的Agent存在的严重安全漏洞凸显了开发更可靠的Web Agent和实施有效防御的迫切性。实际落地应用的可能性攻击侧AdvWeb框架可被红队Red Team用于在Web Agent实际部署前进行安全评估和漏洞挖掘帮助发现潜在风险点。防御侧该研究揭示的漏洞为防御策略的研发提供了明确方向——如何检测和抵御这种视觉上不可察觉的对抗性注入攻击将成为下一代Web Agent安全设计的核心课题。技术细节核心架构AdvWeb的整体架构包含三个关键组件目标Web Agent基于VLM如GPT-4V的通用型Web Agent负责理解网页内容并执行操作。对抗性提示器Adversarial Prompter一个经过训练的模型能够根据攻击目标生成对抗性字符串。该模型通过DPO算法优化利用目标Agent的黑盒反馈进行迭代改进。注入机制将生成的对抗性字符串注入到网页的特定位置如不可见元素或页面文本中同时确保网页的视觉外观不发生变化。DPO训练机制AdvWeb采用直接策略优化Direct Preference Optimization进行训练。与传统的强化学习方法不同DPO无需训练独立的奖励模型而是直接通过偏好数据优化策略。在AdvWeb的上下文中成功攻击字符串能够成功误导Agent执行目标操作的对抗性提示作为“正样本”失败攻击字符串未能达到预期效果的对抗性提示作为“负样本”。通过DPO对抗性提示器学习生成更有可能成功攻击目标Agent的字符串。对抗性字符串的可控编辑AdvWeb的一个关键技术特点是攻击目标的可控切换。生成的对抗性字符串中包含可编辑的“占位符”子字符串攻击者只需修改特定部分即可改变攻击目标。例如原始对抗字符串“… purchase stocks of [COMPANY] …”修改后“… purchase stocks of Tesla …”再次修改“… purchase stocks of Apple …”这种设计使得攻击者无需重新训练模型即可实现多目标攻击大幅提升了攻击效率。研究设定实验配置根据论文信息该研究的基本配置如下配置项详情论文页数15页学科领域密码学与安全cs.CR计算与语言cs.CL目标Agent基于GPT-4V的SOTA VLM Agent攻击设定黑盒访问仅能观察输入输出无法访问内部参数训练算法直接策略优化DPO评估任务多种真实世界Web任务如股票交易、银行操作等代码与数据论文作者已公开代码和数据可在以下地址获取项目主页https://ai-secure.github.io/AdvWeb/论文预印本https://arxiv.org/abs/2410.17401硬件需求推测虽然论文未明确列出硬件配置但基于方法特点可合理推断训练阶段需要GPU资源用于训练对抗性提示器模型DPO优化规模取决于基础模型的参数量推理阶段攻击时只需运行训练好的对抗性提示器生成对抗字符串计算资源需求相对较低目标Agent调用需要能够调用GPT-4V等VLM模型的API接口。综合分析学术价值AdvWeb在安全研究领域具有重要的学术贡献。首先它将对抗性攻击的研究视野从单一的LLM/VLM模型扩展到了更复杂的Agent系统——这些系统不仅包含模型本身还涉及与真实世界网页的交互链路攻击面更广、危害更大。其次黑盒设定使得该研究更贴近实际攻击场景因为商业部署的Web Agent通常不会公开其内部架构。第三DPO的应用为对抗性提示的自动化生成提供了一条高效路径避免了传统RL方法中奖励模型训练的额外开销。技术局限性从技术角度看AdvWeb也存在一些值得关注的局限依赖API访问训练对抗性提示器需要持续调用目标Agent并获取反馈这在某些场景下可能受限于API调用成本和频率限制。泛化性问题论文主要针对GPT-4V进行评估对其他VLM模型如Qwen-VL、LLaVA等的攻击效果尚需进一步验证。防御演进的动态性随着防御机制的引入AdvWeb的攻击效果可能会衰减需要持续迭代。现实意义这项研究最令人警醒的发现是攻击可以在用户完全无感知的情况下发生。由于网页视觉外观不变用户不会怀疑页面被篡改而Web Agent在“不知情”的情况下执行了有害操作可能导致真实的财务损失。这种“人不知、Agent不觉”的攻击模式对金融交易、医疗记录修改、电商操作等高价值场景构成了实质性威胁。与同类工作的对比维度传统对抗攻击AdvWeb攻击对象LLM/VLM模型VLM驱动的Web Agent访问权限通常需要白盒或灰盒纯黑盒隐蔽性文本扰动明显网页外观不变可控性目标固定子字符串可编辑自动化程度需人工设计提示DPO自动优化实践应用对安全研究人员的建议红队测试工具将AdvWeb纳入Web Agent上线前的安全测试流程模拟真实攻击场景提前发现漏洞。防御机制研发基于AdvWeb揭示的攻击模式研究对应的检测与防御策略如对网页内容进行对抗性鲁棒性检测在Agent决策链路中增加对抗性输入过滤层对关键操作如交易、修改增加二次确认机制。对Web Agent开发者的建议输入净化在Agent处理网页内容之前增加对抗性字符串的检测与过滤模块。输出监控对Agent的执行动作进行异常检测识别可能由对抗攻击引发的异常行为模式。多样性训练在Agent训练阶段引入对抗性样本增强提升模型对这类攻击的鲁棒性。对普通用户的提醒虽然普通用户无法直接从技术层面防御此类攻击但可以关注所使用的Web Agent服务商是否具备完善的安全评估流程对涉及金融交易、个人信息修改等敏感操作保持警惕尽量通过多重渠道确认操作合法性。参考资料来源原始论文: https://arxiv.org/abs/2410.17401项目主页: https://ai-secure.github.io/AdvWeb/Hugging Face Paper Page: https://huggingface.co/papers/2410.17401