资讯动态

用 garak LLM 漏洞扫描器检测你的模型会不会被越狱

发布时间:2026/9/18 18:41:53 来源:尧图企业网站定制
用 garak LLM 漏洞扫描器检测你的模型会不会被越狱【免费下载链接】garakthe LLM vulnerability scanner项目地址: https://gitcode.com/GitHub_Trending/ga/garak你的客服 AI 突然把内部系统提示词原样吐给了用户这就是提示注入越狱现场。garak是一个 LLM 漏洞扫描器它把 DAN 越狱、注入、数据泄露等攻击提示喂给模型告诉你哪些防线真能挡住。能力速览模块一句话作用probes向模型发送一组攻击提示模拟越狱、注入、数据泄露等场景detectors判定模型输出是否出现了不想要的不当行为generators连接被测模型支持 OpenAI、Hugging Face、本地 GGUF 等buffs在提示发出前动态改写扩大同一攻击的覆盖面report每次扫描输出 JSONL 报告记录每条尝试与判定结果从零跑通安装 garak 并配置密钥python -m pip install -U garak这一条从 PyPI 安装 garak 及全部依赖。export OPENAI_API_KEY你的密钥测 API 模型前先在终端导出密钥。本地模型则不需要任何密钥。三步任务从冒烟到定向排查最小验证一条冒烟扫描确认环境可用python3 -m garak --target_type test --spec probes.dan用内置的空字符串生成器跑一遍 DAN 探针家族不花一分钱 API 费用能完整走通生成—判定—报告流程确认安装成功。定向排查一条命令排查全部 DAN 变种python3 -m garak --target_type openai --target_name gpt-3.5-turbo --spec probes.dan对真实模型执行 DAN 全系列越狱探针每个探针跑完会打印一行判定结果。只关心某一个版本时把结尾换成probes.dan.Dan_11_0。自定义配置用内置 fast 配置收敛扫描范围python3 -m garak --target_type openai --target_name gpt-3.5-turbo --config fastfast 配置预置了一组常用探针比默认的全量扫描快得多适合作为定期巡检基线。跑通之后先看输出。看懂输出只读三个关键指标FAIL 率每个探针与检测器组合下触发不当行为的尝试占比。这一行标 FAIL 就说明该防线被击穿。生成计数行尾形如 840/840 的数字分别是生成样本总数与表现正常的数量样本量是否够一眼可见。报告文件每次运行生成 garak. .report.jsonl记录全部提示、响应与判定hit log 单独列出每一次命中便于复核。常见卡点三个高频情况现象跑 OpenAI 模型时报错找不到认证信息 原因终端里没有导出 OPENAI_API_KEY 解法同一终端执行export OPENAI_API_KEY...后重跑现象默认全量探针跑了几小时还没结束 原因默认加载全部探针且每条提示默认生成 10 次样本 解法加--config fast收敛范围远程模型可再加--parallel_attempts 20提速现象命令行提示--probes已弃用 原因旧参数已被--spec取代 解法统一改用--spec probes.dan这类写法落地清单每次模型升级后跑一遍--config fast巡检对比 FAIL 率是否回升归档 garak. .report.jsonl 与 hit log作为漏洞定级和复盘依据把 garak 扫描挂进发布流程核心探针 FAIL 率上升时阻断上线延伸阅读检测器模块各类失败模式判定逻辑的源码实现内置配置开箱即用的 fast、bag 扫描配置数据文件目录DAN 提示、越狱语料等探针依赖的攻击数据【免费下载链接】garakthe LLM vulnerability scanner项目地址: https://gitcode.com/GitHub_Trending/ga/garak创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价