agentic_security
开源 LLM 红队攻击工具包:自动化漏洞扫描、越狱攻击测试与多模态安全评估
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源 LLM 红队攻击工具包:自动化漏洞扫描、越狱攻击测试与多模态安全评估
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Agentic Security 启动后的 Web UI 界面,可直接通过浏览器操作漏洞扫描任务。
想象一下:你花了一周时间精心微调了一个内部 AI 客服,它能回答员工的各种报销、HR、政策问题。突然,有人发现只需要输入一串特殊指令,就能让 AI 吐出它训练数据里存储的隐私信息——API 密钥、内部流程文档、甚至其他用户的对话历史。这不是科幻情节,这是 OWASP LLM Top 10 明确列出的真实威胁。
Agentic Security 做的事情,就是把这种找漏洞的活儿自动化。它是一个专门给 AI 系统做红队攻击(Red Teaming)的开源工具包,支持对大语言模型(LLM)和 Agent 工作流进行系统性漏洞扫描,涵盖越狱攻击(Jailbreak)、模糊测试(Fuzzing)、多模态攻击等主流威胁场景。
这个项目由独立安全研究员 Alexander Miasoiedov(GitHub @msoedov)发起和维护。项目的诞生背景是:随着 LLM 被广泛集成到生产系统,传统的静态代码审计已经不够用了——AI 系统的安全风险来自模型行为本身,而不是代码缺陷。手动做红队测试既费时又难以覆盖足够的攻击向量。
msoedov 在实际工作中需要反复对不同 LLM 进行安全评估,于是决定把这套流程工具化,开源出来供整个社区使用。项目于 2024 年初发布,迅速获得了 1899 stars 和 264 forks,并在 Hugging Face Datasets 上维护了多个公开的攻击数据集。
支持同时对文本、图片、音频三种模态的输入进行攻击探测。在 Agentic Security 的框架里,可以针对不同模态构造特定的攻击向量,验证 LLM 在接收多模态输入时是否存在绕过安全过滤的风险。比如,一张经过精心设计的对抗图片配合文字指令,可能诱导模型执行不该执行的操作。
越狱攻击(Jailbreak)是目前最常见的 LLM 安全威胁形式。不同于单次提示词注入,多步越狱攻击通过一系列递进式的对话轮次,逐步瓦解 AI 的安全防护机制。Agentic Security 提供了迭代式攻击模拟能力,可以自动生成并执行多轮攻击序列,测试模型在连续压力下的鲁棒性。
Agentic Security 内置了完整的模糊测试引擎,支持对任意 LLM API 施加高强度随机化输入压力测试。通过加载 Hugging Face Datasets 中的公开数据集(如 AdvBench)或用户自定义的 CSV 提示词库,对 LLM 进行大规模边界条件探测,识别传统测试难以发现的隐藏行为。
这是 Agentic Security 最具技术深度的功能。项目中集成了 scikit-optimize 和 scikit-learn,支持基于强化学习(RL)的自适应攻击生成。攻击探测器会根据目标模型的反馈动态调整策略,模拟真实攻击者边试边学的过程,生成更接近实战的高级威胁向量。
项目采用 Python 3.12 + Poetry 管理依赖,核心架构围绕以下几个模块展开:
项目使用了以下核心技术栈:
Agentic Security 内置了一个功能完整的 Web UI(由 Vue.js + TailwindCSS 驱动),启动后访问 http://localhost:8718 即可在浏览器中操作扫描任务。UI 支持可视化配置 LLM 接入、选择攻击模块、查看扫描报告和图表。
CLI 模式:最简单的方式是 pip 安装后直接运行 agentic_security,默认启动 Web UI。也可以通过 agentic_security ls 查看可用数据集,agentic_security init 初始化配置文件。配置文件使用 TOML 格式,结构清晰。
Docker 模式:提供了完整的多阶段 Dockerfile(基于 python:3.12-slim),构建后容器内运行在 8718 端口,包含健康检查。适合在 CI/CD 环境中集成。
CI 集成:支持通过 agentic_security init 生成 agesec.toml 配置文件,结合 CI 系统做自动化安全扫描。
局限性:
争议点:开源安全工具本身是中性的,但 Agentic Security 这类工具的存在也引发了社区讨论——它既可以用于正当的安全评估,也存在被滥用于生成攻击向量的风险。项目维护者在 SECURITY.md 中明确表示欢迎负责任的漏洞披露,并对恶意使用保持警惕。
Agentic Security 的出现,折射出一个更大的行业趋势:AI 系统的安全评估正在从手工测试走向自动化。随着 LLM 被嵌入金融、医疗、企业内部系统等高风险场景,监管机构和行业标准(如 OWASP LLM Top 10)也在推动强制性的安全评估要求。
从 GitHub 数据来看,项目在过去一年持续活跃更新(最新推送日期 2026-06-11),fork 数达 264 次,社区贡献活跃。与同类工具(如 Garak、Ner agent)相比,Agentic Security 的差异化在于插件化的攻击规则系统(attack_rules)、RL 驱动的自适应攻击,以及与 Hugging Face 生态的深度集成。
如果你正在开发或部署 LLM 应用,建议将 Agentic Security 纳入安全开发生命周期,在上线前进行系统性的红队测试。