AI-Red-Teaming-Guide
最完整的 AI 系统对抗性测试知识库,覆盖传统 LLM 安全到 Agentic AI 新兴攻击面的完
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
最完整的 AI 系统对抗性测试知识库,覆盖传统 LLM 安全到 Agentic AI 新兴攻击面的完
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你的团队刚上线了一个 AI 客服机器人,功能测试一切正常——问答流畅、响应及时。然而三个月后,安全团队发现这个机器人在特定提示词下可以泄露用户的完整电话号码、家庭住址,甚至被诱导生成钓鱼邮件模板。更糟糕的是,攻击者已经通过这个漏洞批量提取了数千条用户数据。
这不是虚构的场景,而是 2025-2026 年 AI 安全事件中的真实缩影。随着大语言模型(LLM)和 Agentic AI 系统在各行业的快速部署,AI 安全问题已经从学术讨论演变为企业必须正视的生存威胁。AI Red Teaming(AI 红队测试) 正是应对这一挑战的核心方法论。
传统的网络安全红队测试已发展数十年,有成熟的框架、工具和最佳实践。但 AI 系统——尤其是基于大语言模型的系统——带来了全新的安全维度:
攻击面急剧扩大。传统应用的攻击入口点相对有限(网络接口、API 端点、数据库)。而 AI 系统在输入侧有 prompt 注入、恶意文档嵌入,在输出侧有幻觉内容、敏感信息泄露,在模型层面还有数据投毒、对抗样本和模型提取攻击。一个看似无害的对话系统,背后可能连接着向量数据库、企业知识库、甚至文件系统。攻击路径的数量级远超传统软件。
安全边界难以定义。传统应用的行为可以精确规约(输入 X 输出 Y)。但 LLM 的行为空间是开放域,同样的提示词在不同的上下文窗口中可能产生截然不同的响应。这使得传统安全测试方法——边界检查、权限验证、输入过滤——难以直接套用。
监管压力加速落地。欧盟《AI 法案》(EU AI Act)、美国 NIST AI Risk Management Framework、OWASP GenAI Security Guidelines 等框架相继出台,要求部署 LLM 系统的组织必须进行对抗性测试。合规需求正在成为 AI 红队测试的重要驱动力。
requie/AI-Red-Teaming-Guide 正是为解决这一空白而生的综合性知识库。该项目由安全研究人员 requie 维护,汇集了 AI 红队测试的完整方法论、攻击向量分类、工具链和实战模板,被 Microsoft、Google、Meta、OpenAI、NVIDIA、Anthropic、IBM、Amazon、Cisco、HackerOne 等机构的从业者参考使用。该项目在 2026 年 6 月完成了一次大规模更新,专门新增了 Agentic AI 时代的新兴攻击面——包括 MCP 协议安全、计算机使用代理攻击和 RAG 攻击分类。

图1:AI Red Teaming Guide 项目首页
该指南的核心是一套结构化的四阶段 AI 红队测试方法论,适用于从 LLM 对话机器人到 Agentic AI 系统的各类 AI 产品的安全评估。
红队测试不是盲目渗透,而是有目的的攻击模拟。第一阶段要求测试团队完成以下工作:
系统认知(System Discovery):理解被测系统的能力边界、使用场景和用户画像。这包括回答一系列关键问题:系统是完全自主运行还是辅助决策?有哪些外部数据源和工具连接?输入输出通道有哪些?潜在攻击者的画像是什么(脚本小子、竞争对手还是国家级APT)?
威胁建模(Threat Modeling):指南推荐使用 MITRE ATLAS(Adversarial Threat Landscape for Artificial-Intelligence Systems)作为威胁建模框架。ATLAS 将 AI 系统的攻击战术划分为 10 余个类别,包括侦察(Discover)、资源开发(Resource Development)、初始访问(Initial Access)、执行(Execution)、持久化(Persistence)、权限提升(Privilege Escalation)、防御规避(Defense Evasion)、凭证访问(Credential Access)、发现(Discovery)、收集(Collection)、影响(Impact)等,对应 ATT&CK 框架的思路但针对 AI 特性重新定义。
风险画像(Risk Profile):根据应用场景对系统进行风险分类。指南将风险分为六个维度:安全风险(数据泄露、未授权访问)、隐私风险(PII 泄露、训练数据提取)、安全风险(物理伤害、危险建议)、公平性风险(歧视性输出、偏见)、可靠性风险(幻觉、不一致响应)和声誉风险(攻击性内容、品牌损害)。不同场景的优先级不同——医疗 AI 的安全风险优先级最高,而客服机器人的隐私风险可能更突出。
执行阶段是整个方法论的核心。指南详细阐述了三种测试方法及其适用场景:
黑盒测试(Black Box):测试人员仅通过公开接口(API、Web UI)与系统交互,不了解内部架构。这种方式模拟外部攻击者视角,是最真实的威胁建模方式。测试人员扮演"什么都不知道"的攻击者,通过不断尝试来发现系统的薄弱环节。
灰盒测试(Gray Box):测试人员拥有部分内部知识(如架构文档、部分数据集)。这模拟了内部威胁或已经完成侦察的 APT 攻击者,能发现更深层的漏洞。
白盒测试(White Box):测试人员拥有完整访问权限(代码、模型权重、训练数据)。这种方式的漏洞发现能力最强,通常用于发布前的最终安全审计。
在此基础上,指南深入讲解了手动红队技术和自动化红队工具的结合使用:
手动红队技术涵盖了几类核心攻击模式:
自动化红队工具包括:
指南推荐混合方法作为最佳实践:先用自动化工具进行广覆盖扫描,再用人工专家对发现的问题进行深度调查,然后将成功的攻击链添加到自动化回归测试套件中,形成持续改进的闭环。
测试完成后,需要对发现的安全问题进行量化评估。指南建议关注以下核心指标:
最后一个阶段是将发现转化为可操作的修复建议。指南提供了标准化的漏洞报告模板,要求包含漏洞元数据(ID、日期、影响版本)、严重性评级、利用场景描述、根因分析和修复建议。
2026 年 6 月的更新是该项目最重要的里程碑,专门针对 Agentic AI(智能体 AI)时代的威胁进行了全面重构。新增内容包括:
1. MCP 协议安全(MCP & Tool-Protocol Security):MCP(Model Context Protocol)允许 LLM 连接外部工具和数据源,但同时引入了全新的攻击面:工具/模式投毒(Tool/Schema Poisoning)、MCP 服务器劫持(Server Compromise / Rug-Pull 攻击)、工具调用拦截重定向(Tool-Call Interception / Redirection)、凭证窃取(Credential Theft via MCP Config)和命名空间冲突(Namespace Collisions,在多智能体系统中利用同名工具劫持调用)。
2. 计算机使用代理攻击(Computer-Use & Browser Agent Attacks):让 AI 直接控制用户计算机是一把双刃剑。视觉劫持(Visual Hijacking)通过精心设计的图像帧欺骗 AI 的屏幕理解能力;OCR 欺骗(OCR Spoofing)在屏幕上渲染虚假内容欺骗 AI 的 OCR 识别;像素对抗输入(Pixel Adversarial Inputs)在图像输入中加入对人眼不可见的对抗噪声操控多模态 AI 决策。
3. RAG 攻击分类(RAG Attack Taxonomy):检索增强生成(RAG)系统的每个环节都可能成为攻击入口:源投毒(Source Poisoning,向知识库注入虚假信息)、检索操控(Retrieval Manipulation,操纵检索结果排序)、引用欺骗(Citation Spoofing,让 AI 引用不存在或被篡改的来源)和上下文耗尽(Context Exhaustion,填满上下文窗口淹没相关信息)。
4. 语音与多模态攻击(Voice, Audio & Multimodal Attacks):音频中的隐写信息、图像中的对抗补丁、视频帧间的恶意指令等。
5. 微调与模型供应链安全(Fine-Tuning & Model Supply-Chain Security):在微调过程中注入后门、在预训练数据中植入隐蔽偏见、利用开源模型的供应链漏洞进行攻击。
6. AI 对 AI 红队测试(AI-on-AI Red Teaming):用 AI 系统来自动化红队测试流程——让一个 LLM 作为攻击者,另一个 LLM 作为目标,通过自动化的多轮对话发现漏洞。这种方法可以大幅降低人力成本,但需要警惕"聪明但错误"的攻击建议。
除了方法论,指南还提供了全面的工具链参考,分为开源和商业两大类:
| 类别 | 工具 | 特点 |
|---|---|---|
| 开源 | PyRIT(微软) | 企业级风险识别,支持多种攻击策略 |
| 开源 | Garak(NVIDIA) | LLM 漏洞扫描,40+ 漏洞类别 |
| 开源 | DeepEval(Confident AI) | 测试框架含 DeepTeam 红队模块 |
| 开源 | ART(IBM) | 对抗性鲁棒性工具箱 |
| 开源 | Giskard | AI 测试平台,支持偏见和性能检测 |
| 开源 | Gideon(Cogensec) | 自主防御安全助手 |
| 开源 | Redamon | 自动化红队框架(侦察→利用→分类→修复) |
| 商业 | Mindgard | 企业级 AI 安全平台 |
| 商业 | Lakera Guard | PII 泄露和注入攻击防护 |
| 商业 | Adversa AI | 对抗性测试即服务 |
| 商业 | Pillar Security | AI 安全态势管理 |
该项目不仅提供方法论,还附带了一套可直接用于实战的安全文档模板:
<类别>-<技术>-<ID>),为建立可积累的测试用例库奠定基础。作为一个诚实的分析,我们也需要指出该方法和项目的局限性:
测试覆盖率瓶颈。LLM 的行为空间是海量的——即使是最全面的测试套件也只能覆盖可能输入的冰山一角。微软的红队报告也承认,"基础方法往往比对抗性后缀更容易广泛传播"——说明测试工具的发展速度跟不上攻击创新的速度。
红队人员的技能门槛。有效的 AI 红队测试需要兼具安全知识和 AI 系统理解的复合型人才。目前这类人才极度稀缺,指南本身也承认"不能完全自动化"。
缺乏统一的评估标准。各机构对攻击成功率的定义不一,严重性评级标准各异,难以进行跨组织比较。
文档型项目的局限性。作为一份 Markdown 文档,AI Red Teaming Guide 提供了极其详尽的知识点,但它本身不包含可执行的代码或测试套件。读者需要自行选择和集成工具链,这增加了实际使用的门槛。
图2:Star 历史趋势图
从 Star 增长曲线来看,该项目在 2025-2026 年间呈现持续上升趋势。299 颗 Stars 配合 51 个 Forks,说明项目不仅受到关注,更被实际参考和使用。Forks 数量与 Stars 的比值约为 1:6,高于一般文档类项目,说明其模板在实际工作中有较高的复用价值。
该项目的行业意义在于:它将原本分散在学术论文、企业博客、OWASP 文档和工具 README 中的 AI 安全知识系统性地聚合在一起,形成了端到端的完整方法论。特别是在 2026 年 Agentic AI 爆发的大背景下,这类覆盖传统 LLM 安全到新兴 Agentic AI 攻击面的综合指南,对安全从业者和 AI 开发者都有重要的参考价值。
谁应该使用这个项目?
如何开始?
对于初学者,建议按以下路径学习:先通读第一部分的"为什么 AI 红队测试重要"建立认知基础,再深入研究第二部分的四阶段方法论,然后从工具链部分选择一个工具(如 PyRIT)进行实操,最后参考模板库为自己的项目建立红队文档。整个学习过程需要约 2-3 周的投入。
对于有经验的安全从业者,可以直接跳到 2026 年新增的 Agentic AI 攻击面部分,这部分内容反映了当前最前沿的威胁态势。同时可以参与 Cogensec 的全球红队网络,与其他从业者交流实战经验。
一句话总结:AI Red Teaming Guide 是目前最完整的 AI 系统对抗性测试知识库,覆盖从传统 LLM 安全到 Agentic AI 新兴攻击面的完整攻击面图谱,适合所有需要理解和评估 AI 系统安全性的技术和管理人员。
Star 历史: 299★ | Forks: 51 | 更新: 2026年6月 | 许可: MIT | 维护: requie / Cogensec