LLMSecurityGuide
AI大模型安全百科全书:OWASP LLM/ASI双标准、红队工具、真实CVE案例与合规指南的全面覆
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI大模型安全百科全书:OWASP LLM/ASI双标准、红队工具、真实CVE案例与合规指南的全面覆
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2026年2月,随着 GPT-5.x、Claude Opus 4.6、Gemini 3.x 等大模型全面融入企业工作流,一个严峻的问题浮出水面:AI 系统正在成为黑客的新目标。Prompt 注入导致机密泄露、越狱攻击让模型执行恶意指令、RAG 检索被投毒……这些不再是理论风险,而是真实发生的安全事件。
LLM Security Guide 正是为解决这一痛点而生——它不是某篇论文的摘要,而是一部持续更新的 AI 安全百科全书,涵盖 OWASP Top 10 for LLMs 2025、OWASP Top 10 for Agentic AI 2026(ASI 系列)、20+ 红队工具、防御框架、合规指南,以及真实 CVE 案例研究。这份 80,000 字的项目已成为 AI 安全领域被引用最多的开源知识库之一。
大模型与传统软件有本质区别:传统软件的输出是确定性的,而 LLM 的输出具有概率性——同一个 Prompt 每次可能给出不同回答。这种不确定性带来了全新的攻击面:
Prompt 注入(OWASP LLM01)是最经典的攻击向量。攻击者通过在输入中植入恶意指令,让模型忽略原始系统提示,转而执行攻击者指定的操作。2024年,某金融公司的 AI 助手因 Prompt 注入泄露了用户余额查询接口,攻击者利用这一漏洞批量获取了客户信息。
系统提示泄漏(LLM07)是另一个高频风险。当模型通过错误消息或对话历史将系统提示暴露给用户时,攻击者可以了解系统的安全规则,从而精准设计绕过方案。更危险的是在 RAG 系统中——如果检索到的文档包含攻击者预先植入的恶意内容,就形成了向量/嵌入投毒(LLM08),直接污染 AI 的"知识来源"。
2026年,随着 AI Agent(自主代理)兴起,安全问题进一步放大。当 Agent 可以调用工具、执行代码、读写文件系统时,一次成功的攻击可能直接转化为服务器权限的夺取。OWASP 为此专门发布了 ASI(Agentic Security Issue)Top 10 2026,将 Agentic AI 安全提升到与 LLM 安全并列的独立高度。
| # | 漏洞类型 | 风险等级 | 核心威胁 |
|---|---|---|---|
| LLM01 | Prompt Injection | 🔴 严重 | 通过恶意输入操控模型行为 |
| LLM02 | Sensitive Information Disclosure | 🔴 严重 | 泄露 PII、凭据、隐私数据 |
| LLM03 | Supply Chain | 🔴 严重 | 污染模型、数据集、依赖项 |
| LLM04 | Data & Model Poisoning | 🔴 严重 | 恶意训练数据植入后门 |
| LLM05 | Improper Output Handling | 🟠 高危 | 未充分验证模型输出 |
| LLM06 | Excessive Agency | 🟠 高危 | Agent 权限过大导致滥用 |
| LLM07 | System Prompt Leakage | 🟠 高危 | 系统提示意外暴露 |
| LLM08 | Vector & Embedding Weaknesses | 🟠 高危 | RAG 检索被投毒或误导 |
| LLM09 | Misinformation | 🟡 中危 | 幻觉导致错误信息传播 |
| LLM10 | Unbounded Consumption | 🟡 中危 | 资源耗尽攻击与成本暴涨 |
随着 Agentic AI 系统(AutoGPT、BabyAGI、CrewAI 等)大规模落地,OWASP 于 2025年12月发布了 ASI 系列标准:
| # | ASI 类型 | 风险等级 | 新增维度 |
|---|---|---|---|
| ASI01 | Agent Goal Hijack | 🔴 严重 | 目标劫持(LLM06 扩展) |
| ASI02 | Tool Misuse & Exploitation | 🔴 严重 | 工具链攻击(新增) |
| ASI03 | Identity & Privilege Abuse | 🟠 高危 | 非人类身份滥用(新增) |
| ASI04 | Agentic Supply Chain | 🟠 高危 | MCP 服务器、Agent 插件供应链 |
| ASI05 | Unexpected Code Execution | 🟠 高危 | 代码生成执行风险 |
| ASI06 | Memory & Context Poisoning | 🟠 高危 | Agent 记忆被持久化污染 |
| ASI07 | Insecure Inter-Agent | 🟡 中危 | 多 Agent 通信窃听与篡改 |
| ASI08 | Cascading Failures | 🟡 中危 | 错误在管道中逐级放大 |
| ASI09 | Human-Agent Trust Exploitation | 🟡 中危 | 用户过度依赖 AI 导致失误 |
| ASI10 | Rogue Agents | 🔴 严重 | 恶意 Agent 伪装潜入系统 |
| 工具 | 类型 | 用途 |
|---|---|---|
| Garak | 检测 | 自动扫描 LLM 漏洞(黄毒、幻觉、Prompt 注入) |
| RedTeam-CC | 框架 | 结构化 LLM 攻击框架,含越狱词库 |
| AutoDAN | 对抗 | 自动生成对抗性 Prompt 绕过安全过滤 |
| DeepTeam | Agent | 多 Agent 红队自动化框架(2025新品) |
| Promptfoo | 评估 | Prompt 质量与安全基准测试 |
| ARTKIT | 分析 | Agentic AI 安全分析工具(2025新品) |
| LlamaFirewall/Llama Guard 4 | 防护 | Meta 开源的输入/输出安全过滤器 |
输入层防护:在用户输入进入 LLM 前,进行 Prompt 注入检测、敏感信息过滤、格式校验。Llama Guard 4(Meta 开源)提供了业界领先的 12 分类安全检测模型。
输出层防护:LLM 输出需要经过内容过滤、事实核查(尤其是 RAG 场景)、格式验证。关键原则是"永远不要盲目信任模型输出"——LLM09 Misinformation 提醒我们,幻觉不是 bug,而是概率模型的固有特性。
权限控制:ASI06 "Excessive Agency" 强调,Agent 的权限应该是最小化的——只授予完成任务必需的最小工具集,并在关键操作前要求人工确认。
记忆隔离:Agent 的长期记忆(RAG 知识库、历史会话)需要定期审计,防止 ASI06 Memory Poisoning——攻击者通过长期对话逐步植入恶意上下文,最终劫持 Agent 行为。
Retrieval-Augmented Generation(RAG)已成为企业 LLM 应用的标配架构,但这套架构引入了独特的攻击面:
向量投毒:攻击者向知识库注入精心构造的文档,使其在特定 Query 时被优先检索,从而向用户传递错误或恶意信息。由于向量相似度计算的黑盒特性,这种攻击极难被传统安全工具检测。
检索操控:通过分析 RAG 系统的检索行为,攻击者可以逆向推断知识库内容——这在法律文档、医疗记录等敏感场景中尤为危险。
上下文注入:在多轮对话中,攻击者利用对话历史或用户输入,在检索到的文档片段中植入恶意指令,让模型"不知不觉"地执行攻击者意图。
指南中推荐了针对 RAG 场景的安全评估框架,包括对向量距离阈值的监控、检索结果多样性的审计、以及知识库变更的完整性校验。
指南收录了多个 2024-2026 年的真实安全事件:
EchoLeak(CVE-2025-32711):某主流 LLM API 提供商因输出处理不当(LLM05 Improper Output Handling),在特定 Prompt 模式下泄露了其他用户的对话历史片段,波及数千企业用户。
DeepSeek R1 漏洞:2026年初,安全研究团队发现 DeepSeek R1 在处理特定语言模型特有攻击("Attributable-to-Backslash")时存在 Prompt 注入绕过,该漏洞后被编号披露。
首个恶意 MCP 服务器:ASI04 Agentic Supply Chain 的里程碑案例——攻击者在 MCP(Model Context Protocol)生态中发布了恶意 MCP 服务器,伪装成常用工具插件,成功渗透多个 AI Agent 项目。
这些案例说明:AI 安全不是"未来问题",而是正在发生的现实威胁。
指南还覆盖了主要 AI 监管框架:
EU AI Act 2026:欧盟《人工智能法案》2026年进入全面实施阶段,对高风险 AI 系统(医疗诊断、金融风控、招聘筛选等)提出强制性合规要求,违规罚款最高达全球营收的 6%。
NIST AI RMF:美国国家标准与技术研究院的 AI 风险管理框架,为企业提供了风险识别、评估、响应的标准方法论。
ISO/IEC 42001:全球首个 AI 管理系统国际标准,提供了 AI 质量与安全管理体系的认证框架。
对于使用 LLM 的企业而言,了解这些监管要求不仅是合规需要,更是产品竞争力的一部分——"AI 安全认证"正在成为 B2B AI 产品的准入门槛。
适用人群:AI 安全研究员、红队工程师、ML 工程师、企业安全团队、AI 产品经理,以及任何关心 LLM 部署安全的从业者。
使用方式:
技术门槛:基础(掌握基本 AI 概念即可),无需深度学习背景,但需要了解 LLM 基本工作原理(如 Token、Prompt、System Prompt 等概念)。
尽管这份指南覆盖极为全面,仍有一些局限值得指出:
缺乏代码级修复方案:指南侧重于漏洞识别和防御思路,但具体的代码修复示例较少。对于想立即动手修复的工程师来说,需要额外查阅其他资源。
Agentic AI 安全尚在成熟期:ASI Top 10 2026 是 2025年12月才发布的较新标准,部分漏洞的检测方法和缓解策略仍在快速迭代中,读者需要关注更新。
工具生态变化快:红队工具每月都有新版本,指南中的工具截图和版本号可能与最新版本有出入。
中文资料匮乏:指南目前以英文为主,对中文读者有一定语言门槛。
LLM Security Guide 项目自发布以来获得了持续关注,GitHub Stars 增长曲线反映了 AI 安全领域的热度变化:
这背后是整个 AI 安全市场的爆发:Gartner 预测,到 2027 年全球 30% 的企业 AI 项目将因安全顾虑而受到监管审查,AI 安全工具市场规模将从 2024 年的 28 亿美元增长至 2028 年的 92 亿美元。
LLM Security Guide 的价值在于:它将碎片化的 AI 安全知识整合为体系化的参考框架,让安全从业者不必从零开始构建知识体系。无论是防御者还是进攻者,这部指南都是当前最权威的开源 AI 安全参考资料之一。
📌 项目信息