ADR
Uber 开源的企业级 AI 代理安全系统,含威胁检测、基准测试和可观测性三大模块,MLSys 2026 接收
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Uber 开源的企业级 AI 代理安全系统,含威胁检测、基准测试和可观测性三大模块,MLSys 2026 接收
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025 年,Cursor、Claude Code、Codex 等 AI 编码工具正在全球科技公司大行其道——开发者用自然语言指挥 AI 写代码、查文档、甚至代替自己与内部系统交互。但鲜为人知的是,这些"聪明"的代理(Agent)同样可以成为攻击者的利器:Prompt 注入、数据泄露、权限滥用……当企业员工在日常工作中频繁使用 AI 代理处理邮件、文档和内部系统时,一条全新的攻击面正在悄然成形。
Uber 就是最早感受到这种焦虑的公司之一。随着内部 AI 编码工具的普及,安全团队意识到:传统的安全监控手段对 AI 代理的行为完全"看不见"——传统安全工具不知道代理在干什么,不知道它调了哪些工具,也不知道它的决策是否偏离了安全边界。
于是,ADR(Agentic AI Detection and Response) 诞生了。
2026 年,ADR 的学术论文被 MLsys 2026 接收,正式从企业内部工具走向开源社区。
ADR 不仅仅是一个检测工具,而是一套完整的企业级 AI 代理安全体系,包含四个互补的能力模块:
Sensor 是整个系统的"眼睛"。 它是一个 Python 库,安装在开发者工作站上,负责从 AI 编码代理(Claude Code、Cursor、Codex 等)实时收集遥测数据——包括代理的意图声明、工具调用行为、执行轨迹等。
Sensor 的核心价值在于统一化:不同 AI 代理的日志格式、数据结构差异巨大,Sensor 将这些碎片化的数据标准化为统一的结构化格式,输送到后端进行分析。Sensor 支持 macOS、Linux、Windows 三大平台,同时也能对接企业内部自动化系统和客服代理。
从代码结构看,Sensor 以 adr_sensor 包为核心,提供了清晰的接口层和示例代码,测试覆盖也比较完善。
如果 Sensor 是眼睛,Benchmark 就是标尺。
ADR-Bench 是目前最全面的 AI 代理安全基准测试集,包含:
MCP 是 Anthropic 主导的 AI 代理上下文协议,当前已经有 133 个主流服务支持 MCP。ADR-Bench 对这些服务器进行了系统化的安全测试,堪称 AI 代理安全领域的 "ImageNet"。
基准测试需要配置 Anthropic API Key 和 OpenAI API Key,并通过 uv sync 安装依赖后执行 main_benchmark.py。
Detection 是 ADR 的"大脑"——双代理检测架构。
ADR 采用了两层检测架构:
这种"粗筛 + 精判"的二层架构在保证检测覆盖率的同时控制了计算成本——毕竟对每条代理日志都调用昂贵的 LLM 进行深度推理是不现实的。
检测配置通过 config_detector.yaml 管理,支持多种检测器(默认 adr 即双代理检测器,也支持 llamafirewall 等基线检测器用于 smoke test)。代码使用 Pydantic 进行数据建模,体现了良好的工程实践。
预防模块当前未开源——ADR 团队预告"Stay tuned",这意味着能够主动阻断不安全行为的主动防御机制尚在开发中。
[AI Coding Agent] ──→ [ADR Sensor] ──→ [遥测数据流]
│
┌──────────────────────┴──────────────────────┐
↓ ↓
[ADR Detection] [ADR-Bench]
双代理威胁检测器 基准测试 + MCP服务器
│ │
└──────────────────┬───────────────────────────┘
↓
[安全运营平台 / SIEM]
从代码结构看,项目分为两大子包:
Sensor/:纯 Python 包,通过 pyproject.toml 定义依赖,支持 uv 和标准 pip 安装Detection/:基准测试框架,同样使用 uv 管理依赖,main_benchmark.py 和 main_detector.py 是核心入口项目整体使用 Python 3.10-3.12,依赖 Pydantic 进行数据验证和建模,YAML 文件管理配置,无 Web UI,属于纯后端/研究型工具。
部署难度:较难。 主要障碍有三:
uv 作为包管理器,对于不熟悉 uv 的用户有一定学习成本上手路径(参考 docs/REPRODUCIBILITY.md):
git clone https://github.com/uber/ADR
cd ADR/Detection
uv sync
export ANTHROPIC_API_KEY="***" OPENAI_API_KEY="***"
# 运行基准测试
python main_benchmark.py --task_ids 1-50 --detector adr
值得注意的是,项目提供了 llamafirewall 检测器作为"keyless smoke test"选项,无需 API Key 即可运行基础测试,这对快速验证安装很有帮助。
ADR 并不是银弹,其局限性值得坦诚讨论:
Prevention 缺失:Detection 再精准,如果不能主动阻断,攻击仍然会发生。现阶段 ADR 只能"看见"和"告警",无法"行动"
Sensor 的隐私代价:Sensor 运行在开发者终端上,实时收集所有代理行为数据——这本身就带来了隐私争议。企业员工是否知道自己被监控?Sensor 数据如何防止被滥用?
覆盖范围有限:目前主要覆盖 AI 编码工具,对其他类型的 AI 代理(如客服代理、办公代理)的支持尚在发展中
基准测试的时效性:AI 代理的攻击技术在快速演进,133 个 MCP 服务器和 17 种攻击技术的覆盖是否能跟上现实威胁的演化速度,是一个持续挑战
ADR 的开源发布有两个层面的意义:
对 AI 安全研究社区:ADR-Bench 提供了首个系统化的 AI 代理安全基准,133 个 MCP 服务器的覆盖是目前最全面的。这让安全研究者可以在标准化环境下评估不同检测方案的效果,而不是各自为战。
对企业安全团队:Uber 将内部已验证的安全方案开源,意味着其他企业不必从零开始构建 AI 代理安全能力。ADR 提供了从可观测性到威胁检测的完整思路参考。
从增长曲线看,AI 代理安全正在成为 2025-2026 年最热门的网络安全细分领域之一——随着 MCP 协议的普及和 AI 代理在企业中的深度渗透,"看不见的代理行为"带来的安全盲区将越来越不可接受。ADR 代表了一种趋势:不是等出了问题再补救,而是从一开始就在代理层面建立可观测性和防御机制。
对于关注 AI 安全的开发者,ADR 是一个值得深入研究的开源项目——它既是一个生产级系统,也是一个学术研究框架。对于关注企业落地的开发者,Sensor 模块相对独立,可以作为在团队内部引入 AI 代理可观测性的切入点。