OpenART
专注 AI Agent 红队安全评测,提供 10K+ 对抗场景验证 Agent 在长时间任务中的攻击防御能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
专注 AI Agent 红队安全评测,提供 10K+ 对抗场景验证 Agent 在长时间任务中的攻击防御能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你给 AI Agent 下达了一个看似无害的任务——"帮我整理一下这个月的财务报销单"。Agent 勤勤恳恳地调用邮件工具读取附件、调用表格工具汇总数据、调用支付工具完成转账——一切看起来都很正常。
但如果这个 Agent 运行在开放的网络环境中,某个第三方工具在它的执行流程中悄悄埋入了一条恶意指令,让它在第 47 步操作时悄悄把报销款项转到了另一个账户呢?
更可怕的是,这条恶意指令可能藏在工具返回的数据里,而不是提示词中——传统的安全扫描根本发现不了。
这就是 OpenART(Open-source Agent Red Teaming)试图回答的核心问题:当 AI Agent 在长时间、状态不断演化的复杂环境中运行时,它到底有多安全?
OpenART 由 AI45Lab 团队开发,核心作者包括 Yunhao Chen、Xin Wang、Yi Liu 等,发表了论文《Scaling Agent Red Teaming via Open-Ended Environment Evolution》(arXiv:2608.00677),在 Hugging Face Papers 平台登顶 #2 Paper of the Day。
该项目是同一团队此前工作 OpenRT(多模态 LLM 红队框架)的"Agent 版"升级。相比 OpenRT 聚焦于单轮提示词攻击,OpenART 专门针对"具有工具调用能力的代码 Agent"——这类 Agent 的攻击面要大得多:工具滥用、状态污染、权限提升、间接注入……
传统 Agent 安全测试往往把"一条提示词"当作全部测试单元,但 OpenART 认为这是不够的。
OpenART 的核心设计哲学是:测试"可执行环境",而非"单条提示词"。 关键机制包括:
评估结果令人警醒:针对 15 个主流 Agent × 5 个基础模型的 75 种组合配置,聚类严格攻击成功率高达 85.0%。这意味着在复杂任务场景下,大多数 Agent 都有相当高的概率被成功攻击。
| 指标 | 数值 |
|---|---|
| 验证场景数 | 10,000+ |
| 覆盖领域 | 50 个 |
| 能力语料库 | 500K+ 工具与技能 |
| 中位任务长度 | 97 次工具调用 |
| 评估矩阵 | 15 Agent × 5 模型 |
| 聚类攻击成功率 | 85.0% |
| 参考攻击算法 | EMHA(进化马尔可夫超图攻击) |
OpenART 提供了完整的 Docker 化评测环境,核心使用流程如下:
第一步:构建基础镜像
git clone https://github.com/AI45Lab/OpenART
cd OpenART
python3 -m venv .venv && source .venv/bin/activate
pip install -r requirements.txt
export PYTHONPATH="$PWD"
docker build -t openart/task-base:latest -f images/Dockerfile.task-base .
第二步:运行本地冒烟测试(无需模型凭证)
python -m framework.cli run \
--task examples/tasks/local-smoke \
--target-config configs/target-configs/target.local-smoke.yaml \
--eval-strategy deterministic \
--skip-attacker \
--run-id local-smoke
第三步:接入模型进行真实评测
docker build -t openart/opencode:latest -f images/Dockerfile.opencode .
cp .env.example .env
# 编辑 .env 填入模型 API 凭证
python -m framework.cli run \
--task examples/tasks/high-complexity-kb-integration \
--target-config configs/target-configs/target.yaml \
--tool-store ../openart-tools \
--eval-strategy deterministic \
--skip-attacker
OpenART 支持 Aider、Claude Code、Codex、Copilot、DeepSeek-TUI、Goose、Gemini、Kilo、OpenClaw、Qwen Code 等 15+ 种主流 Coding Agent,覆盖范围极广。
OpenART 配套发布了 openart-tools 数据集,包含从 500K+ 工具语料库中精选的 63,697 个已实例化工具,覆盖 Atlassian Jira、BigQuery、Gmail、Google Docs、Slack、Snowflake、PayPal 等主流 SaaS 平台,以及 Freshdesk 插件、Datadog API、HubSpot 集成等企业工具。
这些工具经过格式化,可直接用于构建真实的攻击测试场景,模拟 Agent 在真实企业环境中的行为。
1. 部署门槛仍然较高 虽然 OpenART 提供了 Docker 镜像,但本地安装需要:Python venv + pip + Docker 构建 + 模型凭证配置。对于没有 DevOps 经验的研究者,初始上手仍有一定难度。没有 Web UI,全部通过 CLI 操作。
2. 无 docker-compose 一键启动
无法通过 docker-compose up 直接运行完整评测环境,需要分别构建多个镜像,流程碎片化。
3. 攻击成功率"过高"的问题 85.0% 的攻击成功率固然说明了问题的严重性,但也意味着当前大多数 Agent 在复杂场景下几乎"不堪一击"。这个数字可能让部分用户对 Agent 技术产生过度悲观的判断,需要结合具体场景理解。
4. 研究导向,非生产安全工具 OpenART 主要面向 AI 安全研究者,用于基准测试和学术研究,不适合直接作为生产环境的安全监控工具。
OpenART 最重要的贡献不是"证明 Agent 不安全",而是系统性地揭示了 Agent 安全与传统 LLM 安全的本质差异:
在 2026 年 EU AI Act 合规要求、OWASP Top 10 for Agentic Applications 框架逐渐落地的背景下,OpenART 为安全研究者和 AI 开发者提供了一套严谨、可复现的评测方法论。
项目信息
⭐ 113 Stars | 🔤 Python | 📄 AGPL-3.0
🧪 10,000+ 测试场景 | 🌐 50 个领域 | 🔧 63,697 个工具
📄 arXiv 论文 | 🤗 HuggingFace 数据集