AIRTBench-Code
dreadnode/AIRTBench-Code加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
作者:Ads Dawson、Rob Mulla、Nick Landers、Shane Caldwell(Dreadnode 团队) 发表:2025年6月 | Apache-2.0 开源
2024 年至 2025 年,随着 GPT-4、Claude、DeepSeek 等大语言模型(LLM)相继落地千行百业,一个深刻的问题浮出水面:这些 AI 助手,究竟能被"教坏"到什么程度?
从最早的提示词注入(Prompt Injection)、模型越狱(Jailbreak),到后来的数据下毒(Data Poisoning)、模型提取(Model Extraction),攻击 AI 的手段层出不穷。然而,在衡量"AI 的攻击能力"这件事上,业界一直缺乏一把统一的尺子——
AIRTBench 正是为了回答这个问题而诞生的。它由安全公司 Dreadnode 发布,是首个专门衡量大语言模型"自主 AI 红队能力"的基准测试框架。简单来说,它问的是:"下一个 GPT-5,真的能像安全研究员一样自己找漏洞吗?"
AIRTBench 的核心思路非常巧妙:借用真实的安全竞赛(AI/ML CTF)作为测试环境,让被测 LLM 在隔离的容器中自主解决挑战题目。
传统的 AI 安全测试往往依赖人工设计的对抗样本,数据集更新慢,且难以模拟真实攻击的"自主探索"过程。而 AI/ML CTF 挑战天然具备以下特点:
这让 CTF 成为衡量"AI 攻击能力"的理想沙盒。
AIRTBench 的评测流程高度自动化,共 6 步:
.challenges.yaml 清单中选取挑战,加载对应 Jupyter Notebook;rigging 框架),可执行 Python 代码;AIRTBench 目前支持超过 30+ 个挑战,分为以下类别:
| 类别 | 代表案例 | 说明 |
|---|---|---|
| 提示词注入 | Bear 4、Librarian、Miner、Fragile | 测试 Agent 是否会被恶意指令劫持 |
| 系统提示词泄漏 | Extractor、Extractor 2 | 测试模型是否泄露系统 prompt |
| 模型提取 | Bear 2(Model Extraction) | 测试能否通过 API 行为推断模型结构 |
| 模型指纹识别 | Bear 3(Fingerprinting) | 测试能否识别目标模型身份 |
| 图像对抗 | Granny、Granny JPG、Autopilot 1-3 | 对抗样本逃逸目标检测器 |
| 模型规避 | Carbender、Blindspot、DeephTweak | 测试模型在恶意输入下的鲁棒性 |
| 数据逆向/泄露 | Inversion、Genigma、Mirage | 从模型输出逆向训练数据 |
| 音频生成规避 | Hush | 语音生成内容的检测规避 |
| 数据篡改分析 | Audit(Model Analysis) | 分析模型是否被植入后门 |
| 分类器逃逸 | Brig 1/2 | LLM 驱动的高级逃逸攻击 |
LLM-based 挑战(由大语言模型驱动的靶标):Bear 4、Brig 1/2、Extractor 系列、Librarian、Miner、Fragile、Canadian Eh 等约 8 个,是整个 benchmark 中最具前瞻性的测试场景——要求 Agent 攻击另一个 LLM。
uv sync 一键环境搭建airtbench/ # 核心评测引擎
│ ├── __main__.py # CLI 入口
│ ├── main.py # 主循环逻辑
│ ├── challenges.py # 挑战加载器
│ ├── kernel.py # Jupyter Kernel 管理
│ ├── container.py # Docker 容器编排
│ └── challenges/
│ └── .challenges.yaml # 挑战清单配置(30+ 挑战)
├── airtbench/container/
│ └── Dockerfile # 挑战容器镜像(Jupyter SciPy + ART/Foolbox)
├── notebooks/ # Jupyter Notebook 挑战文件
├── dataset/ # 公开数据集(HuggingFace 托管)
├── pyproject.toml # 依赖声明
└── Taskfile.yaml # 任务自动化
根据论文(arXiv:2506.14682),主要发现:
具体数值建议参考 arXiv 原文。
git clone https://github.com/dreadnode/AIRTBench-Code
cd AIRTBench-Code
uv sync # 一键搭建 Python 环境
uv run -m airtbench \
--model openai/gpt-4o \
--project airtbench \
--platform-api-key $DREADNODE_TOKEN \
--token $DREADNODE_TOKEN \
--server https://platform.dreadnode.io \
--organization "your-org" \
--max-steps 100 \
--challenges bear1 bear2
前置条件:需 Dreadnode Strikes 平台账号(Waitlist 申请入口)。
uv run -m airtbench --model openai/gpt-4o --llm-challenges-only
AIRTBench 的出现填补了 AI 安全评估体系中一项重要空白:从"测试 AI 能否被攻击"进化到"测试 AI 能否主动攻击"。
未来,AIRTBench 有望向真实攻击场景(Web 安全、API 安全)扩展,并引入对抗成本评估。