T3MP3ST
将 AI 编程助手武装成零日猎人——多智能体进攻性安全框架,keyless 运行,XBOW 基准 9
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将 AI 编程助手武装成零日猎人——多智能体进攻性安全框架,keyless 运行,XBOW 基准 9
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你日常使用的 AI 编程助手(Claude Code、Codex、甚至是本地运行的 Ollama),突然具备了自动化漏洞挖掘能力——不需要额外的 API key,不需要云端服务,不需要第二张账单。它能够自主完成侦察、漏洞利用、报告生成的全链路攻击。
这正是 T3MP3ST(发音 "Templest",取自拉丁语 tempestas,意为"风暴")所做的事情——一个多智能体进攻性安全框架,将你已有的 AI 编码代理武装成一个零日猎人。

进攻性安全(Offensive Security)长期被昂贵的商业工具和专业经验所垄断。T3MP3ST 的赌注是:通过协调式多智能体 swarm,让从未获得邀请的人也能真正参与漏洞挖掘——覆盖 Web 应用、CTF 夺旗比赛、智能合约、源代码审计、嵌入式系统等场景。
作者 elder-plinius(自述"热爱普林尼")在 AGPL-3.0 开源协议下开发了此项目,其核心理念写在该项目的每个 commit 里:"No trust-me numbers, ever"(永远不要相信任何数字)。项目内置 npm run verify-claims 命令,任何人都可以重新运行基准测试,从已提交的原始数据中验证每一项声明。
T3MP3ST 不是一个单一的 AI 工具,而是一个模块化的 TypeScript 单体,其架构遵循"端口/适配器"模式,将不同的功能解耦为清晰的层次。
系统内部由 8 个"操作员"(Operator)角色组成攻击链,映射到 MITRE ATT&CK 框架和 Cyber Kill Chain 阶段:
| 操作员 | 阶段 | MITRE ATT&CK | 职责 |
|---|---|---|---|
| Recon | 侦察 | TA0043 | OSINT、网络发现、资产枚举 |
| Scanner | 发现 | TA0007 | 漏洞扫描、服务指纹识别 |
| Exploiter | 初始访问 | TA0001 | 漏洞利用、载荷投递 |
| Infiltrator | 横向移动 | TA0008 | 权限提升、持久化 |
| Exfiltrator | 数据收集/外泄 | TA0009/10 | 凭据窃取、数据提取 |
| Ghost | 持久化 | TA0003 | 隐匿、清理 |
| Coordinator | 命令控制 | TA0011 | 任务编排、流程控制 |
| Analyst | 分析 | — | 模式分析、报告生成 |
这些操作员并非独立的 AI 模型,而是框架内的职责角色——它们共享同一个 LLM 后端(OpenRouter、Venice、Anthropic、OpenAI 或本地 Claude Code/Codex/Hermes),通过结构化的 ReAct 循环协同工作。
T3MP3ST 与传统渗透测试工具或 AI 安全代理的根本区别在于三点:
1. 可复现性(Reproducible)
项目 README 中的每一项数据都来自 bench/ 目录下 committed 的 JSON 文件,运行 npm run verify-claims 可以重新计算所有数据。27/27 项声明全部绿标通过。这意味着社区可以独立验证任何基准数字,而不是被动接受官方宣传。
2. 无 Key 化(Keyless) 最激进的特性:你不需要任何 API key。系统可以直接连接本地运行的 Claude Code、Codex 或 Hermes 智能体作为推理后端。没有 OpenRouter,没有 Anthropic,没有第二张账单——你的开发机器就是整套系统的"大脑"。
3. 范围诚实(Scope Honest) README 中有一张详细的"status table",明确标注每个功能域是 ✅ 稳定、⚠️ 实验中还是 🚧 路线图。这不是营销话术——benchmark 文档和基准代码完全公开,任何人都可以复核。
T3MP3ST 目前已在以下领域验证了实战能力:
✅ Web 应用(核心能力) 在 XBOW 官方提供的 104 个黑盒挑战套件中,T3MP3ST 取得了 90.1% pass@1 的成绩(Wilson-95 置信区间 86.2%-92.9%),高于 XBOW 自身报告的 85%。白盒模式下更达到 98.7%、最佳成绩 104/104。
✅ CTF 夺旗比赛 在 Cybench 40 题学术基准测试集上,Claude Opus 4.8 在零提示条件下单次运行取得 23/40(58%)。注意这里的分数是严格 against committed oracle 的真实验证结果,不是模型厂商自报的 raw record。
✅ 源代码审计(实战成果) 在 CVE-Zero 数据集(10 个真实 2026 年 post-cutoff CVE,涵盖 7 种语言)上,单智能体取得了 8/10 精确文件+行号+CWE 定位、10/10 发现率的成绩。这一结果经过 memorize/fitting 防护验证——这些 CVE 是模型训练数据截止日期之后发布的,hardened prompt 并未针对其调优。
⚠️ 智能合约(复现模式) 针对 Damn Vulnerable DeFi 挑战集,T3MP3ST 目前能够复现已知漏洞类型,但尚未独立发现新漏洞。
🚧 云计算/移动/二进制(开发中) IaC 错误配置检测(cloud:bench)、移动端静态分析(mobile:bench)、二进制 RE 静态 sink 检测(binary:bench)等模块均已在 scaffold 阶段,但尚未完成基准测试验证。
武器库(Arsenal)
内置超过 35 个安全工具适配器,涵盖:nmap/DNS/HTTP 侦察引擎、tree-sitter 多语言源码解析、WebTreeSitter(Python/JS/TS/Go/Java/C/C++)、ghidra/radare2 反编译集成、CVE-OSV 漏洞数据库查询等。支持通过 MCP(Model Context Protocol)协议暴露 security_recon 能力给 MCP 感知型 AI 智能体。
多种接入方式
npm install && npm run server 启动本地 Web UI(http://127.0.0.1:3333/ui/),连接 Claude Code/Codex/Hermes 后用自然语言下达作战指令docker compose up 在容器中启动 API 服务器(仅绑定 localhost)npm run build && npx tempest 进入交互式命令行模式POST /api/mission/start 启动任务,支持自动化脚本集成node dist/mcp-server.js 暴露安全侦察 MCP 工具依赖项
对于 AI 爱好者而言,T3MP3ST 提供了零门槛的 War Room 体验——安装后浏览器打开,连接一个本地 AI 智能体,用自然语言描述目标,就能看到 AI 在你的授权目标上执行自动化侦察。
对于安全研究人员,T3MP3ST 是一个高度可定制的框架。scripts/ 目录下提供了大量基准测试脚本(cybench-bench.mjs、cve-hunt-bench.mjs、cloud-misconfig-bench.mjs 等),可以直接用来评估不同模型在不同安全任务上的表现,或集成到自己的 CI/CD 流程中。
对于 AI 开发者,T3MP3ST 的架构(特别是"操作员角色+共享 LLM 后端"的设计)是研究多智能体协作安全任务的优秀参考实现。其 TypeScript/Node.js 实现易于理解和修改。
注意:T3MP3ST 是一个进攻性安全工具,仅限授权目标使用。AGPL-3.0 协议明确声明作者不对未经授权的使用承担任何责任。
1. 仅支持授权目标——这既是安全约束也是法律约束,在使用时必须严格遵守规则。
2. 基准测试≠实战能力:README 特别强调,这些数字来自单智能体 ReAct 循环,不是 8 操作员 swarm 的整体协调效果。实际 swarm 的协同能力尚未在 benchmark 中验证。
3. 复杂目标仍有局限:在 Cybench 等学术基准集上,AI 模型仍然会因缺少上下文理解、工具调用精度等问题而失败。对于真实世界的高度复杂目标(如需要多层社会工程或物理访问),当前框架能力有限。
4. DeFi 只能复现不能发现:对于智能合约领域的漏洞挖掘,T3MP3ST 目前只能复现已知漏洞模式,尚无法独立发现新漏洞。
5. 评估数据的可信度:项目声称"anti-fitting guard"防止模型在基准测试中作弊,但这个防护机制本身的可靠性尚未有独立第三方审计。
T3MP3ST 代表了一种重要趋势:AI 原生安全工具的崛起。传统渗透测试工具(如 Metasploit、Burp Suite)由人类操作员驱动;而 T3MP3ST 将 AI 智能体作为执行主体,实现了部分自动化决策和执行。
其"可验证声明"(verifiable claims)的设计哲学值得整个 AI 安全社区借鉴——当每个基准数字都可以被独立验证时,行业的数据可信度将大幅提升,而不是陷入"谁报告的数字高谁厉害"的军备竞赛。
对于拥有 Claude Code/Codex/Hermes 的开发者来说,T3MP3ST 提供了一个零成本的安全研究起点,无需注册任何付费账号即可开始探索 AI 安全测试的边界。
项目信息

作者头像:Pliny 风格
分析时间:2026-07-28 | 数据来源:GitHub API + README.md + 架构文档