HackSynth
首个基于 LLM Agent 的 CTF 自动化渗透测试框架,配有 OverTheWire 和 PicoCTF 标准评测基准
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个基于 LLM Agent 的 CTF 自动化渗透测试框架,配有 OverTheWire 和 PicoCTF 标准评测基准
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:深夜,一个红队安全研究员正在 CTF(Capture The Flag,夺旗赛)赛场上与时间赛跑。传统做法是手动翻阅 Writeup、逐条尝试命令——既费时又烧脑。但现在,有一个 AI Agent 能 24 小时不眠不休,自动分析题目、执行渗透命令、提取 Flag。这就是 HackSynth 试图解决的核心问题。
HackSynth 由匈牙利 Eötvös Loránd 大学(ELTE)研究团队开发(arXiv:2412.01778),是一个基于大语言模型(LLM)的自主渗透测试 Agent,同时也是一套标准化的评估框架。其核心贡献在于:首次系统性地提出用 LLM Agent 自动化完成 CTF 挑战,并构建了可复现的评测基准。
项目的三位作者 Lajos Muzsai、David Imolai、András Lukács 分别来自安全研究和机器学习领域,这种跨学科背景让 HackSynth 在技术实现上兼具安全工具链的严谨性和 AI Agent 的灵活性。项目在 GitHub 上获得了 300+ Stars,并附有完整学术论文支撑。
HackSynth 采用双模块协同架构,这是一个刻意为之的设计选择——将渗透测试的"思考"与"执行"解耦:
规划器接收当前任务上下文(题目描述、历史命令和执行结果),调用 LLM 生成下一条 Linux 命令。关键实现细节:
transformers.AutoModelForCausalLM 加载)和 OpenAI GPT 系列(gpt-4、o1 等)torch.bfloat16 精度、device_map="auto" 自动分配到 GPU<CMD>...</CMD> XML 标签中,便于精确提取shlex.quote() 对命令进行安全转义,防止注入攻击Planner 的核心逻辑通过正则匹配从 LLM 输出中提取命令,然后在 Docker 容器中执行,结果反馈给 Summarizer 进入下一轮循环。
渗透测试是一个长序列任务,LLM 的上下文窗口有限。总结器的职责是将历史命令输出压缩为摘要,精简后馈送给下一个 Planner 轮次。这个设计灵感来自 ReAct(Reason + Act)模式,但针对安全场景做了定制——总结器不仅压缩文本,还会保留关键的技术发现(如目录结构、敏感文件路径、漏洞提示)。
所有命令在 Docker Kali Linux 容器(kalilinux/kali-rolling)中执行,这带来了几个重要特性:
NET_ADMIN 和 SYS_PTRACE 能力,支持网络嗅探和进程调试kali-linux-headless、sshpass、curl 等工具HackSynth 的另一大贡献是构建了标准化的 CTF 评测基准,覆盖两个主流靶场平台:
OverTheWire:包含 Bandit(Linux 基础安全)、Leviathan(CTF 入门)、Krypton(密码学挑战)、Natas(Web 安全挑战)四个系列,每个系列有数十道题目,难度从基础到进阶循序渐进。
PicoCTF:涵盖逆向工程、Web 安全、密码学、数字取证等多个方向,共约 50 道挑战,难度梯度完整。
每个挑战以 JSON 格式存储,包含目标地址(SSH/Web URL)、Flag 格式、描述信息和文件下载链接。基准测试结果通过 Neptune.ai 平台追踪,记录每个 Planner/Summarizer 调用的输入/输出 token 数量、耗时和中间状态,方便不同模型配置横向对比。
HackSynth 的 Python 依赖非常丰富,揭示了其技术深度:
transformers(本地推理)、openai(GPT 调用)、accelerate(分布式推理)值得注意的是,docker 包出现在 requirements.txt 中——HackSynth 通过 Python Docker SDK 动态创建和管理 Kali 容器,而不是依赖外部 docker CLI。
HackSynth 不支持一键部署,部署难度评定为"较难",主要障碍在于:
好消息是,docker_setup.py 脚本已经封装了 Kali 容器创建和工具安装的大部分工作。如果拥有足够 GPU 资源 + 稳定网络,整个环境搭建可在 2-4 小时内完成。
客观来看,HackSynth 目前存在几个局限:
HackSynth 的出现是 2024 年 AI + Security 融合趋势的一个缩影。随着 GPT-4、Claude 等 LLM 的代码和推理能力大幅提升,研究者开始探索用 AI 自动化解决安全问题。HackSynth 的价值不仅在于 Agent 本身,更在于它提供的可复现评测框架——让不同 LLM 在同一套挑战集上竞技,为"AI 黑客"能力建立量化标准。
作者还透露了一个后续项目 HackSynth-GRPO,引入强化学习(GRPO)来训练 Agent 解决密码学 CTF 挑战,方向值得关注。
一句话总结:HackSynth 是目前最具系统性的 LLM 渗透测试评估框架,适合安全研究员和 AI Agent 研究者作为基准工具使用,但普通用户部署门槛较高,不适合追求"开箱即用"的场景。
分析时间:2026-07-01 | 数据来源:GitHub API + 项目 README + arXiv 论文 | Stars: 309 | Forks: 51