jailbreak_llms
首个大规模野外越狱Prompt数据集,15,140条真实案例含1,405条越狱样本,CCS 2024
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个大规模野外越狱Prompt数据集,15,140条真实案例含1,405条越狱样本,CCS 2024
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
pythonfrom datasets import load_datasetdataset = load_dataset('TrustAIRLab/in-the-wild-jailbreak-prompts', 'jailbreak_2023_05_07', split='train')这个项目还提供了一个配套的 390 题禁区问题集(TrustAIRLab/forbidden_question_set),问题覆盖了 OpenAI 使用政策中定义的 13 种禁区场景,供研究者测试不同 LLM 对越狱攻击的抵抗能力。## 代码模块:ChatGLMEval 评估框架与语义可视化项目的 code/ChatGLMEval 目录提供了一个基于 ChatGLM 的评估框架,开发者可以导入自己的数据集路径,运行 run_evaluator.py 来评估 LLM 在面对越狱 Prompt 时的安全表现。code/semantics_visualization/visualize.ipynb 则提供了语义层面的可视化工具,可以直观看到不同类型越狱 Prompt 在语义空间中的分布规律。整个代码库以 Jupyter Notebook 为主要开发形式,语言为 Jupyter Notebook(Python为核心),代码量适中,结构清晰,主要用于数据处理和可视化。## 部署体验:极简主义坦白说,这不是那种需要折腾 Docker、配置 GPU 的复杂项目。克隆仓库后,你只需要一个 Python 3.8+ 环境,加上 datasets 库,就能开始分析数据。数据以 CSV 文件存储在 data/ 目录下,README 里有完整的数据字典说明。没有 Web UI,没有 API 服务,纯本地数据集+分析脚本组合。不过需要提醒的是:原始 Prompt 数据中可能存在重复,需要预处理去重(研究者也在论文中提到了这一点)。另外 HuggingFace 上的数据集较大,下载可能需要一些时间。## 研究意义:安全研究的「预警系统」在 AI 安全领域,越狱(Jailbreak)是 LLM 部署中最棘手的挑战之一。这个项目的核心价值不在于「教你怎么越狱」——README 里明确写了「Disclaimer: This repo is intended for research purposes only. Any misuse is strictly prohibited.」——而在于提供了一个系统性的研究样本库。研究者已经向各大 LLM 厂商负责任地披露了相关发现。对于想要构建更强大安全防护的 AI 工程师而言,这个数据集是难得的 Benchmark:你可以用这 1,405 条越狱 Prompt 测试自己的安全过滤系统,覆盖面远超自己造的数据。对于 Prompt 工程研究者,这些真实案例也是理解用户如何与 AI 交互的重要素材。该项目在 GitHub 上已获得 3,600+ stars,表明学术界和工业界对 LLM 安全问题的高度关注。随着开源 LLM 越来越多,如何防止模型被恶意使用,将是持续性的重要议题。---数据来源:GitHub verazuo/jailbreak_llms,HuggingFace TrustAIRLab/in-the-wild-jailbreak-prompts,ACM CCS 2024 论文