awesome_LLM-harmful-fine-tuning-papers
系统梳理 LLM 有害微调攻击与防御研究的 ACM CSUR 综述配套论文列表仓库,覆盖 NeurI
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
系统梳理 LLM 有害微调攻击与防御研究的 ACM CSUR 综述配套论文列表仓库,覆盖 NeurI
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2023年,AI 社区沉浸在开源大模型的繁荣之中——Meta 发布 Llama 2、OpenAI 开放 GPT-3.5 Turbo 微调 API,每个人都可以用不到 0.2 美元的成本,在少量有害数据上微调模型,轻易突破 ChatGPT 的安全护栏。这就是有害微调攻击(Harmful Fine-tuning Attack)的序幕。
匹兹堡大学 NSDI 实验室的一篇论文最早系统揭示了这一问题:仅用 10 个对抗性样本微调 GPT-3.5 Turbo,就能让它对几乎任何有害指令"有求必应"。而这只是冰山一角。随着微调即服务(fine-tuning-as-a-service)商业模式兴起,服务提供商允许用户上传自定义数据集来微调基座模型——这个过程中,一个新的攻击面悄然形成:恶意用户可以通过上传部分有害数据,打破模型的安全对齐(Safety Alignment),使原本被 RLHF 训练封禁的有害能力重新释放出来。
git-disl/awesome_LLM-harmful-fine-tuning-papers 正是围绕这一新兴威胁,系统梳理了从攻击到防御的完整研究图谱。该项目附属于发表在 ACM CSUR(Computing Surveys) 上的综述论文,被引用于 arXiv:2409.18169,是该领域目前最权威的研究地图。
如果用生活化的比喻,这个项目就像一张标注了所有危险海域的航海图:有害微调攻击是新的暗礁,而防御方法是绕过暗礁的航线。研究者不需要自己摸索每篇论文,这张图已经标好了所有关键港口的位置。
该项目对有害微调研究进行了系统化分类,涵盖以下主要方向:
攻击层面(Attack):
防御层面(Defense):
学术顶会收录情况(持续更新至 2026年4月):
每周更新的节奏,确保研究者不会错过最新进展。
作为 ACM CSUR 期刊综述,项目对有害微调问题进行了严谨的学术梳理:
威胁模型构建:项目论文首先系统地形式化了有害微调的问题定义和基本假设,明确了攻击者的能力假设(如能访问微调 API)、受害模型范围(已对齐的 LLM)、攻击目标(打破安全对齐)等关键要素。这为后续研究提供了统一的讨论基础。
评估方法论:包含了对现有攻击/防御方法的评估框架,包括攻击成功率、对抗样本构造方法、对齐破坏程度度量等。项目论文还特别回答了同行评审中常见的问题:实验设置是否真实?攻击假设是否合理?为研究者提供了有力的参考。
最新研究趋势:2025年的 Chef Recommendation 特别指出,有害微调的风险在使用 jailbreak tuning 和更大规模模型时尤为显著。2025年8月的 OpenAI 技术报告也指出,有害微调已经影响到 GPT-oss 旗舰模型的生物安全和网络安全风险。
对于普通用户,这个项目没有技术门槛——不需要安装任何软件,不需要 GPU,不需要懂代码。直接访问 GitHub 页面阅读 README,即可获取完整的论文列表、研究分类和 arXiv 链接。
对于研究者,项目提供了更丰富的资源:
organization.png 展示了有害微调攻防的整体框架README 支持中文搜索(英文撰写),论文按顶会、年份、方向分类清晰,配合 topics 标签(alignment、attack、defense、safety 等)可以快速定位感兴趣的方向。
有害微调研究领域目前仍存在一些争议:
攻击的现实性:部分评审对某些攻击设置的现实性提出质疑——攻击者需要访问微调 API 的前提条件在实际场景中是否总是满足?论文对此进行了专门讨论,但部分攻击方法(如需要特定 API 权限的方法)在真实攻击场景中的可行性仍需进一步验证。
防御的通用性:现有防御方法大多针对特定攻击类型设计,跨攻击类型的通用防御方案仍是开放问题。Booster 等对齐阶段防御虽然取得 ICLR Oral,但在大规模生产环境中的部署成本和效果仍有待验证。
开源数据风险:项目列表中涉及的数据集(如污染后的 Alpaca)已被广泛传播,即使删除原始数据也无法完全消除影响,数据污染的长期危害评估尚不充分。
随着各大云厂商纷纷推出微调 API,有害微调已经从学术问题演变为现实安全威胁。OpenAI、Google、Anthropic 等主要 LLM 提供商都在紧急评估应对方案。这个领域的研究正处于爆发期——2024到2026年间,仅顶会收录的相关论文就超过 40 篇。
该项目作为该领域的知识枢纽,不仅服务于学术研究者,也为 AI 安全从业者、政策制定者和行业合规团队提供了不可或缺的第一手资料。在 LLM 安全日益重要的今天,掌握有害微调的攻防动态,已经成为 AI 安全从业者的必修课。
图1:有害微调攻防研究整体框架(来源:项目仓库 organization.png)
