Awesome-Model-Merging-Methods-Theories-Applications
500+篇论文的 Model Merging 综述库,覆盖 LLM/MLLM/扩散模型等10+子领域,附 ACM Computing Surveys 2026 权威论文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
500+篇论文的 Model Merging 综述库,覆盖 LLM/MLLM/扩散模型等10+子领域,附 ACM Computing Surveys 2026 权威论文
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象一下:你花了三个月微调了一个擅长写代码的模型,又花了两个月微调了一个擅长写小说的大模型。现在老板说"能不能做一个既会写代码又会写小说的全能助手"?传统方案是重新训练,数据要从头收集,GPU 卡要重新烧一笔天文数字费用。但 Model Merging(模型合并)告诉你:不用这么麻烦——把两个模型的"知识"像拼图一样拼起来,就能得到一个多才多艺的新模型。
这就是 Model Merging 的核心魅力——不需要原始训练数据,不需要重新烧卡,只需要把已训练好的模型"合"在一起,就能得到一个能力兼备的融合模型。这个看似"天上掉馅饼"的技术,近年来在 LLM、MLLM、CV、NLP 等几乎所有 AI 子领域掀起了热潮,而这本由北京邮电大学杨恩能团队发表于 ACM Computing Surveys 2026 的综述,正是这一领域的权威百科全书。

2023-2024 年,大模型浪潮席卷 AI 领域,但一个根本矛盾始终存在:训练一个全能的通用模型代价极高,而训练多个专用模型又无法共享知识。
以 GPT-4 级别的模型为例,单次预训练估计需要数百万美元。绝大多数研究团队和中小企业根本承受不起"从头训练一个全能模型"的成本。在此背景下,Model Merging 成为了一个优雅的解题思路:与其训练一个全能模型,不如先训练多个专家模型,再用合并技术将它们的知识融合。
这一思路的爆发,背后有三个推力:
Model Merging 的历史可以追溯到 2019 年的"Model Soup"——通过平均多个同架构、不同超参的模型来提升性能。但真正的突破发生在 2022 年:
而 2024-2026 年,Model Merging 的战场扩展到了 LLM 和多模态领域,成为真正的跨领域通用技术。

这是一个围绕 ACM Computing Surveys 2026 综述论文构建的配套资源库,截至 2026 年 8 月已收录 500+ 篇相关论文,涵盖从 2019 年到 2026 年的完整发展脉络。
仓库结构极为简洁:根目录只有 README.md(约 50,000 字)和一个 imgs/ 图片文件夹。README 本身就是一个完整的、结构化的学术百科全书,所有内容以 Markdown 超链接形式组织,读者可以直接点击跳转到对应论文的 arXiv 或官方页面。
该资源库按照以下六大维度组织内容:
① Survey(综述):收录了 10 篇关于 Model Merging 的综述论文,其中最核心的是项目团队自己的这篇 ACM Computing Surveys 2026 论文(Volume 58, Issue 8, Article 216, 41页)。其他综述涵盖大语言模型时代、模型融合民主化、深度模型融合等多个视角。
② Benchmark & Evaluation(基准与评测):收录了 Model Merging 领域专门的评测基准,如医疗 LVLM 基准、MergeKit 基准等,帮助研究者量化不同合并方法的效果。
③ Advanced Methods(进阶方法):这是整个仓库的核心板块,按照两个层次分类:
④ Applications in LLMs(LLM 应用):收录了在大型语言模型上应用 Model Merging 的论文,包括跨模态知识迁移、专家模型能力组合等方向。

⑤ Applications in MLLMs(多模态大模型应用):收录了在多模态大语言模型(GPT-4V、Claude 等)上的模型合并应用,包括跨模态知识融合、专家 MLLM 组合等。
⑥ Applications Across ML Subfields(跨机器学习子领域应用):这是最能体现 Model Merging 普适性的部分,覆盖了 10+ 个 ML 子领域:
| 应用领域 | 具体场景 |
|---|---|
| 持续学习(Continual Learning) | 缓解灾难性遗忘问题 |
| 多任务/多目标/多域学习 | 知识迁移、多目标优化 |
| 分布外泛化 | 提升模型在未知分布上的鲁棒性 |
| 联邦学习 | 本地知识聚合 |
| 零样本/少样本学习 | 跨任务泛化能力 |
| 对抗学习 | 攻防两端的模型合并策略 |
| 扩散模型 | 风格混合、训练成本降低 |
| 视频生成模型 | 运动建模增强 |
| 具身智能模型 | 跨实体知识迁移 |
该项目仓库被打上了 20 个 GitHub Topics 标签,这些标签本身就是一张 AI 研究热力图:model-merging、llms、large-language-models、foundation-models、multi-task-learning、few-shot-learning、federated-learning、knowledge-fusion……这些标签的组合揭示了 Model Merging 不是一个孤立的技术,而是一个横跨多个 AI 子领域的交叉学科,是当前大模型时代"效率优先"思潮的集中体现。
最直觉的方法:将两个模型的参数向量做线性组合。Model Soup 是这一派的开山之作,其核心洞察是"多个微调模型的参数在 loss landscape 中处于同一个平坦盆地",因此可以安全地进行插值。
将"专长"建模为向量——Task Vector = Fine-tuned_Params - Base_Params。加法合并专长向量,负向加法撤销有害知识。简单、直观、可解释,是目前最流行的方法之一。
当合并多个不同任务的模型时,不同任务的最优参数方向可能相互冲突(指向不同的方向)。TIES-Merging 的三步策略:① 选择 sign(取多数同意方向)、② trim(丢弃小权重)、③ disjoint merge(避免冲突)。效果显著超越简单平均。
利用 Fisher Information Matrix 衡量每个参数对最终性能的贡献权重,贡献大的参数优先保留。是理论最优雅的方法之一,但计算代价较高。
在正式合并之前,先优化"待合并模型"的质量。包括:选择更好的微调数据、调整微调策略(如只在关键层微调)、使用更好的基础模型等。MergeKit 等工具将 Pre-Merging 策略系统化,显著提升了合并效果。
这是最常见的误区。Model Merging 并非总是"1+1≥2":如果两个专家模型的能力高度重叠(如两个都专精代码生成),合并反而可能造成"能力稀释"——新模型两边都不精。最佳合并策略是互补型专家的合并。
虽然 Task Arithmetic 提供了直观的参数级解释,但当涉及复杂的大模型时,我们仍然不清楚"为什么合并后的模型会在某些 prompt 上给出特定的回答"。Model Merging 的机制仍然存在大量"经验性成功、理论解释不足"的地方。
一个有趣但令人担忧的方向是 Model Merging in Adversarial Learning——通过合并"正常模型"和"攻击模型",可能产生一个表面正常、实则有害的"后门模型"。这给 Model Merging 的实际部署带来了安全审查的新挑战。
目前大多数 Model Merging 方法假设待合并模型架构相同。对于跨架构合并(如将 CNN 和 Transformer 合并),仍然是一个开放难题。

ACM Computing Surveys 是 ACM 旗下影响因子最高的期刊之一(2025 IF ≈ 20+),专注于发表系统性综述论文。Model Merging 综述能被其接收,本身就说明了这个领域已经从"零散探索"进入了"系统化成熟"阶段。
该综述提出了一个新的分类法:Pre-Merging → Task-Level → Domain-Level,将此前零散的模型合并方法归入了一个统一的框架,对后续研究具有重要的导航价值。
该综述不仅仅是学术论文的堆砌,更是一份实践者指南。它详细讨论了:
对于正在构建多专家模型系统的工程师来说,这是一份可以直接指导选型的参考文献。
Model Merging 的兴起代表了一种 AI 研究范式的转变:从"训练一个万能模型"到"组装一群专家模型"。这与 MoE(Mixture of Experts)、Agent 协作、知识图谱等方向形成了有趣的呼应。可以预见,Model Merging 将成为未来 AI 系统架构中不可或缺的一环。
| 属性 | 值 |
|---|---|
| Stars | 772 |
| Forks | 46 |
| 主要语言 | 无(纯 Markdown 资源库) |
| 许可证 | 无明确许可证 |
| 发表论文 | ACM Computing Surveys, 2026, Vol.58 No.8 |
| 论文 DOI | 10.1145/3787849 |
| 论文链接 | https://arxiv.org/abs/2408.07666 |