Awesome-LLM-Ensemble
系统梳理大模型协作范式的综述资料库,收录140+篇论文,IJCAI 2026 Survey
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
系统梳理大模型协作范式的综述资料库,收录140+篇论文,IJCAI 2026 Survey
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Awesome-LLM-Ensemble 项目 Logo
想象一下这样的场景:你的团队需要完成一份复杂的技术报告,Claude 3.5 Sonnet 在创意写作上游刃有余,但在处理数学推导时总是"一本正经地胡说八道";GPT-4o 的多模态理解能力出色,但在代码补全任务上总比专门的代码模型慢上半拍;而开源的 Qwen2.5 虽然轻量,但某些垂直领域的知识覆盖又不够深入。
面对这样的现实困境,AI 研究者们很早就提出了一个直白的疑问:为什么非要用一个模型解决所有问题?
这个看似简单的想法,正是 LLM Ensemble(大语言模型集成)研究的核心出发点。当单一模型的"木桶效应"日益明显——总有一个维度是它的短板——让多个模型各展所长、协同工作的思路,自然而然地成为了学术界和工业界共同关注的方向。
在这一背景下,北京航空航天大学的研究团队联合国内外多所高校,于 2025 年初发布了系统性的 LLM Ensemble 综述论文,并在 2026 年被 IJCAI Survey 接收,成为该领域被引用最广泛的综述之一。其配套维护的 GitHub 资料库 Awesome-LLM-Ensemble,目前已收录超过 140 篇相关论文,成为 LLM Ensemble 方向最重要的论文聚合站点。
图2:LLM Ensemble 三阶段分类体系示意
综述论文将 LLM Ensemble 方法按照"集成时机"划分为三大类别,这一分类框架如今已被学界广泛引用。
这类方法的核心是在调用模型之前,先判断当前问题该交给哪个模型。它本质上是一个**路由器(Router)**的设计问题——给定一个用户 query,路由器需要预测每个候选模型的"效用",然后选择最合适的那一个。
根据效用的建模方式,又分为两个子方向:
代表性工作包括加州大学 UIUC 实验室提出的 GraphRouter(将 query 与模型的关联建模为图结构)、Router-R1(通过强化学习让路由器学会多轮路由和聚合策略)、以及 Eagle(无需训练的高效推理路由方法)。
图3:推理前集成方法的关键属性对比
这是集成粒度最细的一类方法,它在模型实际生成 token 的过程中就进行多模型协作。根据聚合粒度的不同,又分为三个层次:
Token 级集成:在最细粒度上融合多个模型的输出 token 分布,通过加权平均或采样策略决定最终生成的 token。典型方法如 Medusa(多尾解码)、Self-Speculative Decoding(自推测解码)。
Span 级集成:以短文本片段(如连续的 4-8 个词)为单位进行选择或融合。适合在保持语义连贯性的同时,吸收不同模型在局部表达上的优势。
过程级集成:在推理链(Chain-of-Thought)的每一步动态选择最优的推理过程,逐步构建最终答案。这种方法对于复杂推理任务(如数学证明、逻辑分析)效果尤为显著。
图4:推理中集成方法的技术路线对比
这类方法在各个模型完成完整响应后再做整合,是最直观也最易落地的方案。分为两类:
非级联方式:收集所有模型的完整回答,通过投票、评分或融合网络决定最终输出。Folly(Meta 开源)、LLM-Blender 都是这一类的代表。
级联方式(Cascade):按模型规模和推理成本从低到高排序,先用小模型快速处理简单 case,遇到困难问题才升级到大模型。这在成本敏感的工业场景中尤为实用。
图5:推理后集成方法的分类与技术对比
梳理该仓库收录的 140+ 篇论文,可以清晰地看到 LLM Ensemble 领域的技术演进脉络。
第一阶段(2023-2024):规则与轻量匹配。早期工作多依赖简单的启发式规则(如根据 query 长度、关键词判断)或轻量级分类器。代表工作如 RouteLLM(基于对比学习的路由)、SPARCH(稀疏门控路由)。
第二阶段(2024-2025):可学习路由器。随着 MoE(混合专家)架构的兴起,研究者开始探索更复杂的可学习路由机制。HybridLLM(稠密+稀疏混合)、SCOPS(自我认知系统)等工作从不同角度探索了路由器的训练范式。
第三阶段(2025-2026):强化学习驱动。以 Router-R1 为代表的工作开始将强化学习引入路由器训练,让路由器能够自主学习最优的路由策略,而非依赖人工设计的特征或标注数据。这是当前最活跃的研究方向之一。
在工业界,多模型协作早已不是纸上谈兵。仓库中专门开设了 "Applications" 和 "Systems" 分类,收录了真实落地案例:
综合仓库中论文的分布,以下几个方向值得关注:
测试时计算扩展(Test-Time Scaling):随着 o1/o3/o4 系列模型引领的"推理时 scaling"范式兴起,推理过程中的动态路由和集成将成为核心研究议题。该仓库专门设立了 "Test-Time Scaling" 分类,反映了这一趋势。
多智能体协作(Multi-Agent):多个 LLM 以 Agent 身份分工协作、互相通信,是 LLM Ensemble 在更高层次的延伸。该方向与 Multi-Agent Systems 主题高度交叉,是 2025-2026 年增长最快的子领域。
效率与成本的帕累托最优:如何在模型能力和推理成本之间找到最优路由策略,仍是一个开放问题。级联(Cascade)架构在此方向上有很大的研究空间。
对于学术研究者:该仓库按照严谨的分类体系组织论文,适合作为文献调研的起点。按图索骥,可以快速把握某一子方向的代表性工作和技术脉络。
对于工程实践者:仓库收录了部分工作的开源实现(含 GitHub 链接),可以结合 Benchmark 分类中的评测基准进行技术选型验证。
对于学生/爱好者:综述论文(arXiv:2502.18036)提供了完整的背景知识和分类框架,配合仓库中的论文列表,可以系统性地学习这一领域。
Awesome-LLM-Ensemble 不只是一个论文列表,更是一扇观察大模型协作范式演变的窗口。从最初的"选哪个模型"到如今的"多个模型如何协同生成",LLM Ensemble 正在成为下一代 AI 系统的基础架构理念。如果你对如何让 AI 系统更高效、更智能感兴趣,这个仓库值得持续关注。
本分析基于项目 README、GitHub 元数据及综述论文(arXiv:2502.18036,IJCAI Survey 2026)生成。
资料库维护者联系邮箱:zhijunchen@buaa.edu.cn(欢迎提交论文 Pull Request)