MARL-Papers
多智能体强化学习(MARL)领域最全面的论文精选列表,覆盖10+子方向、9年持续更新
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
多智能体强化学习(MARL)领域最全面的论文精选列表,覆盖10+子方向、9年持续更新
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你正在研究机器人协同搬运——十几台机器人在仓库里分工合作,有的负责搬运,有的负责调度,有的负责避障。单个强化学习模型已经无法解决这种多个大脑同时做决策的复杂问题了。多智能体强化学习(MARL)正是为此而生。
MARL-Papers 是由上海交通大学研究人员 Lantao Yu 于 2017 年创建并维护至今的论文精选列表。截至目前已收录超过 4838 颗星标、772 个 Fork,是 MARL 领域最具影响力的开放知识库之一。它不仅是一份论文清单,更是一部记录 MARL 领域十年演进的学术地图。
图1:MARL-Papers 是 MARL 领域最全面的论文精选库之一
MARL-Papers 的创建者 Lantao Yu 当时正在上海交通大学攻读博士学位,师从多位深度强化学习领域知名学者。2017 年左右,MARL 还不是一个热门研究方向——单智能体强化学习(AlphaGo 掀起的那波浪潮)才是学术界的主角。但 Lantao Yu 敏锐地意识到:随着多机器人协同、自动驾驶车队、大语言模型 Agent 系统等场景的兴起,让多个智能体学会协作与竞争将成为核心问题。
他决定做一件事:系统性地整理 MARL 领域分散在 arXiv、各大顶会(NIPS/ICML/ICLR/AAMAS 等)中的论文,用时间线串联起这个领域从游戏理论起源到 LLM Agent 时代的发展脉络。这份列表从最初几十篇论文,逐步扩展到覆盖 Framework、Joint Action Learning、Cooperation & Competition、Coordination、Security、Self-Play、Communication、Transfer Learning、Imitation Learning、Meta Learning 等十余个子方向的完整体系。
截至 2026 年初,该项目已保持 9 年活跃维护,最近更新于 2026 年 6 月 1 日——这说明作者仍在持续跟踪领域最新进展。
MARL-Papers 的论文按主题分为以下几大类别:
1. 基础框架(Framework)
这是 MARL 的方法论核心,包含了 QMIX、COMA、Mean Field MARL、MADDPG 等里程碑式算法。其中 QMIX(2018)提出混合值函数分解,让去中心化执行与集中式训练的结合成为可能;MADDPG(2017)则开创了多智能体 Actor-Critic 架构的先河。这类论文是理解 MARL 算法设计思想的必读文献。
2. 合作与竞争(Cooperation & Competition)
研究智能体之间的博弈关系。最著名的案例之一是 DeepMind 发表于 2019 年 Science 杂志的工作——在《雷神之锤 III》中训练出的「人类水平」多智能体战队,展现了竞争性合作如何催生出高超的战术智能。
3. 通信学习(Learning to Communicate)
这是 MARL 中最具想象力也最具挑战性的方向:智能体如何自发创造通信协议?OpenAI 在 2017 年发表的《Emergence of Grounded Compositional Language》展示了多个智能体如何通过强化学习「发明」出具有组合性的符号语言——这与大语言模型时代的 Agent 间通信协议研究有着深刻的联系。
4. MARL + 大语言模型(MARL in LLMs)
这是近年来最活跃的新方向。随着 GPT-4、Claude 等 LLM 的崛起,研究者开始探索让多个 LLM Agent 协作或竞争来完成复杂任务。该列表收录了 Theory of Mind for Multi-Agent LLM、CoMAS、Mutual Theory of Mind in Human-AI Collaboration 等前沿工作。

图2:多智能体强化学习系统基本架构示意
极低的使用门槛是该项目的核心优势。用户无需安装任何软件或配置环境,只需打开 GitHub 页面即可浏览所有论文。与 ArXiv 官方的论文列表相比,MARL-Papers 做了大量质量筛选和主题分类工作,将一篇篇孤立的论文编织成有结构的知识网络。
每个分类下的论文都附有 arXiv 或顶会链接、作者信息和发表年份,便于追溯原始工作。对于研究生来说,这是理想的文献调研起点;对于工业界工程师来说,这是快速了解某个具体方向(比如「多智能体通信」或「博弈均衡」)核心工作的快捷通道。
持续更新是该项目的另一大价值。作者通过 GitHub 的 Issue 和 Pull Request 机制接受社区贡献,任何人都可以提交新论文。这种开放协作模式使列表能够及时跟进最新研究成果——2024-2025 年的 LLM+MARL 交叉研究就是通过 PR 不断补充进来的。
需要指出的是,MARL-Papers 是一个纯文档型项目,而非代码仓库。它只提供论文引用,不包含任何可运行的代码实现。如果你需要实际复现某个 MARL 算法,应当参考该论文对应的代码仓库(部分论文在列表中有 GitHub 链接)。
此外,由于论文数量庞大(覆盖 2000 年至今的数百篇文献),初学者可能会感到信息过重。建议从 Framework 类别中的经典论文(如 QMIX、MADDPG)入手,理解基本概念后再按需深入各个子方向。
MARL-Papers 的持续火爆折射出一个更大的行业趋势:多智能体系统正在从学术研究走向产业应用。

图3:MARL-Papers 覆盖的核心研究方向
从自动驾驶的车辆编队控制,到物流机器人的协同调度,再到 LLM Agent 之间的任务分解与协作,MARL 的应用边界正在快速扩展。特别值得关注的是「MARL + LLM」这一新方向——让大语言模型扮演多智能体系统中的决策者,结合 MARL 的博弈论框架与 LLM 的语言理解和推理能力,被认为是通往通用人工智能(AGI)的一条重要路径。
MARL-Papers 作为这一趋势的见证者和参与者,不仅是一份论文列表,更是一个记录领域成长的学术档案。对于所有关注 AI 前沿的人来说,定期翻阅这份列表,几乎是跟上 MARL 发展节奏的最有效方式之一。