awesome-diffusion-model-in-rl
扩散模型+强化学习交叉领域最系统的论文与资源导航,追踪2022-2026年前沿进展
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
扩散模型+强化学习交叉领域最系统的论文与资源导航,追踪2022-2026年前沿进展
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你是一名研究强化学习的博士生,最近在探索如何让机器人在复杂环境中做出更"聪明"的长期决策。传统的 RL 算法在面对稀疏奖励、长周期任务时常常"短视"——过度依赖 Bootstrap 机制导致误差累积,难以捕捉未来的多模态行为分布。而近年来火遍 CV 和 NLP 领域的扩散模型(Diffusion Model),恰恰擅长从噪声中逐步恢复高质量、多样化的样本——这正好填补了 RL 的短板。
awesome-diffusion-model-in-rl 正是这样一个知识枢纽:由 OpenDILab 团队维护,精选扩散模型与强化学习交叉领域的优质论文、开源代码和教程资源,追踪该方向从 2022 年至今的前沿进展。
强化学习的核心问题是时序决策:智能体需要在一连串动作中选择最优路径,最大化累积奖励。传统方法(如 DQN、PPO、SAC)在处理这一问题时存在两大瓶颈:
长期信用分配难题(Long-term Credit Assignment):智能体需要判断很久之前的某个动作对当前结果的影响有多深。Bootstrap 机制虽然高效,但会累积估计误差,在长周期任务中导致策略崩溃。
多模态行为覆盖不足:在许多现实场景中,最优策略本身就具有多样性(比如到达终点有多条路径)。传统高斯策略难以有效覆盖这种多模态分布。
扩散模型的核心思想是逐步去噪:从一个纯噪声分布开始,通过学习逆向扩散过程,逐步恢复出符合数据分布的样本。这种迭代精化的方式天然具有几个优势:
2022 年,Janner 等人在论文"Planning with Diffusion for Flexible Behavior Synthesis"中首次将扩散模型引入机器人轨迹规划,开启了这一交叉领域的先河。
该项目按照会议/年份和应用场景双重维度组织资源:
| 分类 | 数量(示例) | 代表论文 |
|---|---|---|
| Arxiv 预印本 | 27+ | Flow-Based Single-Step、3D Diffusion Policy |
| ICML 2026 | 进行中 | 持续更新 |
| ICLR 2026 | 进行中 | 持续更新 |
| NeurIPS 2025 | 多篇 | Flow Matching、IDQL 延伸工作 |
| ICLR 2025 | 多篇 | NoMaD、PlayFusion |
| CVPR 2024 | 多篇 | 3D Diffusion Policy |
| NeurIPS 2023 | 经典 | Decision Diffuser、Planning with Diffusion |
每条论文条目包含:
将扩散模型作为规划器,在推理阶段通过迭代去噪生成高质量轨迹,代表工作包括:
将扩散模型作为策略函数(Policy) 直接输出动作分布,这是 Offline RL 场景下的重要突破:
利用扩散模型作为环境预测器,构建基于想象的规划系统:
项目中收录了数个高质量的参考实现:
扩散模型与强化学习的结合,本质上是生成式 AI 能力向决策领域渗透的体现。从 2022 年仅有零星几篇探索性工作,到 2024-2025 年 NeurIPS/ICML/ICLR 全面开花,这一方向已从"概念验证"走向"工程落地"。
关键趋势:
总体而言,awesome-diffusion-model-in-rl 是该领域最系统的资源聚合之一,适合作为入门导航和持续追踪的起点。结合 OpenDILab 团队的相关工具链,可以从论文阅读平滑过渡到代码复现和研究创新。
项目地址:opendilab/awesome-diffusion-model-in-rl
Star: 1,626 | Fork: 78 | 维护方: OpenDILab