Awesome-World-Models
世界模型论文全图谱:覆盖通用视频生成、具身智能与自动驾驶三大方向的arXiv论文持续追踪列表
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
世界模型论文全图谱:覆盖通用视频生成、具身智能与自动驾驶三大方向的arXiv论文持续追踪列表
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你玩《黑神话:悟空》时,游戏中的BOSS能「预判」你的出招并实时调整策略——这不是因为程序写了 if-else 分支,而是AI学会了对游戏世界进行建模和推演。这种让AI「理解世界运作规律」的技术,就是世界模型(World Model)。
2026年,世界模型已从学术概念演变为具身智能的核心基础设施。当特斯拉 Optimus 在工厂里搬运零件时,背后运行的是一套能够预测动作后果的「世界模拟器」;当小米汽车用自研世界模型重建驾驶场景时,真实的传感器数据与生成式仿真正在深度融合。这个领域太新了——新到arXiv上每周都有十几篇相关论文涌出,任何一个人都无法靠手工跟踪全部进展。
leofan90/Awesome-World-Models 正是在这个背景下诞生的论文合集:它系统性地整理了世界模型在通用视频生成、具身智能(Embodied AI)、自动驾驶三大方向的核心论文,堪称该领域最完整的知识图谱之一。截至分析时,项目已收获超过 1778 颗星,持续追踪着这个快速演进的领域。
GitHub上 Awesome 类列表多如牛毛,大多数只是罗列链接、缺乏维护。这个项目却有自己的工程化思考。
它采用了一套半自动化流水线来保持列表的时效性:每天定时运行的 GitHub Actions 会调用 arXiv API,自动抓取标题中包含「world」的最新论文;随后 Python 脚本根据关键词规则对论文进行分类(属于「具身智能」还是「自动驾驶」?),并生成一个结构化的 GitHub Issue 作为审核收件箱;维护者人工审核后,在 Issue 下评论 /create-pr 即可触发自动 PR,将新论文插入 README 相应章节。整个流程确保列表既不会过时,也不会因为自动化分类错误而混入无关论文。
分类体系本身就体现了维护者对领域的深刻理解。项目将论文分为七大类别:
| 类别 | 覆盖内容 |
|---|---|
| 基础论文 | World Models 等开创性工作 |
| 博客与技术报告 | 工业界最新进展(NVIDIA Cosmos 3、OmniDreams 等) |
| 综述(Survey) | 全面梳理领域进展的综述性论文 |
| 基准与评估 | 评测数据集与方法 |
| 通用世界模型 | 不限具体应用的基础研究 |
| 具身智能方向 | 机器人操作、导航、强化学习 |
| VLA(视觉-语言-动作) | 视觉-语言-动作联合建模 |
| 视觉理解方向 | 空间推理、视觉问答 |
| 自动驾驶方向 | 交通场景仿真、端到端驾驶 |
这份分类直接反映了当前世界模型研究的核心应用版图。
项目代码量不大(核心脚本约 19KB),但技术选型很有章法。
arXiv API 数据采集:scripts/arxiv_candidates.py 是核心模块,通过 Atom Feed 协议查询 arXiv,每页返回最多 300 条记录,支持重试和去重。它不仅抓取新论文,还会读取本地 README.md 提取已有论文 ID,避免重复收录。关键词匹配规则(SECTION_RULES)将论文分发到对应章节,支持 robot、embodied、autonomous driving、vision-language-action 等多种语义标签。
CI/CD 自动化流水线:.github/workflows/ 目录下配置了两个工作流:arxiv-candidates.yml 每日定时运行(或手动触发),负责抓取论文并更新 Issue;arxiv-candidates-create-pr.yml 响应 Issue 评论,自动化生成合并 PR。GitHub Actions 的 GITHUB_TOKEN 被用来推送分支和创建 PR,整个流程无需外部服务。
数据持久化:data/arxiv-ignore.txt 记录被排除的论文 ID(标题含 world 但实际无关的论文),防止重复干扰;README.md 本身是最终产物,以 Markdown 表格格式存储论文元数据(标题、年份、会议/期刊、Paper链接、Code链接)。
整个技术栈极为精简——Python 标准库 + GitHub Actions + Markdown,没有任何重型依赖,这保证了流水线的可靠性和可维护性。
对于AI 研究者和开发者,这份列表是快速摸清领域全局的利器。当你准备开一个新方向时,与其漫无目的地刷 arXiv,不如先在列表里按类别索引,找到最具代表性的论文和开源代码,事半功倍。尤其是包含了大量 2024-2026 年的最新工作,涵盖 NVIDIA Cosmos 3、HY-World 2.0、Helios、Seedance 2.0 等工业界重磅发布。
对于机器人工程师和自动驾驶从业者,列表中按应用领域分类的结构特别实用:具身智能方向收录了 Cortex 2.0(工业部署)、MotuBrain(机器人控制)、Being-H0.7(第一人称视频)等;自动驾驶方向收录了 Xiaomi EV World Model(重建+生成联合建模)、GE-Sim 2.0(机器人操作的闭环仿真)等。直接对应工作中的技术选型和论文调研需求。
对于AI 爱好者,虽然论文本身有技术门槛,但列表中每个论文都附带了通俗的标题和出处(arXiv编号),配合 GitHub 上的开源实现代码,即使是本科生也能找到感兴趣的切入点——比如 Helios 打着「实时长视频生成」的标签,对于任何对 AI 视频生成感兴趣的人来说都是一个值得深挖的起点。
没有任何项目是完美的。对于这份列表,读者需要了解以下几点:
首先,arXiv 论文不代表经过同行评审。列表以 arXiv preprint 为主,大量论文未经正式会议接收,引用时需注意。其次,分类依赖关键词匹配,自动化分类的准确率并非 100%,维护者在 Issue 中保留了人工纠正分类的环节,但无法保证每篇论文都分到最恰当的类别。
此外,图片素材极度匮乏是这个项目天然的劣势——作为纯文本论文列表,没有 Demo 视频或架构图可以直观展示世界模型的工作原理。读者若想深入理解某篇论文的实际效果,需要自行访问论文主页或 Hugging Face/YouTube 上的 Demo。
世界模型正在成为 Physical AI(物理世界AI)的基础设施。NVIDIA 推出 Cosmos、CES 2026 上机器人厂商集体押注世界模拟器、特斯拉和 Figure 的人形机器人背后都有世界模型的影子——这个趋势已经从学术界蔓延到了工业界。
Awesome-World-Models-for-Robotics 的价值在于:它提供了一个结构化的知识入口,让研究者和工程师不用在海量 arXiv 论文里大海捞针。从 2018 年 World Models 的开创性工作(Ha & Schmidhuber,NIPS 2018 Oral),到 2026 年最新的工业级世界模拟器,这个列表跨越了世界模型从理论走向工程化的完整历程。
对于想进入这个领域的人,这是最好的起点之一。对于已经在其中的人,它也是保持信息同步的效率工具。每周花 10 分钟过一遍自动生成的 Issue,比刷 Twitter/X 的碎片信息要系统得多。
链接直达:https://github.com/leofan90/Awesome-World-Models