Awesome-LLMs-for-Video-Understanding
最全面的 Vid-LLM 综述资源库,收录 100+ 视频大语言模型,IEEE TCSVT 期刊综述
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
最全面的 Vid-LLM 综述资源库,收录 100+ 视频大语言模型,IEEE TCSVT 期刊综述
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,为什么现在的 AI 能"看懂"一段几十分钟的视频,还能回答"这段视频里主人公第二次转身是在什么时候"这样复杂的问题?传统计算机视觉模型只能识别"画面里有一只猫",而新一代的大语言模型(LLM)正在让 AI 拥有真正的视频理解能力。Awesome-LLMs-for-Video-Understanding 就是这个领域最全面的知识地图——一份由罗切斯特大学、南科大、港大等顶尖学术机构联合维护的 Vid-LLM 综述资源库。

图1:Vid-LLM 领域发展里程碑(里程碑图)
视频理解一直是人工智能的"硬骨头"。不同于静态图片,视频包含时间维度的海量信息——动作的先后顺序、人物的情绪变化、场景的动态发展。要让 AI 真正"看懂"视频,不仅需要识别画面中的物体,还需要理解时空关系、因果逻辑甚至常识推理。
2023 年 12 月,来自罗切斯特大学、南科大、香港大学等机构的研究团队在 arXiv 上发布了论文"Video Understanding with Large Language Models: A Survey",对 Vid-LLM(视频大语言模型)这一新兴领域进行了系统性的梳理。2025 年 4 月,该综述被顶级期刊 IEEE Transactions on Circuits and Systems for Video Technology (TCSVT) 正式接收,标志着学术界对该领域的高度认可。
该综述最初版仅收录约 50 个模型,到 2024 年 7 月更新时已收录超过 150 个 Vid-LLM,涵盖 15 个新 benchmark,并重新设计了分类体系。这份 GitHub 资源库正是这篇综述的配套项目,持续跟踪领域最新进展。
项目对现有 Vid-LLM 进行了两套正交的分类体系,让你从不同维度理解这个领域:
Taxonomy 1 — 按 LLM 功能角色分类:
项目将 Vid-LLM 分为三大架构范式,每个范式下再按 LLM 的具体作用细分:
Video Analyzer × LLM(视频分析器 + LLM):先用视频分析器提取高层语义,再让 LLM 处理这些语义表示。LLM 在其中的角色可以是"总结者"(Summarizer)、"管理者"(Manager)等。
Video Embedder × LLM(视频嵌入器 + LLM):用视频嵌入器将视频连续帧转化为向量表示,直接输入 LLM。LLM 承担"文本解码器"(Text Decoder)、"回归器"(Regressor)、"隐藏层"(Hidden Layer)等角色。
(Analyzer + Embedder) × LLM(混合架构):结合以上两种方案,LLM 同时管理多个分析模块,处理更复杂的视频理解任务。
Taxonomy 2 — 按训练策略分类:
LLM-based Video Agents:利用 LLM 作为核心推理引擎,通过调用外部工具处理视频(如调用视觉模型、检索系统等),典型工作包括 VideoChat、ChatVideo 等。
Vid-LLM Pretraining:在大规模视频-文本数据上进行端到端预训练,使 LLM 原生具备视频理解能力。
Vid-LLM Instruction Tuning:在预训练基础上,通过指令微调(Instruction Tuning)提升模型对具体任务的遵循能力,如 Video-LLaMA 等。
资源库系统性地收录了以下类别:
模型收录: 涵盖从 2019 年至今的主要工作,包括 IG-VLM(用图像格代替视频的高效方案)、LangRepo(长视频语言表示)、MVU(单次多模态模型理解长视频)、LLoVi(简单 LLM 框架处理长视频问答)、DoraemonGPT(动态场景理解)、VAST(视觉-音频-字幕-文本全模态模型)、VLog(将视频当成长文档处理)、LaViLa(从 LLM 蒸馏视频表示)等超过 100 个模型,覆盖短视频、长视频、 ego-centric(第一人称)视频、影视等多种场景。
Benchmark 收录: 收录了 MSVD、MSRVTT、ActivityNet、HowTo100M、Kinetics、TVR、NExT-QA、QVHighlights 等经典数据集,以及专门针对 Vid-LLM 设计的新一代评测基准。
任务类型: 覆盖 VideoQA(视频问答)、Temporal Grounding(时序定位)、Action Recognition(动作识别)、Video Captioning(视频描述)、Video Retrieval(视频检索)、Video Summarization(视频摘要)等核心任务。
持续更新: 项目保持着高活跃度,最近(2025 年 10 月)还发布了续作 Awesome-Video-LMM-Post-Training,专门探讨 Video-LMM 的后训练策略。
学术严谨: 所有收录的模型均标注了对应的 arXiv 论文链接,部分还附带了 GitHub 代码仓库链接,方便研究者和开发者直接溯源。
分类清晰: 两套分类体系从不同角度解构 Vid-LLM,既有技术路线的纵向对比,也有训练策略的横向梳理。
这不是一个可以直接运行的代码库。 这是一个 Markdown 格式的学术资源列表,所有内容都保存在一个约 73KB 的 README.md 文件中。项目不包含任何可执行代码、模型权重或推理引擎——它的价值在于帮研究者和开发者快速了解"Vid-LLM 领域有哪些重要工作,它们各自的技术路线和特点是什么"。
如需实际使用某个模型,需访问各模型对应的 GitHub 仓库或 Hugging Face 页面下载模型权重。
收录偏向学术前沿: 项目以论文为主要收录来源,部分工业级应用(如 GPT-4V、Gemini 等)未被专门收录,因为它们并非专门针对视频理解设计。
Vid-LLM 正在成为多模态 AI 的重要分支。随着 LLM 推理能力的不断增强,将视频理解能力融入通用 AI 助手已成为趋势——用户可以用自然语言询问视频内容、要求视频摘要、甚至让 AI 根据视频内容进行推理决策。
这份 Awesome List 就像一张领域地图,帮助研究者在海量论文中快速定位方向,也帮助开发者了解哪些技术路线已有成熟实现。对于想进入多模态 AI 领域的学习者来说,它是绝佳的入门路线图。
该项目 Star 数超过 3000,说明其受到了学术和工业界的广泛认可。在 Vid-LLM 领域快速发展的当下,这份持续更新的综述资源库将是每一位从业者的重要参考。