Awesome-VLM-Streaming-Video
汇集流式视频理解与视觉语言模型前沿论文的开源知识库,收录 CVPR/NeurIPS 等顶会工作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
汇集流式视频理解与视觉语言模型前沿论文的开源知识库,收录 CVPR/NeurIPS 等顶会工作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你正在观看一场足球比赛的实时直播,想问 AI「现在比分是多少」「刚才那个越位球判得对吗」。传统视频理解模型必须等待整场比赛结束才能回答,而 Streaming Video(流式视频理解)技术让 AI 能够边看边说——这正是近年来 CVPR、NeurIPS 等顶会上最活跃的研究方向之一。
由开发者 ydyhello 维护的 Awesome-VLM-Streaming-Video 项目,正是这一领域最系统的Awesome类资源聚合站。该项目收录了流式视频理解方向的论文、开源代码和相关资源,截至目前已获得近 200 颗 GitHub Stars,深受研究者和工程师关注。
当前主流视频理解模型(如 LLaVA-Video、VideoChat 等)属于离线批处理模式:必须将完整视频加载到内存、处理完毕后才输出结果。这一模式在短视频场景尚可接受,但在以下场景中面临根本性挑战:
流式视频理解通过将视频视为无限长度的 token 流,用滑动窗口替代全量加载、用 KV Cache 管理历史记忆、用 EOS(End-of-Sequence)机制决定何时「开口说话」,从根本上解决了这一矛盾。
Awesome-VLM-Streaming-Video 的 README 文件长达约 30000 字,内容涵盖:
| 类别 | 代表作品 | 出处 |
|---|---|---|
| 开山之作 | VideoLLM-online | CVPR 2024 |
| 工业级方案 | StreamingVLM | NVIDIA/MIT-HAN-Lab |
| 高效计算 | VideoLLM-MoD | NeurIPS 2024 |
| 长视频推理 | VideoStreaming | NeurIPS 2024 |
| 层级化理解 | ThinkStream | ECCV 2026 |
| 主动式对话 | ProAssist | EMNLP 2025 |
除论文外,项目还收录了配套的数据集(Benchmark)、评估标准(Metrics)和开源代码仓库(Code)。相比单一论文的解读,这是一份完整的领域知识地图,能帮助研究者快速定位:
VideoLLM-online(CVPR 2024)是该方向的里程碑工作。研究者提出了 Streaming EOS(End-of-Sequence)机制:模型在每个视频帧预测一个特殊 token [EOS],若该帧无需回应则输出 [EOS],若需要描述/问答则生成对应文本。
这一机制的关键创新在于:无需等待未来帧即可做出判断。模型学会了「什么时候该说话」,而不是等视频播完再全局分析。在 RTX 3090 上达到 5-10 FPS,A100 上达 10-15 FPS,实现了真正意义上的实时流式理解。
StreamingVLM(NVIDIA Research)则从系统层面给出了更完整的答案。其核心是混合记忆管理策略,将 KV Cache 分为三类:
训练策略上,StreamingVLM 采用 overlapped chunk training(重叠分块训练):用短重叠窗口的完整注意力训练,模拟推理时的流式注意力模式。这种训练-推理一致性设计让模型无需在超长上下文上训练,即可泛化到无限长视频。
VideoLLM-MoD(NeurIPS 2024)针对 VLMs 中视觉 Token 计算成本过高的问题,引入了 Mixture-of-Depths 思想:对 80% 的视觉 Token 在部分 transformer 层直接跳过计算、透传到下一层,在不减少视觉 Token 总量的前提下显著降低 FLOPs。这对流式视频场景意义重大——视频流持续不断,每帧节省 1% 计算都意味着更大的帧率上限。
从时间线看,流式视频理解经历了三个阶段:
第一阶段(2024年初):证明可行性。VideoLLM-online 用 Streaming EOS 证明 VLMs 可以边看边说,但帧率有限、对话质量有待提升。
第二阶段(2024年中):系统化工程。StreamingVLM 带来了完整的训练-推理框架和 Benchmark;VideoLLM-MoD 在效率上做出突破。
第三阶段(2025-2026):智能化深化。ThinkStream(ECCV 2026)引入流式推理思维链,让模型在边看边说时展现逻辑推理能力;ProAssist(EMNLP 2025)将流式视频理解应用于第一人称视频的主动式 AI 助手。
未来趋势可能包括:
作为纯文档类项目,Awesome-VLM-Streaming-Video 无需安装部署,使用方式极为简单:
# Clone 到本地
git clone https://github.com/ydyhello/Awesome-VLM-Streaming-Video.git
cd Awesome-VLM-Streaming-Video
# 用任意 Markdown 阅读器打开
cat README.md | less
# 或直接在 GitHub 网页端浏览
如需运行 README 中提到的具体代码项目(如 StreamingVLM、VideoLLM-online 等),请访问各项目主页查看环境配置要求。
| 项目 | 主要依赖 | GPU 需求 | 难度 |
|---|---|---|---|
| StreamingVLM | PyTorch, Transformers | NVIDIA H100/A100 | 中等 |
| VideoLLM-online | Qwen-VL, vLLM | RTX 3090+ | 较高 |
| VideoLLM-MoD | LLaVA 架构 | 多卡 | 高 |
需要指出的是,Awesome-VLM-Streaming-Video 作为一个 Awesome List,本质上是资源聚合而非原创研究,其局限性体现在:
但这些「局限」并不影响项目的核心价值——作为领域入门地图,它提供了最全面的论文导航,让研究者无需在 arXiv 海洋中逐篇搜索。
流式视频理解代表了 VLMs 从「静态图像理解」向「持续感知」演进的关键一步。随着 VideoLLM-online → StreamingVLM → ThinkStream 的技术演进,我们正在见证一个实时 AI 感知时代的到来。
建议的阅读路径:
Awesome-VLM-Streaming-Video 是该领域难得的优质导航站点,值得每一位关注视频 AI 的研究者和工程师收藏。