VideoLucy
worldbench/VideoLucy加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你花了两个小时看完一部纪录片,现在朋友问你"片中主角第一次出场是在哪个时间点",你能在不看回放的情况下准确回答吗?人类在处理长视频时,往往只能记住"粗粒度的概貌",而忽略大量细节。但恰恰是这些被忽略的细节,才是回答精确问题的关键。
VideoLucy 正是为解决这一难题而生。
VideoLucy 的核心灵感来自人类的回忆过程——我们总是先想起"大概发生了什么",再逐步回溯到"具体细节"。项目提出了层级记忆结构( Hierarchical Memory Structure),将视频理解分为两个粒度:
这种由粗入精的设计大幅降低了计算开销——模型无需对整部长视频保持高分辨率注意力,只需在需要时"回溯"到关键片段。
仅有层级结构还不够,VideoLucy 还引入了基于 Agent 的迭代回溯机制(Agent-based Iterative Backtracking)。整个推理流程如下:
这一机制让模型能够主动"发现自己的知识边界",而非被动等待用户指定关注区域。
| 组件 | 技术选型 |
|---|---|
| VLM(视觉语言模型) | Qwen2.5-VL-7B-Instruct(本地部署) |
| LLM(大语言模型) | DeepSeek-R1 / 火山引擎 Ark API |
| 深度学习框架 | PyTorch + Transformers |
| 注意力优化 | Flash Attention 2 |
| 推理精度 | bfloat16 |
| 视频下载 | you-get(B站视频支持) |
代码结构清晰,核心分为三个模块:
VLMs/vlm_roles.py:VLM 调用、帧采样、图像处理LLMs/llm_roles.py:LLM API 封装、记忆摘要、问答逻辑utils.py:日志、答案解析、时间段过滤等工具函数VideoLucy 团队同步开源了 EgoMem 评测基准,专门针对**超长第一人称视频(Ego-life Video)**设计,数据来源为 EgoLife 数据集。评测重点考察两方面能力:

项目提供了一个开箱即用的 demo.py,默认使用 B 站视频链接 + 预设问题进行演示。用户只需:
Qwen/Qwen2.5-VL-7B-Instruct)you-get 用于视频下载python demo.py项目还贴心地在 demo_cache 中预置了中间结果缓存,可直接跳过后续推理,加速体验流程。
VideoLucy 被 NeurIPS 2025 接收,标志着长视频理解正在成为多模态 AI 的新战场。与传统"全量注意力"方案相比,层级记忆 + 主动回溯的范式在计算效率上具有显著优势。随着 VLM 和 LLM 能力的不断提升,这种"按需深挖"的设计思路有望成为长视频理解的标准架构。
项目链接:https://github.com/worldbench/VideoLucy
论文:arXiv:2510.12422
主页:https://videolucy.github.io