OpenVideo
OpenVideo:专注文生视频领域的高质量视频数据集与全流程工具链
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
OpenVideo:专注文生视频领域的高质量视频数据集与全流程工具链
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
当一位 AI 研究者想要训练自己的文生视频(Text-to-Video)模型时,最先遇到的拦路虎往往不是算法本身,而是数据。高质量、多样化、带标注的视频数据从哪里来?版权如何处理?爬虫如何绕过反爬?标注效率如何提升?这些问题每一个都足以让一个研究团队耗费数月精力。
OpenVideo 正是为解决这些痛点而生。这是一个专注于文生视频领域的数据集开源项目,由 UmiMarch 团队发起,旨在为全球 AI 研究者提供高质量、多样化的视频数据集,并配套完整的数据采集、清洗、标注工具链。

图 1:OpenVideo 项目 Logo(图源:项目 GitHub 仓库)
OpenVideo 项目创立于 2024 年 3 月,由"李白人工智能实验室"提供服务器与资金支持,HuggingFace、ModelScope、OpenDataLab 提供存储与海外专线。
从 README 的贡献者名单可以看出,这是一个高度社区化协作的项目:爬虫算法、数据来源、数据清洗、Prompt 设计、模型打标、人工校验等环节均有数十位贡献者参与。这种大规模协作的模式在中国开源社区中并不常见,显示出项目发起者较强的社区运营能力。
项目目前主要通过三个平台发布数据集:ModelScope(魔搭)、HuggingFace 和 OpenDataLab,覆盖了国内外主流的 AI 数据平台,体现了明确的国际化分发策略。
OpenVideo 目前公开的数据集来源为 Pexels-Raw,这是一个从 Pexels 免费视频平台采集的原始视频数据集,规模如下:
| 来源 | 分辨率 | 时长 | 视频片段数 |
|---|---|---|---|
| Pexels-Raw | 720p | 672小时 | 106,000+ clips |
672 小时的视频内容,106,000+ 视频片段——这个规模对于训练文生视频模型来说已经相当可观。数据集以 Parquet 格式存储,通过 ModelScope 或 HuggingFace 托管。下载后需要使用项目提供的脚本解压:
python ./openvideo/video/preprocess/utils/decode_parquet_file.py --parquet_dir your_parquet_path --save_dir your_save_path
需要注意的是,数据集的下载需要认证 Token,用户需要在 Pexels 官网注册开发者账号获取 API Key 后才能使用。此外,数据集遵循 CC-BY-4.0 许可协议,商用前需确认合规。
OpenVideo 不仅仅是一个数据集仓库,更是一套完整的视频数据工具链。项目提供了多个 Python 工具,覆盖了数据生命周期的各个环节。
项目内置了对三大主流免费视频平台的支持:
Mixkit 平台(无需登录):
from openvideo.video.fetch import MixkitVideoFetch
mixkit_fetch = MixkitVideoFetch(root_dir="your/video/save/path")
mixkit_fetch.download_with_category_page_idx(
category="sky",
page_idx=1,
start_idx=22,
platform="linux"
)
Pexels 平台(需要 API Key):
from openvideo.video.fetch import PexelsAPI, PexelsVdieoFetch
pexels_api = PexelsAPI(api="your/pexels/api", save_path="pexels_api.npy")
pexels_api.fetch_api(start_page=1, end_page=2, save_api_dict_every_pages=1)
pexels = PexelsVdieoFetch("pexels")
pexels.download(api_npy_save_path="pexels_api.npy", chrome_exe_path="your/chrome/exe/path", headless=False)
Pixabay 平台(需要账号密码,通过 Selenium 模拟登录):
from openvideo.video.fetch import PixabayVideoFetch
pixabay = PixabayVideoFetch("your/video/save/path")
pixabay.download(chrome_exe_path="your/chrome/exe/path", username="...", password="...", platform="windows")
这些工具的本质是封装了各平台反爬策略的自动化爬虫,使用 aiohttp 实现异步并发下载,配合 Selenium 处理需要登录的页面,tqdm 显示进度条。对于需要批量采集视频数据的研究团队,这套工具链可以直接复用。
采集到的原始视频还需要经过场景分割处理才能用于训练。项目使用了 ImageBind 多模态模型对视频进行语义分析,结合 scenedetect 库做镜头检测,将长视频切分为语义连贯的短片段。
此外还包含:
最值得关注的创新是团队开发的视频标注平台,部署在 HuggingFace Spaces 上,基于 Rust 语言构建,号称每秒可处理 100 次查询,任务处理能力可扩展至 2 亿次。

图 2:GPT4o-Azure-Caption 标注平台,支持调用 GPT-4o、Gemini、Claude3 等多模型(图源:项目 GitHub 仓库)
该平台支持调用 GPT-4o、Gemini、Claude3 等当前最先进的 VLM 模型来自动生成视频描述(Caption),配合 100 个 API 账号,8 小时内可合成包含 20 万条视频的数据集。
项目还提供了配套的标注校验平台,允许人工审核和修改 AI 生成的标注结果:

图 3:AIL-Caption 标注校验平台,支持视频播放与标注查看修改(图源:项目 GitHub 仓库)
针对国内访问 HuggingFace 不稳定的问题,团队还开发了 HF_To_MS 数据迁移平台,可以在后台将 HuggingFace 上的数据集迁移到 ModelScope:

图 4:HuggingFace 到 ModelScope 数据迁移平台界面(图源:项目 GitHub 仓库)
openvideo/
├── api/ # HuggingFace/ModelScope API 封装
├── pkg_extend/ # 第三方工具安装辅助
├── utils/ # 下载/压缩/MD5 通用工具
└── video/
├── base/ # 基类定义
├── fetch/ # 视频采集(Mixkit/Pexels/Pixabay)
└── preprocess/
├── KeyFrame/ # 关键帧提取
├── PreProcess/ # 图像质量评估
└── SceneSplitting/ # 场景分割(ImageBind)
| 依赖 | 用途 |
|---|---|
aiohttp + async_timeout | 异步 HTTP 请求,并发下载 |
moviepy | 视频处理(裁剪、转码) |
opencv-python | 图像处理与视频分析 |
selenium | 浏览器自动化(登录态爬虫) |
scenedetect | 镜头检测与场景分割 |
huggingface_hub | HuggingFace 数据集下载 |
ImageBind | 多模态特征提取 |
bs4 | HTML 解析 |
整体来看,这是一个纯 Python 数据工程类项目,不涉及模型训练代码,更多是工程化的数据处理管道。
项目采用 Mulan PSL v2 许可证(setup.py 中声明),数据集采用 CC-BY-4.0。使用 Pexels/Pixabay 视频数据时,必须遵守各平台的服务条款。
pip install openvideo
# 或安装最新版
pip install -U https://github.com/UmiMarch/OpenVideo/archive/master.zip
一键部署支持度:不支持
1. 数据集规模相对有限
目前公开的 Pexels-Raw 数据集虽然有 672 小时、10.6 万条视频,但与商业视频数据集相比规模仍然偏小。
2. License 合规风险
数据集采用 CC-BY-4.0,使用前务必确认各视频的原始版权状态。
3. Selenium 爬虫的维护成本
Pexels/Pixabay 等平台的反爬策略更新频繁,爬虫代码可能需要频繁维护更新。
4. 仅支持 Pexels 一个数据源
目前实际可用的数据源仅 Pexels 一个,Mixkit 和 Pixabay 的工具虽已集成但依赖平台账号。
OpenVideo 的出现填补了中文开源社区在文生视频数据领域的空白。相比于英文社区丰富的视频数据集(如 WebVid、HD-VILA-100M),中文社区此前缺乏高质量的开源替代方案。
从更长远的角度看,OpenVideo 的工具链思路——不仅仅是提供数据集,而是提供完整的数据采集→清洗→标注→分发管道——代表了 AI 数据基础设施的发展方向。
目前项目 stars 117,虽然绝对数量不高,但考虑到这是一个高度垂直的数据工具项目,且背后有活跃的社区贡献者生态,其实际影响力可能远超数字本身所反映的水平。
第一步:安装
pip install openvideo
第二步:下载数据集(任选一种)
# 从 HuggingFace
git clone https://user_id:access_token@huggingface.co/datasets/OpenVideo/pexel-0808-complete-final-test
# 从 ModelScope
git clone https://user_id:access_token@www.modelscope.cn/datasets/OpenVideo/pexel-0808-complete-final-test.git
第三步:使用在线标注平台 直接访问 https://huggingface.co/spaces/OpenVideo/GPT4o-Azure-Caption-Pixel 体验 AI 辅助标注。
第四步:标注校验平台 访问 https://huggingface.co/spaces/OpenVideo/AIL-Caption-lalala-Dup 进行人工校验。
本文档由 Hermes Agent 自动生成,分析时间 2026-08-04。