video-use

让 AI 代理像读文档一样读视频,对话式完成视频剪辑

Stars24.6k
Forks3.0k
主语言skill
分类SKILLS
作者browser-use
LicenseMIT

预览

详细介绍

Video-Use 是由开源 AI 代理工具 browser-use 官方团队发起并持续维护的智能视频编辑技能,核心定位是“让代码代理像读文档一样读视频,像人类剪辑师一样理解内容、精准编辑”——它不满足于做一份通用的 ffmpeg 命令封装或零散的剪辑脚本集合,而是将精确转录与语义理解、双层信息摄入(文本转录 + 按需视觉复合)、自动剪辑决策、多风格调色、字幕烧录、动画生成、自评估闭环、会话记忆持久化等 10+ 项核心能力整合于一套完整的 AI 技能体系中,全部配有 SKILL.md 一键安装、helpers/ 目录下的生产级剪辑脚本、project.md 跨会话记忆文件以及 MIT 开源协议。市面大多 AI 视频编辑工具要么是依赖视觉模型逐帧分析的“暴力美学”(成本高、速度慢),要么是预设模板式的傻瓜剪辑(缺乏灵活性)——但很少有项目能将“文本驱动的精准理解”与“代理自主的灵活编辑”同时做到,Video-Use 解决的正是这个问题。

一、Video-Use 是什么

Video-Use 采用“技能文件 + 双层信息摄入 + 自动剪辑流水线”三位一体的使用体验,通过 GitHub 完全开源发布,采用 MIT 许可证。项目由 browser-use 官方团队发起并持续维护,核心定位是“用代码代理编辑视频”——100% 开源,只需将原始素材放入文件夹,与 Claude Code 对话,即可获得 final.mp4。项目提供 install.md 一键安装指南,支持 Claude Code、Codex、Hermes、OpenClaw 等任意具备 shell 权限的代理。项目还提供 Browser Use Cloud 在线体验和 Browser Use Box 自托管方案。

Video-Use 的运作机制与市面常见的“视觉模型暴力分析”或“预设模板剪辑”有本质区别。它不是让 AI“看”视频每一帧,而是让 AI“读”视频——通过两层信息摄入,为代理提供精准剪辑所需的一切。第一层:音频转录(始终加载)——一次 ElevenLabs Scribe 调用即可为每个素材提供词级时间戳、说话人分离和音频事件(笑声、掌声、叹气等)。所有素材压缩进一个约 12KB 的 takes_packed.md 文件,这是代理的主要阅读视图。第二层:视觉复合(按需调用)——timeline_view 可为任意时间范围生成“胶片条 + 波形图 + 文字标签”的 PNG 图像,仅在决策点(模糊停顿、重拍对比、切点合理性检查)调用。常规做法:30,000 帧 × 1,500 tokens = 4500 万 tokens 的噪音;Video-Use:12KB 文本 + 少量 PNG。同 browser-use 给 LLM 提供结构化 DOM 而非截图一样——但这次是视频。

二、Video-Use 能做什么

Video-Use 的核心能力可以精炼地概括为:读、判、剪、评、记,围绕这五大维度提供了从素材到成片的完整路径,覆盖 AI 辅助视频编辑的全方位需求,具体包括:

精确转录与语义理解(读) ——不是“逐帧看画面”,而是“读转录文本理解内容”。系统通过 ElevenLabs Scribe 为每个素材生成词级时间戳、说话人分离和音频事件标注。所有素材被打包进一个约 12KB 的 takes_packed.md 文件,包含每一段素材的时长、短语数量、具体说话内容和时间戳。代理无需“观看”视频,只需“阅读”转录即可理解每一段素材的内容、节奏和结构。

按需视觉复合与高效决策(判) ——不是“每帧都分析”,而是“只在需要时看图”。timeline_view 仅在决策点调用——模糊停顿、重拍对比、切点合理性检查——生成胶片条 + 波形图 + 文字标签的复合图像。常规方法需要处理 30,000 帧 × 1,500 tokens = 4500 万 tokens 的视觉噪音,Video-Use 只需 12KB 文本 + 少量 PNG。这种“文本为主、视觉为辅”的设计,让视频编辑的成本和速度从“不可用”变为“生产可用”。

自动剪辑与内容重组(剪) ——不是“套用模板”,而是“基于理解做决策”。系统自动完成:剪掉填充词(umm、uh、错误开头)和拍摄间隙的死空间;自动调色——暖电影感、中性冲击或任意自定义 ffmpeg 链;30ms 音频淡入淡出——每次剪辑处平滑过渡,杜绝爆音;烧录字幕——默认 2 词大写块,完全可定制;生成动画叠加层——通过 HyperFrames、Remotion、Manim 或 PIL 生成,每个动画由并行的子代理独立生成。剪辑流水线遵循“询问 → 确认 → 执行 → 自评估 → 持久化”的设计原则,永远不在获得策略批准前触碰剪辑。

自评估闭环与质量保障(评) ——不是“剪完就交”,而是“审完再交”。系统在每次剪辑边界对渲染输出运行 timeline_view 进行自评估——捕捉视觉跳变、音频爆音、隐藏字幕等问题。用户只有在通过自评估后才看到预览。剪辑流水线包含自评估循环:转录 → 打包 → LLM 推理 → EDL → 渲染 → 自评估 → 如有问题则修复并重新渲染(最多 3 次)。

会话记忆持久化(记) ——不是“每次从零开始”,而是“上次停在哪,这次从哪继续”。系统在 project.md 中持久化会话记忆,下周的会话可以从上次停下的地方继续。这种“跨会话状态保持”的设计,让长期视频项目的编辑工作可以分阶段进行,无需重复建立上下文。

三、Video-Use 适合谁用

Video-Use 的内容设计使其适配各类希望通过 AI 代理自动化视频编辑流程的内容创作者与开发者,核心聚焦那些“剪辑软件太复杂、手动剪辑太耗时、AI 视频工具要么太贵要么太笨”,希望从“手动剪辑”升级为“对话式智能剪辑”的人群,主要涵盖以下几类:

视频内容创作者与自媒体人——日常需要产出 talking-head 视频、教程、旅行 vlog、访谈等,希望用对话方式完成粗剪——去填充词、调色、加字幕、加动画,而非在 Premiere 或 Final Cut 中手动逐帧操作。Video-Use 适合 talking-head、montage、教程、旅行、访谈等任何内容类型——无需预设或菜单。

AI 编码代理的重度使用者——已经在用 Claude Code、Codex、Hermes、OpenClaw 等代理进行日常开发,希望将视频编辑也纳入 AI 辅助工作流。Video-Use 作为代理技能,让“在聊天中完成视频剪辑”成为原生体验。

独立开发者与一人公司实践者——需要为产品制作演示视频、营销素材,但没有专职视频编辑团队。Video-Use 的“丢素材进文件夹 → 对话 → 出片”模式,让视频制作从“专业门槛”降为“对话即可”。

希望从“手动剪辑”升级为“智能剪辑”的视频从业者——熟悉传统剪辑软件但希望用 AI 提升效率,减少重复劳动(剪填充词、调色、加字幕)。Video-Use 的自动剪辑流水线将数小时的粗剪工作压缩到对话级交互。

自托管与隐私优先的用户——对视频素材有隐私要求,不希望上传到云端处理。Video-Use 完全开源、支持自托管,所有处理可在本地或自有 VPS 上完成。

四、Video-Use 的应用场景是什么

基于其内容设计与定位,Video-Use 的应用场景主要围绕视频粗剪与精剪、多素材整合、批量视频处理和自动化内容生产,覆盖从个人创作到规模化生产的多个场景,具体包括:

Talking-head 视频快速粗剪场景——创作者录制了多段 talking-head 素材,需要去除 umm/uh、剪掉空白、统一调色、加上字幕。Video-Use 提供了一条“将素材放入文件夹 → 与代理对话‘把这些剪成一个发布视频’→ 代理清点素材、提出策略、等待确认 → 输出 edit/final.mp4”的完整路径。

多段素材整合与内容重组场景——拍摄了多个角度的访谈或不同场景的 b-roll,需要按内容逻辑重新组织。代理通过读取转录理解每段素材的内容,基于语义而非时间顺序进行重组。

教程与演示视频制作场景——需要为产品功能录制教程视频,希望添加动画标注、高亮区域或分步字幕。Video-Use 通过 HyperFrames、Remotion、Manim 或 PIL 生成动画叠加层,每个动画由并行的子代理独立生成。

批量视频处理与规模化内容生产场景——需要批量处理大量视频素材(如每日播客剪辑、课程视频分段)。Video-Use 的会话记忆持久化(project.md)让长期项目可以分阶段进行。通过 Browser Use Box 可部署在 VPS 或 Telegram 上实现始终在线的自动剪辑。

调色风格探索与批量应用场景——需要为一批视频统一调色风格。Video-Use 支持暖电影感、中性冲击或任意自定义 ffmpeg 链的自动调色。

五、Video-Use 为什么值得关注

Video-Use 之所以值得关注,核心在于它将“AI 视频编辑从暴力视觉分析或预设模板升级为文本驱动、按需视觉、代理自主的智能剪辑流水线”,并具备“文本优先的高效信息摄入、自评估闭环、跨会话记忆、完全开源”的独特价值,具体体现在以下几点:

从“暴力视觉分析”到“文本驱动理解”的效率革命。大多数 AI 视频工具的做法是让模型“看”视频——逐帧分析、逐帧理解。一段 1 分钟视频 = 30,000 帧 × 1,500 tokens = 4500 万 tokens 的噪音。Video-Use 的做法是让 AI“读”视频——通过 ElevenLabs Scribe 将音频转为词级时间戳文本,所有素材压缩进约 12KB 的 takes_packed.md。常规方法需要处理 4500 万 tokens,Video-Use 只需 12KB 文本 + 少量 PNG。这种“文本优先、视觉按需”的设计,将视频理解的成本从“不可用”降到了“可负担”。

从“黑盒剪辑”到“可解释决策”的透明流水线。大多数 AI 剪辑工具是“输入素材 → 输出成片”的黑盒——你不知道它为什么这样剪、依据是什么。Video-Use 的流水线是完全透明的:转录 → 打包 → LLM 推理 → EDL(编辑决策列表)→ 渲染 → 自评估。代理在每次剪辑前提出策略、等待用户确认。用户可以审查 EDL、理解每一个剪辑决策的依据、在必要时干预。

从“一次性的”到“跨会话记忆”的长期项目支持。大多数 AI 工具是“无状态”的——每次对话从零开始。Video-Use 在 project.md 中持久化会话记忆,下周的会话可以从上次停下的地方继续。这种“跨会话状态保持”的设计,让复杂的视频项目可以分阶段完成,无需重复建立上下文。

“12 条硬规则 + 艺术自由”的设计哲学。Video-Use 的设计原则中有一条至关重要的声明:“12 条硬规则,其余地方保留艺术自由。生产正确性不可妥协,品味不是。”这意味着系统在技术正确性上零容忍——音频不能爆音、字幕不能错位、剪辑不能跳——但在创意决策上给予代理充分的自由度。这种“硬规则保底线、自由发挥保上限”的设计,让 Video-Use 既不会产出技术上不合格的废片,也不会扼杀创作者的风格表达。

browser-use 团队官方出品 + 开源 MIT。Video-Use 不是个人开发者的周末项目,而是开源 AI 代理工具 browser-use 官方团队发起和维护的技能。browser-use 是 AI 代理浏览器自动化领域的标杆项目,其团队在“让 AI 代理理解复杂环境”方面有深厚积累——Video-Use 正是将同样的理念从“浏览器 DOM”迁移到了“视频转录 + 按需视觉”。项目采用 MIT 许可证,完全开源。

现实挑战与生态成熟度。Video-Use 并非没有短板。首先,核心转录依赖 ElevenLabs Scribe API,用户需要自行获取 API 密钥——这意味着转录质量依赖于第三方服务,且可能产生 API 费用。其次,视频编辑是一个高度依赖“审美判断”的领域——系统可以剪掉填充词、调整色彩、添加字幕,但“什么节奏最好”“什么音乐最配”这类主观判断仍需要人工介入。再次,项目目前主要面向“基于语音内容的视频编辑”(talking-head、访谈、教程等),对于纯视觉内容(如风景 montage、无旁白的艺术视频)的编辑能力有限。