claude-video-vision
让 Claude 直接「看懂」视频的 Claude Code MCP 插件,集成 ffmpeg 帧提取 + 多后端音频转录
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让 Claude 直接「看懂」视频的 Claude Code MCP 插件,集成 ffmpeg 帧提取 + 多后端音频转录
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
video_analyze 工具提供了 ffmpeg 过滤器分析能力,可以检测场景切换、静音区间、运动剧烈程度、模糊度、曝光等视频特征。Claude Code 在正式提取帧之前,会先调用 video_analyze 分析视频结构,制定最优的提取策略——这一步对长视频尤为关键。### 第二层:音频处理(多后端支持)音频处理是插件的第二个核心能力,支持三种后端灵活切换:Gemini API(推荐):利用 Gemini 原生的语音事件识别能力,可以区分语音内容和非语音声音(如掌声、敲门声)。免费层每日 1500 请求,适合大多数个人用户。仅需配置 GEMINI_API_KEY 环境变量。本地 Whisper(完全免费,离线可用):支持 whisper.cpp 或 Python 版 openai-whisper。首次使用时,Whisper 模型(如 tiny/base/small/medium/large-v3)会自动下载到 ~/.claude-video-vision/models/ 目录。在 macOS 上只需 brew install whisper-cpp 即可,零 API 费用。OpenAI Whisper API(付费,按量计费):适合已有 OpenAI API 账户的开发者。三种后端输出的转录文本均带时间戳标注,Claude 在分析视频时能够将语音内容与视觉画面精确对齐。### 第三层:YouTube 深度集成插件对 YouTube URL 提供了开箱即用的支持。传入 YouTube 链接后,MCP 服务器自动调用 yt-dlp 下载视频,同时利用 YouTube 自带字幕资源:优先使用官方字幕,其次是自动字幕,最后才降级到音频后端处理。字幕来源会在结果中标记(youtube_subtitles / youtube_auto_captions),Claude 可以据此调整对内容的信任权重。## 使用体验:从安装到分析的全流程安装过程极度简洁,无需任何构建步骤。在 Claude Code 中执行两条命令即可完成:/plugin marketplace add https://github.com/jordanrendric/claude-video-vision/plugin install claude-video-vision首次使用时 MCP 服务器通过 npx claude-video-vision@latest 自动从 npm 安装。安装完成后,运行交互式配置向导 /setup-video-vision,插件会引导用户选择音频后端、配置 Whisper 引擎、验证 ffmpeg 和 yt-dlp 依赖是否就绪。使用方式分为两种:斜杠命令和自然语言交互。斜杠命令适合精确控制:/watch-video path/to/video.mp4/watch-video tutorial.mp4 "what language is used in this tutorial?"/watch-video https://www.youtube.com/watch?v=... "summarize this video"自然语言交互则更灵活——只需在对话中提到视频文件路径或 YouTube 链接,Claude 会自动检测并启动分析流程。Claude 会根据对话内容推断时间范围和分辨率需求。## 技术架构:TypeScript + MCP 标准从代码结构来看,这是一个典型的 TypeScript MCP Server 项目。核心技术栈如下:| 组件 | 技术选型 | 说明 ||------|---------|------|| 运行时 | Node.js >= 20 | 最低要求 20,原生 ESM 模块 || 开发语言 | TypeScript | 完整类型注解,构建产物为 dist/index.js || MCP SDK | @modelcontextprotocol/sdk ^1.12.0 | Anthropic 官方 MCP 协议实现 || 数据验证 | Zod ^3.24.0 | schema-first 类型校验 || 音频转录 | Whisper.cpp / Gemini API / OpenAI Whisper | 三选一,灵活切换 || 视频处理 | ffmpeg | 帧提取和视频分析 || 包管理 | npm | MCP 服务器通过 npm 发布,可 npx 启动 |源码目录结构清晰:mcp-server/src/├── index.ts # 入口,MCP 服务器启动点├── config.ts # 配置管理├── types.ts # TypeScript 类型定义├── backends/ # 音频处理后端(Whisper/Gemini/OpenAI)├── extractors/ # 视频帧提取逻辑├── tools/ # MCP 工具实现(video_watch 等)├── session/ # 会话管理(缓存、生命周期)└── utils/ # 工具函数项目配置存储在 ~/.claude-video-vision/config.json,支持细粒度调整:帧格式(jpeg/png/webp)、默认帧率、帧分辨率、最大帧数、Whisper 模型选择等。Claude Code 的 Skill 文件(skills/video-perception)负责将用户指令路由到正确的 MCP 工具,并规范 Claude 的帧提取决策流程。## 局限与争议作为一个相对年轻的项目(v1.0.0 初始发布),Claude Video Vision 在某些方面仍有改进空间。帧率控制的精度问题:虽然 Claude 会根据对话内容推断最优帧率,但对于极其快速的视觉变化(如高速动画、体育赛事),自动推断可能不够精准,需要用户手动指定 --fps 参数。这对非技术用户存在一定门槛。长视频处理成本:Gemini API 的免费层每日 1500 请求,对普通用户够用,但若频繁分析长视频(每分钟视频产生大量音频段),配额消耗较快。本地 Whisper 虽然免费,但对内存有要求,large-v3 模型需要约 10GB RAM。无 Web UI:作为纯 Claude Code 插件,该工具没有独立的图形界面或 API 服务端点,无法直接集成到其他不支持 Claude Code 的工作流中。这是设计取舍——作者选择深度嵌入 Claude Code 而非做一个通用视频分析服务。## 行业意义与生态定位Claude Video Vision 的出现,折射出一个更大的趋势:AI 工具正在从「文本处理」向「多模态感知」快速演进。在 Claude Code 的生态中,代码编辑器已经从单纯的文本编辑器升级为能够理解屏幕内容、对话上下文的智能开发环境——而视频理解是这个进化的下一个里程碑。从 GitHub 热度来看,项目上线后在极短时间内突破 800+ stars(作者仅一人),说明开发者社区对「AI 理解视频」这一能力有强烈需求。结合 MCP 协议的可扩展性,未来完全可能出现更多类似的感知层插件——音频分析、PDF 文档理解、实时屏幕录制解析……Claude Code 有潜力成为一个真正的多模态开发助手,而 Claude Video Vision 正是这个方向上的第一个标杆。