autoclip_mvp
AI 自动分析视频字幕,智能提取高光片段并生成可传播的短视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI 自动分析视频字幕,智能提取高光片段并生成可传播的短视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在 B 站创作生态中,如何从一部几十分钟的长视频中精准提取出最能引发共鸣的高光片段,是每一位内容创作者都头疼的问题。手动逐帧回看、反复拖进度条、反复截取……这套流程不仅耗时,而且主观性强,容易遗漏真正有价值的内容。AutoClip 正是为解决这一痛点而诞生的 AI 视频切片工具——它能自动分析视频字幕、理解内容结构、评估每个片段的传播潜力,最终输出一批经过 AI 打分排序的高质量切片和合集视频。
AutoClip 由独立开发者 zhouxiaoka 开发并开源(MIT License),GitHub 仓库已积累超过 970 颗星、173 个 Fork,项目持续活跃维护,Issues 保持在 13 个左右。这名开发者专注于 AIGC(AI 生成内容)工具链,AutoClip 是其围绕视频二创场景构建的核心产品。
从项目的话题标签(ai-video-editing、auto-highlight、llm、video-editing)可以看出,这是一个将大语言模型能力引入传统视频剪辑流程的跨界项目。项目灵感来源于 B 站 up 主的实际工作流——他们经常需要将长视频拆分成若干短视频片段用于分发,但纯手工方式效率极低。AutoClip 将这套工作流 AI 化,用通义千问(Qwen)模型替代人工判断,实现"上传视频 → AI 分析 → 自动出切片"的全链路自动化。
AutoClip 的核心是一个精心设计的六步处理流水线,每一步职责清晰,模块之间通过 JSON 元数据文件串联,天然支持断点续跑和步骤级别的参数调优:
Step 1 · 大纲提取(Outline):输入 SRT 字幕文件后,TextProcessor 解析时间轴信息,将长视频按约 30 分钟一块进行智能分块(避免单次 LLM 调用 token 溢出)。每块内部调用通义千问,从转写文本中提取结构化大纲——即识别出视频讨论了哪些主题、各主题的起止时间。
Step 2 · 时间轴规划(Timeline):在已提取的大纲基础上,细化每个主题的精确时间边界,输出带时间戳的「话题列表」,同时为每个话题分配固定 ID(便于后续步骤追踪)。
Step 3 · 内容评分(Scoring):这是 AutoClip 的核心智能所在。评分器按块批量调用 LLM,综合评估四个维度:信息价值(内容是否有独特见解)、情感共鸣(能否引发观众强烈情绪反应)、传播潜力(是否有"金句"或易传播的梗)、结构完整性(逻辑是否清晰有始有终)。最终每个话题得到一个 0.0~1.0 的 final_score,并附带一句 AI 生成的推荐理由。
Step 4 · 标题生成(Title):对评分靠前的切片,由 LLM 基于内容上下文自动生成吸引点击的短视频风格标题,配合 outline(主题概述)和 content(子话题要点),形成完整的切片元数据。
Step 5 · 主题聚类(Clustering):将语义相近的切片归并为合集(Collection),AI 自动为合集生成标题和摘要,支持手动编辑(拖拽排序、增删片段)。
Step 6 · 视频生成(Video):调用 FFmpeg 批量切割原始视频文件,输出 MP4 切片和合集视频,完成物理层面的文件生成。
整个流水线采用项目制管理:每个视频处理任务对应一个独立项目(Project),元数据存储在 output/metadata/ 目录,JSON 文件完整记录每一步的输入输出,可随时恢复任意步骤重新执行。配置层面支持 8 种视频分类(知识科普、商业财经、观点评论、经验分享等),每类对应独立 Prompt 模板,适配不同内容风格。
后端基于 FastAPI + Uvicorn,提供 RESTful API 和交互式 Swagger 文档(/docs),支持文件上传(视频/字幕)、项目状态轮询、切片/合集的 CRUD 操作。LLM 调用层支持**通义千问(DashScope)和硅基流动(SiliconFlow)**两套 API,工厂模式(LLMFactory)动态切换,无需修改业务代码。
前端采用 React 18 + TypeScript + Ant Design 5,引入 react-beautiful-dnd 实现切片拖拽排序,react-player 内嵌视频预览,zustand 状态管理,react-router-dom 路由控制,整体体验接近专业 SaaS 产品。前端界面包含项目列表、上传处理、切片管理、合集编辑、设置页面等完整页面栈。
视频下载方面,项目内置 BilibiliDownloader,基于 yt-dlp 实现 B 站视频的自动下载和字幕提取,创作者可以直接输入 B 站链接,工具自动完成"下载 → 字幕 → 切片的全流程,无需本地存有视频文件。
AutoClip 在部署体验上下了相当大的功夫。项目根目录包含多阶段构建 Dockerfile(Node 18 构建前端 + Python 3.11-slim 运行后端,内置 FFmpeg、curl),docker-compose.yml(开发配置,2GB 内存)和 docker-compose.prod.yml(生产配置,端口 80,4GB 内存)。配套的 docker-deploy.sh 傻瓜式部署脚本,执行后访问 http://localhost:8000 即可使用,Docker Compose 内置 30 秒间隔健康检查。
唯一需要用户手动配置的只有 API Key(.env 文件),其余全部自动化。这对于没有 Docker 经验的普通创作者非常友好。
AutoClip 同样存在一些局限性值得关注:依赖外部 LLM API——项目本身不包含任何模型权重,所有分析能力完全依赖通义千问或硅基流动 API,运行时会产生 API 调用费用。对字幕文件强依赖——缺少字幕时无法运行,尽管内置了 B 站字幕自动提取能力,但部分老视频或直播录屏无法直接处理。FFmpeg 切割精度——在 GOP 间隔较大的编码下,切片起止时间可能存在秒级误差,这是所有软件级切割工具的通病。B 站下载限制——B 站对部分付费内容有下载限制。
AutoClip 代表了一个正在快速扩张的赛道——AI 视频二创工具链。随着抖音、B 站、视频号等平台的短视频分发需求爆发,长视频拆短、批量生成内容的效率工具成为刚需。AutoClip 的六步流水线设计思路清晰,可扩展性强,未来可以探索的方向包括:接入多模态模型实现"视频帧 + 字幕"联合分析、支持字幕自动生成(Whisper 集成)、支持更多平台(YouTube、TikTok)的视频下载,甚至将流水线改造为 MCP 协议的工具包,嵌入更大的 AI Agent 工作流。
截至目前,该项目已获得 970+ GitHub Stars,在中文 AI 视频工具领域属于头部开源方案。随着 AIGC 视频生态持续火热,这类工具的商业化和生态扩展空间值得期待。