autoclip
AI 自动识别视频高光片段,支持 B站/YouTube 双平台,一键提取精彩时刻
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI 自动识别视频高光片段,支持 B站/YouTube 双平台,一键提取精彩时刻
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
对于长期做视频内容的朋友来说,最耗时的事情往往不是拍视频本身,而是剪辑——看完一两个小时的长视频,找到最精彩的片段,再剪成几条短内容,这个过程可能需要花掉大半天。而 AutoClip 正是为了解决这个问题而生:它让 AI 代替人工,自动完成视频"找高光"的苦活累活。
想象一下,你是一位专注做游戏解说或知识科普的 UP 主,刚录完一期 2 小时的产品评测或游戏实况。面对这 120 分钟的原始素材,传统的做法是你得从头到尾看一遍,手动标记精彩时间点,再一条一条剪出来。AutoClip 的做法是:你只管上传视频,然后去倒杯咖啡,回来时 AI 已经把精彩片段全部提取好了。
这种体验背后,是一套完整的 AI 分析流水线:先用 Whisper 语音识别提取字幕,再把字幕和视频画面特征交给大语言模型(支持通义千问、OpenAI GPT、Google Gemini 等多个提供商),让 AI 判断"这段内容够不够精彩",最后自动切割并生成分段。
AutoClip 的开发者是独立开发者 zhouxiaoka,项目托管于 GitHub(zhouxiaoka/autoclip),采用 MIT 许可证开源,目前 Star 数超过 5500。对于一个个人开发者打造的垂直工具来说,这个数据相当亮眼。项目的核心定位很清晰——做内容创作者(尤其是 B 站 UP 主和 YouTube 创作者)的 AI 剪辑助手,解决"高光提取"和"多平台视频管理"两大需求。
项目支持的视频来源覆盖了国内外的两大主流平台:YouTube 视频下载(通过 yt-dlp)和 B 站视频下载(B站 Cookie 登录态),同时支持本地文件直接上传。这种多源支持让它不局限于某一平台的创作者,适用范围较广。
AutoClip 的功能体系可以分为三个层次:
1. 视频获取层:支持 YouTube URL、B站 URL 和本地文件三种输入方式。B站下载还支持账号 Cookie 导入和密码登录两种认证方案,并内置了账号健康检查和自动重试机制,确保长时间使用不掉线。
2. AI 分析层:这是 AutoClip 的核心能力。用户上传视频后,系统通过 Celery 异步任务队列调度 Whisper 语音识别(自动检测语言),生成带时间戳的 SRT 字幕文件。随后,将字幕 + 视频视觉特征一起发送给大语言模型,由 AI 判断每个片段的"精彩程度得分",最终输出高光时间点列表。
3. 剪辑与合集层:基于 AI 识别的高光片段,用户可以在 Web 界面中手动调整切割点、排序片段、合并生成合集。整个过程在浏览器中完成,实时预览,无需任何本地剪辑软件。开发中的功能还包括字幕可视化编辑和自动上传到 B 站。
AutoClip 采用典型的前后端分离 + 异步任务队列架构:
后端服务层划分清晰:core/ 处理配置/数据库/ Celery 初始化;services/ 承载业务逻辑(clip_service、bilibili_service、whisper_model_manager 等);tasks/ 定义 Celery 异步任务(video.py、processing.py 等);api/v1/ 暴露 REST 端点。前端组件化程度高,按功能拆分为 components/(UI 组件)、pages/(页面)、hooks/(状态逻辑)、store/(全局状态)。
整体代码质量评分可达 80/100:项目文档极为完善(BUILD_GUIDE、DEVELOPER_GUIDE、FAQ、ERROR_HANDLING 等 20+ 篇文档),单元测试覆盖主要服务模块,PR 规范(CONTRIBUTING)和安全策略(SECURITY.md)齐全。但代码中确实存在一些历史痕迹(如多个版本的 celery_app.py 并存、celery_app_fixed.py 等文件),说明项目经历过较长的迭代演进,部分配置文件尚未完全收敛。
AutoClip 提供了三种部署方式,推荐使用 Docker Compose 一键部署。克隆代码库后,只需运行 ./start_autoclip.sh,系统会自动构建镜像并启动四个服务:FastAPI 后端(8000端口)、React 前端(3000端口)、Celery Worker 和 Redis。内存需求约 4GB 以上,磁盘 10GB+(视视频素材大小而定)。
纯 CPU 环境下可以运行,无需 GPU——Whisper 推理和 LLM 调用都在本地 CPU 完成,LLM 实际调用是通过 API 请求远程模型服务(通义千问/OpenAI),不占用本地算力。当然,如果用户自建 Ollama 等本地 LLM 服务,也能接入。
本地开发环境需要 Python 3.8+、Node.js 16+、Redis,手动安装前后端依赖后,通过 uvicorn 和 npm run dev 分别启动前后端服务。
AutoClip 不是一个通用剪辑工具,它有明确的边界:
AutoClip 代表了 AI 在视频内容创作领域的一个细分方向:高光提取自动化。随着 AI 模型能力(尤其是多模态理解)的持续提升,这类工具正在从"辅助参考"进化为"生产级工具"。类似的赛道还有腾讯的"智影"、剪映的"AI 脚本"、以及 YouTube 的自动章节生成,但 AutoClip 的差异化在于它专注于 B站/YouTube 双平台 + 开源自托管这个组合,覆盖了国内创作者无法使用海外工具的痛点。
对于有意深度定制的开发者而言,开源代码的 MIT 许可证提供了充分的二次开发空间——可以接入自己的 LLM 服务商、定制高光评分规则、甚至集成到现有的内容工作流中。
技术标签:Python · FastAPI · Celery · React · TypeScript · Whisper · LLM · yt-dlp
许可证:MIT
作者:zhouxiaoka(christine_zhouye@163.com)
项目地址:https://github.com/zhouxiaoka/autoclip