VideoCaptioner
基于 LLM 的视频字幕全流程工具,语音识别+翻译+优化+配音+烧录一条龙
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于 LLM 的视频字幕全流程工具,语音识别+翻译+优化+配音+烧录一条龙
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你是否曾为一段外语视频配字幕而头疼?逐句听写、校对时间轴、翻译润色……一套流程下来,一个 10 分钟的视频往往要花上两三个小时。对于经常需要消化外网资讯的内容创作者、外语学习者乃至专业字幕组来说,这几乎是日复一日的"苦力活"。
VideoCaptioner(卡卡字幕助手)的出现,正是为了把这份重复劳动压缩到最低。这个由个人开发者 @WEIFENG2333 维护的开源工具,凭借 14750+ GitHub Stars 的高人气,已成为中文互联网最受欢迎的 AI 字幕处理工具之一。它以本地 Python 包为载体,同时提供命令行(CLI)和图形桌面版(GUI),让普通用户无需写代码也能用上 AI 加持的字幕全流程自动化。

图1:VideoCaptioner 桌面版界面(来源:Appinn)
VideoCaptioner 的诞生折射出一个真实需求:随着 B 站、YouTube 等视频平台的爆发式增长,内容本地化(即为外语视频配上本地语言字幕)需求急剧扩大。传统方案依赖专业字幕软件(如 Aegisub)+ 人工听写,效率低下且门槛较高。
作者 WEIFENG 在反复处理外网技术视频时发现了这一痛点,于2023年左右开始动手开发。工具最初聚焦于"语音识别(ASR)转字幕"这一单点能力,后来逐步扩展到字幕优化、大模型翻译、配音合成、视频烧录等完整链路,最终形成了今天的一站式解决方案。项目采用 GPL-3.0 开源协议,代码完全开放,在 GitHub 上持续维护。
VideoCaptioner 提供了 8 大核心命令,覆盖从视频输入到字幕输出的完整生命周期:
1. 语音转字幕(transcribe)
这是整个工具的入口。支持多种 ASR 引擎:
2. 字幕翻译(subtitle)
支持三种翻译方式:
3. 字幕优化(llm)
用大模型对原始 ASR 结果进行去口语化、补全标点、分段优化等处理,大幅提升可读性。
4. 配音合成(dub)
根据字幕自动生成配音音轨或配音视频,支持微软 Edge-TTS 引擎,中英文均可用。
5. 视频字幕烧录(synthesize)
将字幕(软字幕 SSA/ASS 或硬字幕)烧录到视频中输出,支持多种样式自定义。
6. 全流程处理(process)
一条命令串联"转录 → 优化 → 翻译 → 合成"四步,适合想要一键搞定的用户。
7. 在线视频下载(download)
支持 YouTube、B 站等平台的视频下载,集成 yt-dlp。
8. GUI 桌面版
无需记忆命令,打开图形界面点点鼠标即可完成所有操作,对非技术用户极其友好。

图2:VideoCaptioner 操作流程界面(来源:Appinn)
从代码结构来看,VideoCaptioner 采用了清晰的模块化分层设计:
videocaptioner/
├── cli/ # 命令行入口,commands/ 下分模块
├── core/
│ ├── asr/ # 多种 ASR 引擎适配层
│ ├── llm/ # 大模型 API 调用封装
│ ├── translate/ # 翻译服务
│ ├── optimize/ # 字幕优化
│ ├── split/ # 字幕断句
│ ├── subtitle/ # 字幕格式处理
│ ├── tts/ # 文字转语音
│ ├── dubbing/ # 配音合成
│ └── speech/ # 音频处理
├── ui/ # PyQt5 GUI 桌面版
└── resources/ # 字体、字幕样式、多语言资源
核心技术栈:
值得注意的是,项目引入了 edge-tts 实现配音功能——这是微软 Azure 的免费 TTS 服务,中文支持较好,为用户省去了付费成本。
VideoCaptioner 的安装非常简单:
pip install videocaptioner
videocaptioner # 直接运行打开 GUI
免费功能(必剪识别 + 必应翻译)无需配置任何 API Key,安装后立即可用。进阶功能(大模型翻译/字幕优化)只需配置一个 OpenAI 兼容接口的 API Key,支持 SiliconCloud、DeepSeek、VideoCaptioner 中转站等服务商。
局限: GUI 依赖 PyQt5 和 PyQt-Fluent-Widgets,在 Linux 环境下安装 GUI 版本可能面临 Qt 依赖问题。项目没有提供 Dockerfile 或 docker-compose,意味着没有标准的容器化部署方案——对于需要在服务器上批量处理视频的用户来说,这是最大的部署障碍。不过,由于核心处理逻辑均为 Python 代码,理论上可以通过 pip 安装 + 无头模式(headless)实现自动化批处理。
VideoCaptioner 代表了一个趋势:AI 原生工具的本地化落地。不同于需要翻页的网页服务,它以 pip 包的形式分发,用户数据留在本地(无需上传视频),在隐私敏感场景下尤为适用。
从 GitHub Stars 增长曲线来看,该项目在 2024-2025 年间增长迅猛,已成为中文技术社区中字幕处理类工具的标杆。它的成功印证了"聚焦单点痛点 + 完整链路覆盖 + 低门槛 UI"这一产品组合的有效性。随着多模态大模型能力的提升,未来视频理解+字幕生成的端到端方案值得期待。
项目信息: GPL-3.0 开源 | Python | 主要语言:中文/英文文档 | Star: 14750+ | Fork: 1218+