KrillinAI
一键将视频翻译配音成100种语言,支持抖音/B站/TikTok/YouTube多平台
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一键将视频翻译配音成100种语言,支持抖音/B站/TikTok/YouTube多平台
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:KrillinAI 项目 Logo
想象这样一个场景:你是一位专注于科技领域的 B 站 UP 主,在网上发现了一段非常有价值的英文技术演讲视频,想要分享给国内粉丝——但视频长达 20 分钟,字幕校对费时费力,配音更是天方夜谭。KrillinAI 正是为解决这类痛点而生的。
KrillinAI 由 Krillin AI 团队开发,是一个开源的 AI 视频翻译配音工具。项目名称中的「Krillin」取自龙珠中的克林(战斗力不俗却常被低估的角色),暗合团队「小而美但实用」的理念。项目于 2024 年在 GitHub 开源,迅速获得超过 1 万颗星,在视频本地化工具领域成为最受关注的开源项目之一。
当前出海内容创作者面临着严峻的本地化挑战:YouTube、TikTok 等国际平台的内容想要进入中国市场,需要中文配音;B 站、抖音创作者想要出海,同样需要多语言字幕和配音。传统人工翻译配音成本高达每分钟数百元,而 KrillinAI 通过 LLM(大语言模型)和 TTS(文本转语音)技术的组合,将这一成本压缩到接近于零。
KrillinAI 的核心架构设计非常清晰——将视频翻译配音拆解为四个环节,每个环节均可选择不同的引擎:
| 环节 | 支持引擎 | 说明 |
|---|---|---|
| 视频下载 | yt-dlp | 支持 YouTube、TikTok、B 站等国内外主流平台 |
| 语音转文字 | OpenAI Whisper / faster-whisper / whisper.cpp / WhisperKit / WhisperX / 阿里云 | 覆盖云端 API 与本地开源模型 |
| 文字翻译 | OpenAI / DeepSeek / 通义千问等 OpenAI 兼容 API | 支持 100 种语言双向翻译 |
| 文字转语音 | OpenAI TTS / 阿里云 TTS / Edge TTS | 可选语音克隆 |
代码结构上,项目采用 Go 语言开发,分为 cmd/(命令行入口)、internal/(核心业务逻辑:API、路由、服务处理、存储)和 pkg/(可复用工具包:各 TTS/ASR 引擎封装)三层。pkg 目录下每个子目录对应一种技术方案的实现,例如 pkg/fasterwhisper 封装了 faster-whisper 本地推理,pkg/aliyun 封装了阿里云语音服务。这种设计使得用户可以像「换轮胎」一样灵活切换底层引擎,而无需修改上层业务逻辑。
视频处理流程非常简洁:用户粘贴视频链接(或上传本地文件)→ KrillinAI 自动下载并提取音频 → 切分音频段(默认 5 分钟一段)→ 并发转录 → 并发翻译 → 并发 TTS 合成 → 音视频合成输出。整个流程可通过 Web UI 点点鼠标完成,也可通过命令行脚本化批量处理。
多平台兼容是另一大亮点。配置文件中支持填写抖音、小红书、B 站、视频号、TikTok、YouTube 等平台的视频链接,yt-dlp 会自动识别并下载。输出视频支持横屏(16:9)和竖屏(9:16)两种比例,完美适配不同平台的发布要求。
语音克隆功能通过阿里云 TTS 实现,可以让配音听起来像原视频说话者的音色(需额外配置阿里云密钥)。这比通用的 TTS 音色更自然,观众的沉浸感更强。
在线体验版本托管于 https://www.klic.studio/,用户无需任何配置即可直接试用。这是官方提供的托管版,适合评估体验;正式使用建议自行部署。
图2:KrillinAI Web 界面截图
KrillinAI 提供官方 Docker 镜像 asteria798/krillinai,支持 x86_64、ARM64、ARMv7 三种架构,覆盖从树莓派到高性能服务器的广泛硬件环境。
启动仅需一行命令:
docker run -d \
-p 8888:8888 \
-v /path/to/config.toml:/app/config/config.toml \
-v /path/to/tasks:/app/tasks \
asteria798/krillinai
配置文件 config.toml 中需要填写 LLM API Key(如 OpenAI 或 DeepSeek)和 TTS 密钥。服务器默认监听 127.0.0.1:8888,通过浏览器访问即可使用 Web UI。若需远程访问,将监听地址改为 0.0.0.0 即可。
值得注意的是,若使用 faster-whisper 本地转录模型(约 3GB 权重文件),模型会自动下载到容器内的 /app/models 目录。建议将该目录和数据输出目录 /app/tasks 通过 -v 映射到宿主机,以实现容器重建后模型复用。
适用场景:
当前局限:
KrillinAI 代表了 AI 视频本地化工具的开源化趋势。传统方案如「译制厂模式」依赖专业团队,成本高、周期长;而 KrillinAI 将整个流程开源化、自动化,使得独立创作者也能以极低成本实现多语言内容产出。
从 GitHub Stars 增长曲线看,该项目在 2025 年初迎来快速增长,与全球短视频出海/入海的浪潮高度吻合。随着 LLM API 成本持续下降、TTS 质量不断提升,这类工具的实用性还将继续增强。
项目团队还提供了多语言文档(简体中文、日语、韩语、越南语、法语、德语、西班牙语、葡萄牙语、俄语、阿拉伯语),展现了明确的国际化定位。