OmniVoice-Studio
本地运行的 AI 语音克隆与视频配音工具,支持 646 种语言,完全免费无需 API Key
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
本地运行的 AI 语音克隆与视频配音工具,支持 646 种语言,完全免费无需 API Key
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,如果有一天想把自己的声音克隆给 AI 用,或者想让 YouTube 视频自动翻译配音——这些曾经只有 ElevenLabs 这样的商业服务才能做到的事情,如今有了完全免费的开源替代方案。
OmniVoice Studio 就是这样一款工具:它是一个本地桌面应用,支持 646 种语言的语音克隆、语音合成、视频配音,全部在你自己电脑上运行,不需要任何 API Key,不需要联网支付。
OmniVoice Studio 由独立开发者 Palash Deb(@debpalash) 开发维护,项目启动于 2025 年。
Palash 的初衷很简单:市面上的语音克隆工具要么价格昂贵(ElevenLabs 按字数收费),要么需要上传音频到云端(隐私风险),要么只能在特定平台使用。他想做一个真正自由、本地化的解决方案,让任何人都能在自己电脑上完成从配音到翻译的完整流程。
项目一经发布便迅速获得关注,截至 2026 年 5 月已积累超过 5000 颗 GitHub Stars,成为开源语音 AI 领域最活跃的项目之一。它被社区誉为 ElevenLabs 的开源替代品。
图1:OmniVoice Studio 社交预览图
只需提供任意语言某人说话的 3 秒钟音频片段,OmniVoice 就能学习这个声音的独特质感,然后用它来朗读任何文本。这背后的技术依赖开源的 SuperTonic3 等 TTS 引擎,支持的语言覆盖全球 646 种语言——包括大量小语种。
这意味着你可以用一段特朗普的演讲音频,让他说出任何他从未说过的话;也可以用一段日语动漫角色的声音,朗读中文台词。零样本克隆打破了声音的语言壁垒。
如果不克隆真实声音,用户也可以从零开始设计一个虚拟声音:调节性别(男/女/中性)、年龄(从儿童到老人)、口音、语速、音调、情绪等参数,实时预览听到效果。适合游戏配音、有声书、虚拟主播等场景。
这是 OmniVoice 最强大的功能模块。输入一个 YouTube 视频 URL 或本地视频文件,工具自动完成以下步骤:
整个流程一键启动,可以批量排队 50 个视频,支持断点续传。
全局快捷键呼出听写小窗口,在任何应用中都可以语音输入,自动粘贴到当前焦点窗口。用的是 Whisper ASR 模型,准确率极高,实时转写,直接替代打字。
Meta 开发的 AudioSeal 技术会给 AI 生成的音频嵌入人耳听不见的隐形水印,方便追溯检测音频来源,满足部分平台的合规要求。
图2:OmniVoice Studio 项目预览图
前端采用 Tauri 2.0 框架(Rust 后端 + Web 前端),而不是 Electron,这让应用体积更小(比 Electron 小约 50 倍)、启动更快、内存占用更低。Web 前端用 Vite + React 构建,开发体验现代,构建产物轻量。
同时提供一个 Web UI 版本(通过 uvicorn 在本地 3900 端口启动),适合不想安装桌面应用的轻量用户直接用浏览器访问。
后端是 Python FastAPI 应用,分为清晰的服务模块:
| 模块 | 职责 |
|---|---|
engines/ | 多种 TTS 引擎适配层(SuperTonic3、OmniVoice GGUF、IndexTTS) |
services/tts_backend.py | TTS 核心调度 |
services/asr_backend.py | Whisper ASR 语音识别 |
services/dub_pipeline.py | 视频配音流水线编排 |
services/translation_engines.py | 多翻译引擎接入 |
services/model_manager.py | 模型下载、缓存、GPU 管理 |
services/speaker_clone.py | 语音克隆逻辑 |
mcp_server.py | MCP 服务,支持 Claude Desktop 等 AI 工具调用 |
数据存储用 SQLite(通过 Alembic 管理迁移),任务队列用自定义 JobQueue 实现持久化。
所有模型均从 HuggingFace 自动下载,首次运行约需下载 4GB 模型文件。
OmniVoice 提供了完善的多阶段 Dockerfile 和 docker-compose.yml,支持 CPU 和 GPU 两种 profile。GPU 模式下使用 NVIDIA CUDA 加速,推理速度比纯 CPU 快 5-10 倍。
# GPU 加速模式(推荐)
docker compose -f deploy/docker-compose.yml --profile gpu up
# CPU 模式(无 NVIDIA 显卡)
docker compose -f deploy/docker-compose.yml --profile cpu up
首次启动后,打开 http://localhost:3900 即可使用 Web UI。默认绑定 127.0.0.1,仅本机可访问;如需局域网访问需手动改配置。
项目提供预编译安装包(macOS DMG、Windows MSI、Linux AppImage/deb),下载对应平台的安装包双击即可,无需手动配置环境。
需要 Python 3.11+、uv 包管理器、Bun(前端)、Node.js 环境。文档中有详细的初始化脚本,克隆仓库后几行命令即可本地运行。
硬件需求:推荐 NVIDIA RTX 3060 或更高显卡(6GB+ VRAM),无 GPU 时可用 CPU 模式(慢一些),内存建议 8GB 以上。
零样本语音克隆技术本身就存在被滥用的风险——用几秒钟音频就能合成任何人说话的内容,可能被用于诈骗、伪造新闻、政治操纵等。OmniVoice 虽然内置了 AudioSeal 水印,但水印并非不可移除,社区对此仍有争议。项目文档和 Discord 社区明确要求用户不得用此工具从事欺诈和深度伪造。
克隆效果很大程度上取决于提供的音频样本质量:背景噪音、录音设备、回声等都会影响还原度。对于某些小众语言或特殊口音,克隆效果可能明显失真。
截至目前项目处于活跃 beta 阶段,版本更新频繁,预编译安装包的稳定性和源码最新版本之间可能存在差异。README 建议想要最新功能的用户直接从源码运行。
OmniVoice Studio 代表了开源语音 AI 的一个重要方向:让高门槛的 AI 能力民主化。
在此之前,语音克隆、视频配音的技术壁垒极高,要么需要专业知识,要么需要付费 API。OmniVoice 将这一切封装成一个任何人都会用的桌面应用,而且完全本地运行,数据不离开你的电脑。
其 5000+ Stars 的增长曲线反映了社区对隐私优先、本地优先语音工具的强烈需求。随着开源模型质量持续提升(SuperTonic3、F5-TTS 等),本地语音合成的效果正在快速逼近商业云服务。
与此同时,它也提醒整个行业:AI 音频的监管和伦理框架必须同步建立,才能让这类强大的工具真正服务于创造,而非破坏。