OmniVoice
k2-fsa/OmniVoice加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你是一名记者,需要在阿富汗采访当地居民,对方只会说普什图语;你需要为一款出海 App 提供本地化配音,但团队里没有尼泊尔语配音员;你想用自己祖父的声音朗读家庭相册的解说词,但手头只有他年轻时的几张照片。
在传统方案里,这些需求意味着高昂的翻译费、漫长的录音周期,以及对稀有语言人才近乎不可能的寻觅。而 OmniVoice 正在改写这个局面——一个由 k2-fsa 团队开源的 600+ 语言零样本文本转语音(TTS)系统,只需一段参考音频或一句文字描述,就能生成自然流畅的目标语言语音。
OmniVoice 的开发者是 k2-fsa 团队,这个团队在语音开源领域已经深耕多年,此前已开源 Whisper 推理引擎 sherpa-onnx、Paraformer 系列模型等热门项目,GitHub 累计 star 数可观。团队核心成员 Han Zhu(朱涵)等人在 2026 年发表了论文《OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models》(arXiv:2604.00688),首次将扩散语言模型思想引入离散非自回归 TTS 架构。
项目完全基于开源数据构建,训练语料库规模达到 581,000 小时,覆盖 646 种语言,语料全部来自公开数据集。这使得 OmniVoice 成为目前语言覆盖范围最广的开源 TTS 系统。
OmniVoice 的核心创新在于其扩散语言模型风格的离散非自回归(NAR)架构。传统的多语言 TTS 系统通常采用两阶段流水线:文本→语义 token→声学 token→波形,OmniVoice 则一步到位,直接将文本映射到多码本声学 token,大幅简化了推理链路。
两个关键设计:
架构上,OmniVoice 使用 PyTorch + Transformers 生态,依赖 torchaudio、accelerate、pydub、librosa 等基础库,核心推理代码在 omnivoice/models/omnivoice.py。
OmniVoice 提供两种风格迥异的语音合成路径:
语音克隆(Voice Cloning):上传一段参考音频,OmniVoice 提取说话人的音色特征后,用目标文本生成保持该音色的语音。适合品牌定制配音、历史人物声音重建、游戏 NPC 个性化等场景。
语音设计(Voice Design):无需参考音频,只需用文字描述目标声音的特征(如"年轻女性、英式口音、音调偏高"),OmniVoice 即可"即兴创作"符合描述的音色。这解决了参考音频难以获取时的冷启动问题。
在 HuggingFace Spaces 上可直接体验这两种模式,地址:https://huggingface.co/spaces/k2-fsa/OmniVoice
本地部署门槛中等。由于没有提供 Dockerfile,用户需要手动搭建 Python 环境:
pip install omnivoice
python -m omnivoice.cli.demo # 启动 Gradio Web UI
模型权重(约数GB)通过 from_pretrained("k2-fsa/OmniVoice") 自动从 HuggingFace 下载,国内用户需注意网络速度。Gradio 界面提供了简洁的文本输入框和音频播放控件,上手难度低。
显存需求约 8GB 以上(FP16),CPU 模式下速度较慢。团队还提供了 LoRA 微调支持(通过 peft 库),可针对特定说话人做轻量级定制化训练,数据准备文档在 docs/lora_finetuning.md。
CLI 工具链覆盖了推理、批量推理、LoRA 合并等常见场景:
omnivoice-infer:单条推理omnivoice-infer-batch:批量推理omnivoice-merge-lora:合并 LoRA 权重omnivoice-demo:Gradio 交互界面OmniVoice 的出现填补了开源领域超多语言 TTS 的空白。此前 Meta 的 MMS-TTS 和微软的 Vall-E 等工作虽然也覆盖多语言,但前者音质相对粗糙,后者闭源且对计算资源要求极高。OmniVoice 以 Apache-2.0 许可证开源,在消费级 GPU 上可跑,兼具可玩性和实用性。
局限之处:
from_pretrained 接口拉取,缺乏镜像支持OmniVoice 是目前开源社区在多语言零样本 TTS 方向最具野心的作品——600+ 语言覆盖、扩散语言模型架构、语音克隆+语音设计双模式,加上相对平民化的部署要求,为多语言内容创作、有声内容本地化、个性化语音应用打开了一扇低成本的大门。虽然距离商用级音质还有差距,但其开源透明性和极致语言覆盖已足以让它成为语音 AI 领域不可忽视的存在。
相关信息