VieNeu-TTS
越南语TTS引擎,支持3-5秒即时音色克隆、48kHz高保真输出,纯CPU运行无需GPU
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
越南语TTS引擎,支持3-5秒即时音色克隆、48kHz高保真输出,纯CPU运行无需GPU
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
截至2026年,越南语作为东南亚第六大语言,拥有近一亿母语使用者,但在全球开源语音合成领域,越南语长期面临"低质量、少资源"的困境——大多数主流 TTS(Text-to-Speech)引擎对越南语的支持停留在机械拼接阶段,音调抑扬顿挫的自然度远不及英语或中文。
VieNeu-TTS 的出现,正在改变这一局面。这个由独立开发者 Phạm Nguyễn Ngọc Bảo(GitHub @pnnbao97)主导的项目,不仅将越南语 TTS 质量推向了商用级别,更带来了即时音色克隆(Zero-shot Voice Cloning)、双语混说(Bilingual Code-switching)和播客对话模式等旗舰功能,让越南语语音合成从"能用"升级到"好听、可用、有灵魂"。
截至当前,该项目已在 GitHub 获得超过 1,700 颗星,成为越南语 AI 语音领域最具影响力的开源项目之一。
VieNeu-TTS 的诞生并非一蹴而就。项目作者 pnnbao97 同时维护了 sea-g2p(东南亚语言 Grapheme-to-Phoneme 转换工具),这一底层工具链为 VieNeu-TTS 的高保真发音奠定了基础。
项目的核心迭代路径清晰可见:
这种版本演进策略在开源 TTS 项目中相当成熟——v1/v2 验证技术可行性,v3 面向生产环境优化,每个版本都附带 HuggingFace 预训练模型权重,方便用户直接调用。
这是 VieNeu-TTS 最具吸引力的功能。用户只需提供 3-5 秒的参考音频,即可克隆任意音色,并在任意文本上生成语音。
背后的技术原理是将音色信息编码为speaker embedding,结合声码器(Vocoder)合成波形。v3 Turbo 版本进一步优化了克隆一致性,使得克隆音色与原音在情感色彩上更贴近。
对于内容创作者、教育应用和有声书制作团队而言,这意味着无需专业录音棚,也能快速生成大量个性化语音内容。
越南语和英语在日常生活中经常混用(例如在科技、商务场景中)。传统 TTS 在处理混合文本时,往往出现语种切换突兀、发音不准确的问题。
VieNeu-TTS 通过 sea-g2p 音素器实现精确的双语切换:英文部分使用英语发音规则,越南语部分使用越南语调规则,过渡自然。这一能力使其在跨境电商多语言客服、越南本地化 AI 助手等场景中有独特优势。
v2 版本引入的 Podcast/Conversation 模式支持多说话人自动检测——系统能够根据对话文本自动识别不同角色,并使用不同音色朗读。这对于自动生成对话内容、有声剧等场景非常实用。
v3 Turbo 引入了一套实验性标签语法:用户可以在文本中插入 [cười](笑)、[thở dài](叹息)、[hắng giọng](清嗓)等标记,模型会在对应位置生成相应的情感音效或语气变化。这一设计参考了剧本标注的思路,赋予了语音合成更强的表现力。
v3 Turbo 支持批次大小最高 32 的并行生成,并提供专门的对话模式——无论说话人数量多少,系统会将整个脚本统一批次处理,大幅提升批量内容生成效率。
VieNeu-TTS 的一大工程亮点是去 PyTorch 化的 CPU 推理路径:
uv sync --group gpu 安装后,v3 Turbo 自动切换至 PyTorch 引擎;v1/v2 版本则通过 LMDeploy 实现高效 GPU 推理这种设计让同一个 SDK 可以灵活适配从树莓派到 A100 的各类硬件,真正实现了"一处训练、多处部署"。
| 组件 | 技术选型 | 作用 |
|---|---|---|
| 音素器 | sea-g2p | 越南语/英语 grapheme-to-phoneme |
| 声码器 | MOSS Audio Tokenizer Nano | 音频编解码 |
| ONNX Runtime | onnxruntime >= 1.20.0 | CPU 推理引擎 |
| Web UI | Gradio >= 5.49.1 | 交互界面 |
| 模型管理 | HuggingFace Hub | 权重分发 |
| 音频 I/O | soundfile + soxr | 音频读写与重采样 |
项目提供了两套完整的部署方案:
vieneu-web 命令):面向终端用户,支持实时合成参数调整、音色选择和克隆操作,默认端口 7860vieneu-serve 命令):面向开发者,提供 OpenAI 兼容的 HTTP API,便于集成到现有应用,默认端口 23333通过 docker-compose 可以一键拉起完整服务栈,支持 GPU 加速和公共隧道(bore)。
项目支持三种安装方式:
pip install vieneu,仅依赖 ONNX Runtime,v3 Turbo 48kHz 在 CPU 上直接运行uv sync --group gpu,解锁 v1/v2 GPU 加速模式docker-compose up 即可启动完整 Web UI 服务from vieneu import Vieneu
tts = Vieneu() # 默认 v3 Turbo,CPU ONNX
# 1. 内置音色,无需参考音频
audio = tts.infer("Xin chào, tôi là Bình An!", voice="Bình An")
tts.save(audio, "output.wav")
# 2. 即时克隆,只需3-5秒参考音频
audio = tts.infer("Giọng này thật đặc biệt", ref_audio="my_voice.wav")
# 3. 情感标签(实验性)
audio = tts.infer("[cười] Nghe hay quá đi! [hắng giọng] Để mình nói tiếp nhé")
整体使用体验与主流商业 TTS(如 ElevenLabs)相近,但完全免费、可私有化部署。
尽管 VieNeu-TTS 取得了显著进展,仍有一些值得关注的局限:
[cười]、[thở dài] 等情感标签在当前版本中准确度和稳定性仍有提升空间,用户需要测试调优VieNeu-TTS 的价值不仅在于技术本身,更在于它代表了一种趋势:小语种 AI 的平民化。
过去,高质量语音合成是英语和中文的专利;如今,凭借 PyTorch-free 的 ONNX 推理路径和 HuggingFace 的模型分发生态,一个专注于东南亚语言的独立开发者,也能做出商用级别的 TTS 系统。这降低了越南语语音应用的开发门槛——教育科技、有声内容创作、客服自动化、无障碍辅助等领域都将受益。
同时,v3 Turbo 的批次生成和对话模式设计,也反映出项目在产品化方向上的思考:从单句合成走向内容规模化生产。
VieNeu-TTS 是目前最值得关注的越南语开源 TTS 项目之一。它以 v3 Turbo 为核心引擎,通过 ONNX Runtime 实现了真正意义上的端侧推理,结合即时音色克隆、双语混说和情感标签等差异化功能,在 1,700 星量级开源项目中构建了独特的技术护城河。
对于需要越南语语音合成能力的开发者和团队,VieNeu-TTS 提供了从 pip 一行安装到 docker-compose 集群部署的完整选项,上手成本低,定制空间大,是进入越南语语音 AI 领域最具性价比的入口之一。