VoxCPM
无需离散分词器的开源多语言TTS系统,支持文字描述生成音色、声音克隆和创意语音设计
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
无需离散分词器的开源多语言TTS系统,支持文字描述生成音色、声音克隆和创意语音设计
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你想让一段文字用"30岁温暖女声、略带南方口音"的方式朗读出来,或者直接复制某位播客主播的声音来读新闻——VoxCPM2 就是来解决这个问题的。它是目前 GitHub 上少有的无需离散分词器(Tokenizer-Free)的开源语音合成系统,直接绕过传统 TTS 中的音频离散编码步骤,在连续表征空间内完成扩散生成,输出自然度和表现力远超市面大多数开源方案。
传统的文本转语音(TTS)系统,比如大家熟悉的 FastSpeech2、VITS,通常需要把音频先转换成离散 token(比如 Meta 的 Encodec、Google 的 SoundStream),再让模型学习从文本 token 到音频 token 的映射。这个"离散化"过程本质上是一种有损压缩——就像把高清图片压缩成 JPEG 会丢失细节一样,离散 token 也会抹掉语音中的微妙情感、呼吸停顿和语调起伏,最终听起来"像机器人"。
VoxCPM2 的核心创新在于取消离散分词器:模型直接在连续表征空间做扩散生成,语音的每一个细微变化都被保留下来。这背后是北京人工智能研究院(BAAI)和面壁智能(OpenBMB)团队多年在 MiniCPM 语言模型上的积累——VoxCPM2 继承了 MiniCPM4 的语言理解能力,同时融入了自研的音频 VAE(AudioVAE)和 LocDit 扩散Transformer 架构。
VoxCPM2 提供三种完全不同的使用模式:
🎨 Voice Design(音色设计):不需要任何参考音频,只要用文字描述想要的音色特征(性别、年龄、语调、情感、语速等),VoxCPM2 就能凭空"捏"出一个全新声音。适合做游戏配音、品牌语音助手等需要创意语音设计的场景。
🎛️ Controllable Cloning(可控克隆):上传一段参考音频,VoxCPM2 可以克隆声音,同时你还能叠加文字描述来调节最终效果——比如"保持音色,但语速放慢、用更活泼的语气"。这个组合控制能力是很多开源 TTS 所不具备的。
🎙️ True-to-Life Cloning(高保真克隆):直接克隆参考音频的声音特征,追求最大程度的相似度,适合需要高度还原特定人声的场景。
所有模式均支持多语言(中文、英文、日文、韩文等),而且 VoxCPM2 的模型权重托管在 Hugging Face 和 ModelScope 上,提供了在线 Demo 可以直接体验。
从代码结构来看,VoxCPM2 的架构分为几层:
推理入口有三种:
app.py):基于 Gradio 的网页界面,适合非技术用户src/voxcpm/cli.py):命令行工具,适合批量处理和自动化脚本src/voxcpm/core.py):通过 VoxCPM() 类直接调用,适合集成到其他项目依赖方面需要 Python 3.10+、PyTorch 2.5+、torchaudio、transformers 等,必须使用 NVIDIA GPU(推荐 8GB+ 显存,如 RTX 3090/4090)。

图1:THUHCSi 实验室 Logo — VoxCPM2 由北京人工智能研究院与面壁智能联合开发
优点:
lora_ft_webui.py),可以低成本定制专属音色缺点:
推荐人群: 有一定深度学习环境配置经验的开发者、语音产品设计师、AI 研究者。
VoxCPM2 仍有一些局限性值得注意:
但整体来看,VoxCPM2 代表了一个重要方向:跳过离散 token、直接在连续空间生成,这条路线如果和更大的语言模型结合(比如 GPT-4o 级别的实时语音对话),可能会催生出下一代交互式语音 AI 产品。
VoxCPM2 获得了超过 19,000 颗 GitHub Stars,话题标签涵盖 audio、deeplearning、multilingual、text-to-speech、voice-cloning 等十余个领域。它不仅是一个技术项目,更是 BAAI/面壁智能在"语言模型 + 多模态生成"交叉方向上的重要里程碑。开源社区对它的关注度说明:市场对高质量、可定制、开源免费的语音合成工具有强烈需求,而 VoxCPM2 正好填补了这个空白。