ComfyUI-VoxCPM
基于 MiniCPM-4 的无 Tokenizer 端到端 TTS 系统,支持零样本声音克隆、Voice Design 和 LoRA 训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于 MiniCPM-4 的无 Tokenizer 端到端 TTS 系统,支持零样本声音克隆、Voice Design 和 LoRA 训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你录一段 10 秒的语音,就能让 AI 用完全相同的声音朗读任意文章——甚至还能调整语气、情感和语言。这不是科幻,这是 VoxCPM 正在做的事。
VoxCPM 由国内 AI 团队 OpenBMB(面壁智能)开发,是一款基于 MiniCPM-4 骨干网络的无 Tokenizer Text-to-Speech(TTS)系统。项目于 2025 年 9 月开源,不到一年时间在 GitHub 积累近 500 颗星,迅速成为 ComfyUI 生态中最受关注的语音合成节点之一。
传统的 TTS 系统(如 VITS、F5-TTS)依赖 tokenizer 将文本转换为离散 token,再送入声码器合成语音。这种流程存在两个天然缺陷:一是 tokenizer 本身会丢失韵律信息,二是两阶段(文本到 token 再到语音)的 pipeline 延迟高且难以端到端优化。VoxCPM 的核心创新在于去掉了 tokenizer,直接在连续空间中建模语音,实现了真正意义上的端到端语音合成。
VoxCPM 采用了完全不同于传统 TTS 的技术路线,其核心架构包含以下几个关键模块:
1. MiniCPM-4 骨干网络 VoxCPM 的语言理解能力来自 MiniCPM-4,这是一个参数量仅 2B 的小型语言模型,却具备出色的上下文理解能力。在 TTS 任务中,模型不仅处理输入文本,还会根据上下文关系(如句子的逻辑走向、情感色彩)预测正确的语速、重音和停顿位置,这正是"有表现力的语音"的技术来源。
2. 连续空间语音建模 区别于离散 token 方案,VoxCPM 在连续的语义空间中对语音进行建模。这让它能够捕捉到传统 TTS 难以复现的细微语音特征——说话人的气息感、鼻音、吞音等,都会自然地体现在生成结果中,而不是被 tokenizer 标准化掉。
3. Voice ZipEnhancer 后处理 生成的语音会经过一个名为 ZipEnhancer 的声学增强模块,进一步消除机械感、提升音质。模型还内置了 denoiser(降噪器),用于处理环境噪声,让最终输出更加干净。
4. VoxCPM2 的 Voice Design 2025 年底发布的 VoxCPM2(2B 参数)带来了革命性的 Voice Design 功能:用户可以用自然语言描述声音特征(如"温暖的女性嗓音,带轻微沙哑"),AI 就能生成符合描述的新声音,无需任何参考音频。配合 48kHz 高采样率和 30 种语言支持,VoxCPM2 已经从"专业工具"进化为"创作者利器"。
图1: VoxCPM 在 ComfyUI 中的工作流示例,支持文本输入和 LoRA 风格控制
ComfyUI-VoxCPM 并非简单的 Python 脚本,而是为 ComfyUI 量身打造的完整节点包。代码结构清晰,分为以下几个层次:
| 节点类型 | 功能 |
|---|---|
| VoxCPM TTS(主节点) | 统一 TTS 合成入口,支持 VoxCPM1.5/2 |
| VoxCPM Voice Cloning | 配置语音克隆参数(参考音频+文本) |
| VoxCPM Advanced Params | 配置高级生成参数(temperature、CFG、sway sampling) |
| VoxCPM Train Config | 配置 LoRA 训练参数 |
| VoxCPM Dataset Maker | 从音频文件制作训练数据集 |
| VoxCPM LoRA Trainer | 在 ComfyUI 内直接训练自定义语音 LoRA |
这种模块化设计的优势在于:复杂的工作流可以将配置和执行分离,同一个配置节点可以连接到多个 TTS 节点复用,大幅提升工作效率。
VoxCPM 的语音克隆能力是它最吸引人的特性之一。从技术层面,它支持三种克隆模式:
基础克隆(Prompt Audio + Transcript): 提供一段参考音频及其转写文本,模型会学习该声音的音色、语速和韵律特征。适用于克隆已知内容的朗读风格。
参考克隆(Reference Audio Only,VoxCPM2): 只需提供参考音频,无需转写文本。模型通过 AudioVAE 等技术从音频中提取说话人的身份特征(音色、发音习惯),直接用于合成。这对于没有现成转写的真实录音(如采访、播客片段)特别有用。
终极克隆(Ultimate Cloning): 将参考音频(身份信息)与提示音频(韵律特征)结合,取两者之所长——既保留原声的真实音色,又能控制说话风格和节奏。这是最精确的克隆方式,也是 VoxCPM2 独有的功能。
图2: 使用 ComfyUI 内置节点训练自定义语音 LoRA,零门槛定制音色风格
显存需求较高: VoxCPM2(2B 参数)在 fp16 精度下需要约 8GB VRAM,在无独立 GPU 的环境下几乎无法运行。虽然 ComfyUI 提供了 dtype 选项(fp16/fp32/bf16)和模型 offload 策略,但对于没有 NVIDIA 显卡的用户仍然是硬性门槛。
克隆需要高质量音频: Voice Design 和参考克隆的效果高度依赖输入音频质量。背景噪声大、音质低(电话录音、压缩严重的 MP3)会显著影响克隆效果。在实际使用中,准备一段 10-30 秒、清晰无噪的语音样本是获得高质量克隆效果的前提。
中文支持有取舍: VoxCPM2 支持 30 种语言,但 VoxCPM1.5 仅支持中英两种。在项目实际使用中,中文 TTS 效果稳定,但部分中文多音字和轻声的韵律处理仍有优化空间。
无独立部署包: 项目没有提供 Docker 或独立 Web 服务,只能作为 ComfyUI 的插件使用。对于不熟悉 ComfyUI 的用户,有一定的上手门槛。不过好在 ComfyUI 本身的普及度已经很高,社区中有大量安装教程可供参考。
前置要求: ComfyUI 已安装(支持 Windows/Linux/macOS)、NVIDIA GPU + CUDA 11.8+(强烈建议,CPU 推理极慢)、Python 3.10+、VRAM 8GB+(VoxCPM2)/ 6GB+(VoxCPM1.5)。
安装步骤(3 步搞定):
ComfyUI-VoxCPM,点击 Installcd ComfyUI/custom_nodes && git clone https://github.com/wildminder/ComfyUI-VoxCPM.git && cd ComfyUI-VoxCPM && pip install -r requirements.txtaudio/tts 分类中,首次使用会自动下载模型(约 2-4GB)安装过程完全自动化,模型管理由 huggingface_hub 处理,首次运行时会提示选择 VoxCPM1.5 或 VoxCPM2 模型。
截至 2026 年 6 月,ComfyUI-VoxCPM 已在 GitHub 获得约 490 颗星,项目持续活跃开发(最近更新于 2026 年 4 月)。项目集成了 transformers、diffusers、bitsandbytes 等主流 AI 框架,代码质量高,文档完整,pytest 测试覆盖核心模块。
从趋势看,VoxCPM 代表了 TTS 领域"去 Tokenizer 化"的技术方向,结合 MiniCPM 系列小模型的高效推理路线,有望在端侧部署场景中取得更大突破。对于需要个性化语音合成、内容创作、有声书制作等场景的开发者,VoxCPM 是当前开源生态中极具竞争力的选择。