ComfyUI-QwenTTS
在ComfyUI中拖拽使用Qwen3-TTS语音合成,支持10语种、语音克隆与自然语言风格设计
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在ComfyUI中拖拽使用Qwen3-TTS语音合成,支持10语种、语音克隆与自然语言风格设计
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你是AI视频创作者,用ComfyUI生成了一个高质量的数字人视频,但配音环节突然卡住了——要么要去第三方平台注册账号、上传文本、下载音频,再导入ComfyUI;要么本地部署了TTS模型,但命令行参数复杂、集成困难,整个流程断成两截。ComfyUI-QwenTTS 要解决的就是这个问题:让语音合成成为ComfyUI工作流中的一个节点,像拖拽图片生成节点一样,丝滑地融入AI创作管线。
这个痛点非常真实。随着 ComfyUI 成为AI生成图像、视频的标准工具,用户对"一站式工作流"的需求急剧增长。语音作为视频、动画的配套输出,自然成为下一个需要集成的模块。而阿里巴巴通义实验室开源的 Qwen3-TTS 系列模型(12Hz采样率)恰好提供了高质量、多语种、支持语音风格控制的端到端语音合成能力——ComfyUI-QwenTTS 就是两者的粘合剂。

图1:Qwen3-TTS节点在ComfyUI界面中的节点列表视图
Qwen3-TTS 是阿里巴巴通义实验室基于大语言模型(LLM)架构开发的端到端语音合成模型。与传统TTS(文本转语音)系统需要声学模型+声码器等多级管线不同,Qwen3-TTS 采用了类似 LLM 的序列到序列架构,直接从文本 token 生成音频 token,再通过声码器还原为波形。这种设计让它具备了一些独特优势:
项目由 1038lab 团队开发维护(GitHub账号 1038lab),采用 GPL-3.0 许可证。项目已发布到 ComfyUI 官方 Registry(PublisherId: ailab),可通过 ComfyUI-Manager 直接搜索安装。
当前版本为 v1.1.4,从 README 的更新日志来看,团队保持着积极的迭代节奏(约每月一次小版本更新),支持与同作者的 ComfyUI-QwenAR(语音识别)节点联动。
ComfyUI-QwenTTS 提供三大核心节点,覆盖从新手到进阶用户的不同需求层次:
1. CustomVoice(自定义音色)
这是最简单直接的节点,提供9种预设音色(Preset Speakers),用户只需输入文本即可生成高质量语音。对于不想折腾、快速出活的用户来说,这是最高效的路径。预设音色经过团队优化,在稳定性和生成速度上都有保障。
2. VoiceDesign(语音设计)
用自然语言描述想要的语音风格,模型据此生成语音。这是 Qwen3-TTS 区别于传统TTS的核心能力——你可以写"a warm middle-aged female voice with a slight Beijing accent"(温暖的中年女性声音,带轻微北京口音),模型能理解并生成对应风格的音频。这对于游戏配音、有声书等需要差异化音色的场景特别有价值。

图2:Voice Design 节点的工作流示例,通过自然语言指令设计语音风格
3. VoiceClone(语音克隆)
通过提供一小段参考音频(约10秒以上)和对应文本,克隆出该音色。v1.1.0版本后支持将克隆音色保存为可复用的 VOICE 资源,方便在多个工作流中重复使用。进阶玩法是配合 ComfyUI-QwenAR(语音识别)节点,形成"录音→识别文本→克隆音色→生成新音频"的完整语音管线。

图3:Voice Clone 节点配合 QwenAR 使用的完整语音管线工作流
此外,Tools套件提供了辅助节点:Create Voice(创建语音)、Load Voice(加载语音)、Whisper STT(语音转文本)、Voice Instruct(语音指令预设)、Text Token Count(token计数),进一步丰富了语音相关的工作流工具链。
从代码结构来看,ComfyUI-QwenTTS 的架构设计非常清晰:
节点加载机制:使用 Python 标准库 importlib.util,在 __init__.py 中动态扫描同级目录下的所有 .py 文件(除自身外),提取 NODE_CLASS_MAPPINGS 和 NODE_DISPLAY_NAME_MAPPINGS,自动注册为 ComfyUI 可用的节点。这是一种常见的 ComfyUI 节点包开发模式,插件化程度高,添加新节点只需在同目录新增文件即可。
模型管理:通过 huggingface_hub 的 snapshot_download 自动下载模型,优先使用本地路径 ComfyUI/models/TTS/Qwen3-TTS/。首次运行时会自动检测并下载模型到默认位置;如用户有自定义模型路径,通过 ComfyUI 的 extra_model_paths.yaml 配置即可。
设备适配:节点内置自动设备选择逻辑,优先 CUDA → MPS(Apple Silicon)→ CPU。这意味着在 NVIDIA GPU 环境下自动获得最优性能,在 Mac M系列芯片上也能正常运行(通过 MPS),无GPU的CPU环境作为保底。
核心依赖:基于 PyTorch 生态,关键依赖包括 transformers>=4.57.0(模型加载)、accelerate>=1.12.0(推理加速)、librosa>=0.11.0(音频处理)、openai-whisper(语音识别)、tiktoken>=0.12.0(tokenizer)。值得注意的是 torch>=2.9.1 和 torchaudio>=2.9.1 要求较高,确保了与新版 PyTorch 生态的兼容性。
高级控制:v1.1.0+ 版本的高级节点暴露了注意力后端选择(auto / sage_attn / flash_attn / sdpa / eager),允许用户根据硬件条件选择最优注意力实现。flash_attn 和 sage_attn 是可选依赖(CUDA-only),安装后能显著提升推理速度。
作为 ComfyUI 的节点包,ComfyUI-QwenTTS 不需要独立部署,前提是已有运行中的 ComfyUI 实例。安装方式有两种:
方式一:ComfyUI-Manager(推荐) 打开 ComfyUI-Manager → 搜索"ComfyUI-QwenTTS" → 一键安装。这是体验最顺畅的方式,Manager 会自动处理依赖安装。
方式二:Git 克隆
cd ComfyUI/custom_nodes
git clone https://github.com/1038lab/ComfyUI-QwenTTS.git
然后手动安装依赖(使用 ComfyUI embedded Python 或系统 Python):
python -m pip install -r requirements.txt --no-cache-dir
安装完成后,导入示例工作流(如 QwenTTS_sample_workflow.json),首次运行会触发模型下载,稍作等待即可使用。

图4:示例工作流 QwenTTS_sample_workflow 的 ComfyUI 界面截图
1. 硬件门槛不可忽视 TTS 推理对 GPU 有一定要求,官方推荐 6GB+ VRAM。无独显环境下勉强可用但速度较慢。这意味着它不是"任何机器都能跑"的项目,部署前需要评估硬件条件。
2. 语音克隆的版权与伦理问题 零样本语音克隆技术引发了广泛关注。用户克隆真实人物声音可能涉及隐私、肖像权问题。项目文档提到了 Qwen3-TTS 模型采用 Apache-2.0 许可证(本节点包为 GPL-3.0),但克隆音频的合规性由使用者自行负责。
3. 非独立应用,依赖上游生态 这是 ComfyUI 节点包,不是独立程序。没有 ComfyUI 基础的用户需要先搭建 ComfyUI 环境,增加了入门成本。
4. 依赖版本较新
torch>=2.9.1、transformers>=4.57.0 等要求较新的依赖版本,在某些老旧环境中可能遇到兼容性问题,需要额外配置虚拟环境。
ComfyUI-QwenTTS 的出现反映了一个更大的趋势:AI生成工具的节点化、组件化。随着 AI 模型能力越来越强,单一模型往往难以满足复杂创作需求,将多个模型串联成工作流成为主流范式。ComfyUI 提供了这个管线编排能力,而像 ComfyUI-QwenTTS 这样的节点包,则是将具体模型能力接入管线的"翻译层"。
从 GitHub 数据看(225 stars,截至分析时),项目处于稳步增长期,活跃的更新节奏说明作者在持续维护。随着 Qwen3-TTS 模型本身的迭代(如更高采样率、更多语种),该节点包预计会持续跟进。
如果你已经在使用 ComfyUI,那么 ComfyUI-QwenTTS 是将语音能力纳入工作流的最直接选择;如果你还没有 ComfyUI 环境,但有语音合成需求,可以将它视为体验 Qwen3-TTS 能力的一个入口——尽管优先级的建议是先有 ComfyUI 再考虑这个节点包。