ComfyUI-Qwen3-TTS
将 Qwen3-TTS 语音合成能力带入 ComfyUI 生态,支持声音克隆、设计与微调的完整工具链
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将 Qwen3-TTS 语音合成能力带入 ComfyUI 生态,支持声音克隆、设计与微调的完整工具链
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你在 B 站刷到一个音色惊艳的配音视频,想让自家项目也用上这个声音,却苦于没有专业录音设备和调音技术。现在,一个叫 ComfyUI-Qwen3-TTS 的工具把这个过程变得像搭积木一样简单——只需要上传一段 5~30 秒的参考音频,就能克隆出几乎一模一样的音色,甚至还能在此基础上微调出全新的声音风格。
这就是 ComfyUI-Qwen3-TTS 带给普通创作者的可能性。
ComfyUI-Qwen3-TTS 是由独立开发者 DarioFT 打造的一个 ComfyUI 扩展节点套件,专门用来对接阿里巴巴 Qwen 团队 开源的 Qwen3-TTS 系列模型。Qwen3-TTS 是 Qwen 家族在 2025 年初推出的文本转语音模型,支持 1.7B(高精度)和 0.6B(轻量级)两种参数量,涵盖从声音设计、语音克隆到模型微调的完整工具链。
在 ComfyUI 生态中引入 Qwen3-TTS 能力,意味着 AI 音视频创作者可以在同一个工作流里串联起图像生成、视频生成和语音合成三大模块——这对于制作数字人、短视频配音、有声读物等场景意义重大。
ComfyUI-Qwen3-TTS 提供了一套完整的语音合成工作流,节点之间可以自由组合:
1. Custom Voice(预设音色) 内置 9 种高质量预设音色(如 Vivian、Ryan 等),可直接调用,适合快速产出配音场景。通过节点选择说话人、音色语言、情感指令(如"Happy"或"Whispering"),即可生成目标语音。
2. Voice Design(声音设计) 基于 Qwen3-TTS VoiceDesign 模型,用自然语言描述你想要的音色——比如"深沉、有磁性的男声,适合纪录片旁白"——模型即可生成对应风格的语音。这种纯文本驱动的声音创作方式大大降低了专业配音的门槛。
3. Voice Clone(声音克隆) 上传 5~30 秒参考音频,模型即可克隆出相似音色。这是该工具最核心的能力,支持最长 30 秒的参考音频输入,自动裁剪过长的片段。克隆后的声音可以直接用于后续文本到语音生成,并可通过 Prompt Maker 节点预计算声学特征(QWEN3_PROMPT),重复利用而无需每次重新计算。
声音保存与复用 通过 Qwen3-TTS Save Prompt 和 Qwen3-TTS Load Prompt 节点,克隆好的声音嵌入(.safetensors 格式)可以保存到本地 ComfyUI/models/Qwen3-TTS/prompts/ 目录,后续直接加载跳过计算过程,大幅提升批量生成效率。
10 种语言支持 支持中文、英文、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语、意大利语,覆盖主流应用场景。
VRAM 优化机制 节点内置多级显存优化:梯度检查点(gradient checkpointing)可节省约 30~40% VRAM;8-bit AdamW 优化器(需安装 bitsandbytes)进一步降低占用;支持可配置的 batch size 和梯度累积,适配不同显存容量的显卡。
模型下载与缓存管理 首次使用时,模型按需从 HuggingFace 或 ModelScope 下载,只下载你实际选择的模型变体而非全量下载。如果之前在其他工具(如 Qwen 官方脚本)中已有缓存模型,系统会自动迁移到 ComfyUI 模型目录,避免重复下载。
对于有更高定制需求的用户,ComfyUI-Qwen3-TTS 提供了完整的微调(Fine-Tuning)工具链,将原本需要写训练脚本才能完成的工作全部封装为可视化节点:
整个微调流程在 ComfyUI 图形界面中完成,无需编写 Python 代码,对非算法背景用户友好。
从源码结构来看,ComfyUI-Qwen3-TTS 的设计遵循了 ComfyUI 扩展开发规范,核心文件包括:
| 文件 | 作用 |
|---|---|
| nodes.py(~84KB) | 所有自定义节点的注册与实现,含 Loader、Generator、Prompt Maker、Finetune、Dataset Maker、Audio Compare 等 11 个节点 |
| dataset.py | 数据集处理工具类 TTSDataset |
| init.py | ComfyUI 插件入口,注册节点到画布 |
| pyproject.toml | 项目元数据与依赖声明,版本 1.7.0 |
nodes.py 中约 84KB 的单文件包含了完整的推理逻辑、模型管理(本地路径解析、缓存迁移)、训练循环(PyTorch DataLoader + Accelerate)、文件哈希校验等复杂逻辑。所有功能高度内聚、依赖关系清晰。
关键依赖:qwen-tts(上游 Qwen 官方包)、modelscope(模型下载)、transformers==4.57.3(注意版本锁定可能与其他 ComfyUI 扩展冲突)、accelerate、librosa、soundfile、safetensors。
Flash Attention 2 支持:优先使用 flash_attention_2,自动降级到 PyTorch 2.0 的 SDPA 实现,保障不同硬件环境的兼容性。Windows 用户需注意 Flash Attention 在 Windows 下支持不完整,建议降级使用 SDPA。
尽管功能强大,使用时需注意以下几点:
1. 依赖版本冲突风险 qwen-tts 包依赖 transformers==4.57.3,可能与其他 ComfyUI 扩展所需的更新版本 transformers 冲突。建议在独立 Python 虚拟环境中运行,或接受版本降级。
2. 生成可能卡死 模型在罕见情况下会进入无限生成循环(未能正确发出 EOS 终止符),此时需手动重启 ComfyUI。降低 max_new_tokens 或缩短参考音频长度可以缓解。
3. 微调门槛不低 虽然节点封装了训练流程,但实际微调仍需准备高质量数据集(音频与文本对齐)、调参理解,以及足够的显存(1.7B 模型至少 8GB VRAM)。
4. 许可信息不明确 仓库 license 字段为空(Apache-2.0 仅在 pyproject.toml 中声明),生产使用前建议确认实际许可状态。
5. 非一键部署 需要手动 git clone 到 custom_nodes 目录并执行 pip install,没有 Dockerfile 或 docker-compose 支持,无法在无 ComfyUI 环境中独立运行。
ComfyUI-Qwen3-TTS 的出现,是 AI 语音合成工具走向"平民化"趋势的一个缩影。回顾语音合成发展历程,从早期需要专业录音棚和语言学专家参与,到 Google WaveNet、DeepMind WaveRNN 等端到端模型的崛起,合成质量逐步逼近真人。而 Qwen3-TTS 这类开源模型的开放,以及 ComfyUI 扩展的图形化封装,让即便不具备深度学习背景的内容创作者也能零门槛使用。
更重要的是,Voice Clone + Fine-Tuning 的组合打开了「声音资产化」的可能性——个人可以训练自己或授权对象的声音模型,声音成为一种可量化、可交易的无形资产。当然,这也带来了深度的伦理挑战:声音克隆技术滥用的风险已有先例(深度伪造诈骗),使用此类工具时务必遵守各地法律法规和平台政策。