ComfyUI-FishAudioS2
在 ComfyUI 中实现零样本声音克隆和情感控制 TTS,支持 83 种语言和 1500+ 情感标
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在 ComfyUI 中实现零样本声音克隆和情感控制 TTS,支持 83 种语言和 1500+ 情感标
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Saganaki22 GitHub 头像 — ComfyUI-FishAudioS2 作者
想象这样一个场景:你在制作一部 AI 动画短片,需要为角色配上配音,但预算有限请不起配音演员;或者你想让一个已故名人的声音"复活"来朗读一首诗;又或者你是一个内容创作者,需要用不同语言、不同情感色彩为同一段文案配音。这些需求在过去往往意味着数千元的配音费用和专业音频设备,而 Fish Audio S2 Pro 正在彻底改变这一切。
Fish Audio S2 Pro 是 Fish Audio 公司于 2026 年初开源发布的第三代文本转语音(Text-to-Speech, TTS)模型,号称"开源与闭源中最好的 TTS"。该模型在超过 1000 万小时、涵盖 83 种语言的音频数据上训练,并内置 1500+ 情感标签,支持零样本语音克隆——只需 10-30 秒的目标声音样本,就能合成出音色高度还原的语音。而 ComfyUI-FishAudioS2 正是将这一强大能力以原生节点的方式引入 ComfyUI 工作流的项目。
该项目的作者是 GitHub 用户 Saganaki22(GitHub UID: 84208527),项目采用 Fish Audio Research License(非商业研究友好),当前版本 0.5.3,于 2026 年 3 月上线 GitHub,仅用 4 个月就积累了 256 颗星,成为 ComfyUI 生态中增长最快的语音类节点之一。
在 AI 创作工具井喷的 2025-2026 年,图像生成、视频生成、文本生成已经相当成熟,但语音合成始终是创作链条中最薄弱的一环。早期的 TTS 工具声音机械、情感单一,克隆效果更是差强人意。ElevenLabs、OpenAI 的 GPT-SoVITS 等方案虽然效果不错,但要么闭源收费、要么需要复杂的本地部署。
Fish Audio 的 S2 模型在这个时间节点出现,正中创作者的痛点。该模型的核心创新在于将 Dual-Autoregression(双自回归)架构 与 强化学习对齐(RL Alignment) 技术结合,能够在保持语音自然度的同时,对语速、语调、情感进行精细控制。Fish Audio Research 团队选择了将模型权重开源,这一决定让全世界的开发者和创作者都能在本地免费使用这一前沿技术。
ComfyUI-FishAudioS2 的价值则在于,它是连接前沿模型与成熟工作流生态的桥梁。ComfyUI 已经是 AI 图像和视频生成领域最流行的开源工作流工具,如果创作者已经在用 ComfyUI 做图生视频(比如配合 SadTalker、Wav2Lip 做虚拟主播),那么直接在同套工作流中完成语音合成和情感控制,意味着无需切换工具、不需要 API Key、不产生云端调用费用。
ComfyUI-FishAudioS2 提供四个独立的 ComfyUI 节点,设计思路清晰,覆盖了从基础 TTS 到高级多角色对话的完整场景:
最基础的节点,将输入文本转为语音流。核心亮点是支持 inline 情感标签——在文本中直接插入 [laugh]、[whisper]、[excited]、[sigh] 等标签,即可精确控制输出语音的情感色彩。模型内置 1500+ 情感标签,涵盖情绪(excited/sad/angry)、音量(whisper/shouting)、节奏(pause/inhale)、声乐(laughing/chuckling)、语调(professional broadcast tone/singing)等多种维度。
对于中文、日语、英语三大主流语言(T1 级)提供了最佳质量支持;T2 级语言(韩语、西班牙语、法语等)质量良好;其余语言(T3 级)亦可使用。这种分层设计确保了开发者在主流语言场景下获得最佳体验。
这是整个项目最吸引人的功能。用户只需提供 10-30 秒的目标音频片段(录音、歌曲片段、影视台词均可),模型就能捕捉声音的音色特征,生成具有该声音风格的全新内容。支持提供参考文本(reference_text)以提高克隆准确度。
代码实现上,voice_clone_node.py 负责接收 AUDIO noodle 输入,将参考音频编码为说话人向量(speaker embedding),然后将其注入到 Fish Speech 的解码器中。这个过程依赖 bundled 版的 fish_speech_src 源码——作者将原始 fish-speech 项目完整打包进了节点目录,并在 __init__.py 中动态将其注入 sys.path,巧妙规避了 pip install 在嵌入式 Python 环境中可能失败的问题。
在同一节点内同时指定 2-10 个不同的参考声音(speaker_1 到 speaker_10),并在文本中使用 [speaker_1]: 和 [speaker_2]: 这样的标记区分不同角色的台词,一次性生成包含多个角色交替对话的完整音频。适合有声书、播客、多角色动画配音等场景。
多角色 TTS 的进阶版,除了输出混合音频外,还同时输出每个角色的独立音轨(speaker_1_audio 到 speaker_10_audio)。每条独立音轨中,该角色的部分正常播放,其他角色的部分替换为静音。这一功能为唇音同步(Lip Sync)工作流提供了关键支持——可以将不同角色的音频分别对接 SadTalker、Wav2Lip 或 Infinite Talk 等虚拟人节点,分别生成每个角色的口型动画,最后合成为完整视频。
从代码结构来看,项目采用了清晰的模块化架构:loader.py(27KB)负责调用 transformers 加载 fishaudio/s2-pro 或 s2-pro-fp8 模型,并配置各种推理参数(精度 dtype、attention kernel、chunk_length 等);model_cache.py(10KB)实现了智能模型缓存——当用户多次运行同一配置时,模型会保持在 VRAM 中,避免重复加载的延迟。
最值得关注的技术细节是 __init__.py 中的依赖安装逻辑。由于 fish-speech 无法通过 pip 可靠地安装到 ComfyUI 的嵌入式 Python 环境中,作者采取了"bundled source + 动态 sys.path"的策略:fish-speech 源码被完整复制到 fish_speech_src/ 目录,在节点加载时,__init__.py 将其路径插入 sys.path[0],使 import fish_speech 和 import tools 优先加载 bundled 版本。
此外,install.py(ComfyUI Manager 安装脚本)处理了一个棘手的依赖冲突:descript-audio-codec 和 descript-audiotools 依赖 protobuf<5,但 tensorflow、mediapipe、florence2 等其他常用 ComfyUI 节点需要 protobuf 5.x。解决方案是始终用 --no-deps 参数安装这两个包,绕过其 transitive protobuf 约束。这个细节处理体现了作者对 ComfyUI 生态复杂依赖关系的深刻理解。
推理层面,模型支持多种精度模式:bf16(CUDA 默认,推荐)、fp16、fp32(CPU/MPS),以及三种量化方案:BNB INT8(~18GB VRAM)、BNB NF4 4-bit(~16GB VRAM)、FP8 权重量化(~20GB VRAM,RTX 4090+ 专用)。内置 SageAttention、FlashAttention、SDPA 三种 attention kernel 选择,可在不改变结果的情况下提升推理速度。
这是必须直面的话题。S2-Pro 模型有 40 亿参数(4B),完整 bf16 模型需要约 24GB VRAM,这是 RTX 4090/A5000 或更高级别显卡的显存规格。对于显存不足的用户,项目的量化方案提供了务实的降级路径:
从这个角度说,ComfyUI-FishAudioS2 并非人人可用的工具——它本质上是为已有中高端 GPU 的 ComfyUI 用户准备的升级选项,而非降低门槛的入门级 TTS。对于还没有合适硬件的内容创作者,使用 fish.audio 官方网页版或 API 仍然是更实际的选择。
语音克隆的伦理风险是此类工具无法回避的话题。项目 README 末尾附有 Usage Disclaimer,明确声明 Fish Audio S2 仅供学术研究和合法用途,并提醒用户注意当地 DMCA 相关法规。作者在 License 中明确要求商业使用需额外获得 Fish Audio 的商业授权。但从技术角度看,任何人都可以用名人或他人的声音生成内容,这是技术本身的固有风险,工具本身无法防范。
节点与 fish-speech 官方版本的同步问题也值得关注。作者 bundled 了一个完整的 fish_speech_src,但 fish-speech 官方在持续更新。如果 fish-speech 发布了 bug 修复或性能优化,用户需要等待 Saganaki22 同步更新 fish_speech_src,无法直接通过 pip 升级 fish-speech 本身。README 中明确警告"不要运行 pip install git+https://github.com/fishaudio/fish-speech",这意味着用户实际上被锁定在 bundled 版本上。
与其他 ComfyUI 节点的潜在冲突也需留意。如果另一个自定义节点在 sys.path 中抢先导入了不同版本的 fish-speech,会导致本节点报错。这在大型 ComfyUI 安装(50+ 节点)中并不罕见。
从更宏观的视角看,Fish Audio S2 的开源和 ComfyUI-FishAudioS2 的出现,代表了 AI 语音合成从"云端 API 调用"向"本地可复现工作流"迁移的大趋势。
2026 年的 TTS 领域呈现出三足鼎立的格局:闭源 API(ElevenLabs、Azure TTS)提供最稳定的服务质量;半开源模型(Fish Audio S2、CosyVoice)提供本地部署能力;完全开源项目(Coqui XTTS、XTTS-v2)则面向极客用户。Fish Audio S2 在这个生态中找到了一个精妙的位置——开源模型权重、提供高质量本地推理能力,同时通过 ComfyUI 节点这种形式与最流行的开源创作工具深度绑定。
从增长曲线看,项目 4 个月获得 256 星、34 个 fork,说明在 ComfyUI 生态中,语音合成是一个真实存在的强需求。而多角色分轨输出的设计(Multi-Speaker Split),精准对接了虚拟主播和 AI 动画短片的 Lip Sync 工作流需求,这是一个正在快速增长的细分市场。
如果你已经在运行 ComfyUI,且手头有一张 24GB+ 的 NVIDIA 显卡,ComfyUI-FishAudioS2 是目前将前沿 TTS 语音克隆集成进工作流的最成熟方案。只需在 ComfyUI Manager 中搜索安装,重启后即可使用——从安装到生成第一条克隆语音,总耗时不超过 30 分钟。