Spark-TTS
基于Qwen2.5的LLM-TTS模型,一段参考音频即可零样本克隆任意音色,支持中英双语可控语音生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于Qwen2.5的LLM-TTS模型,一段参考音频即可零样本克隆任意音色,支持中英双语可控语音生成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你是一位内容创作者,想要为自己的视频配上专属配音,却苦于没有录音设备和专业声线;又或者你是科研人员,需要合成不同语料的语音数据集。过去,这些需求往往意味着昂贵的专业设备、漫长的录音周期,或者被迫接受通用TTS工具机械冰冷的合成音。而今天,Spark-TTS 正在改变这一切——它只需要一段10秒的声音样本,就能克隆出几乎完美复现的专属嗓音。
Spark-TTS 由香港科技大学(HKUST)、南方理工大学(SJTU)、西北工业大学(NPU)、出门问问(Mobvoi)联合研发,2025年3月在 arXiv 发表论文。该项目的核心创新在于提出了单流解耦语音 Token 机制——不同于传统级联式TTS系统(文本→声学特征→声码器→音频),Spark-TTS 基于 Qwen2.5 大语言模型,直接从文本预测离散语音码,从而实现端到端的高效语音合成。
这种架构的优势非常直观:系统组件大幅精简,推理速度更快,同时避免了多阶段模型之间的误差累积。简单类比,就像从「翻译→润色→朗读」三个接力棒,变成一个全能选手一气呵成——中间环节越少,信息损失自然越少。
图1: Voice Cloning 推理流程图

Spark-TTS 提供两大核心能力:零样本声音克隆(Voice Cloning)和可控语音生成(Voice Creation)。
零样本声音克隆是其最具想象力的功能。用户只需提供一段参考音频及其对应文本,模型即可合成任意文本内容、但音色风格完全一致的语音。这一能力天然适合:个性化语音助手、辅助残障人士的声音恢复、无录音棚条件下的专业配音等场景。项目 demo 页面展示了用特朗普语音说中文、用《原神》中钟离角色的声音说英文等案例,中英双语切换自然流畅,韵律风格保持高度一致。
可控语音生成则更进一步:无需参考音频,用户可以直接通过调节性别、音高、语速等参数,从零「捏」出一个虚拟说话人。这对于需要批量生成不同属性的测试语音、或者构建多角色内容的开发者来说非常实用。
在推理性能方面,团队还提供了基于 Nvidia Triton + TensorRT-LLM 的部署方案。在单张 L20 GPU 上,RTF(实时因子)可达 0.07 左右,即 1 秒音频的实际推理耗时约 70 毫秒,已具备实时应用的基础。
图2: Spark-TTS Logo

从代码结构来看,Spark-TTS 采用了标准的模块化设计:sparktts/ 下分 models/(模型核心)、modules/(神经网络组件)、utils/(工具函数);cli/ 提供命令行推理入口;example/ 包含示例脚本。项目依赖 PyTorch 2.5+、Transformers 4.46+ 以及 Gradio 5.18(WebUI 框架)。
模型权重托管在 HuggingFace(SparkAudio/Spark-TTS-0.5B),0.5B 参数规模,属于轻量级 LLM,在消费级 GPU(如 RTX 3090)上完全可跑。值得注意的是,项目官方明确仅发布推理代码,训练代码和数据集(VoxBox)仍在 roadmap 中尚未公开——这是当前版本的主要局限之一。
安全方面,项目 README 末尾专门加入了用途免责声明:明确禁止将零样本声音克隆用于未经授权的语音模仿、欺诈、深伪造等非法用途,并呼吁社区负责任地使用 AI。这反映了当下语音克隆技术的核心伦理挑战。
部署方面,项目提供了两种交互方式:python webui.py 启动 Gradio WebUI(推荐),或通过 python -m cli.inference 使用命令行。对于没有 GPU 的用户,代码支持 CPU 降级运行,但推理速度会大幅下降。
需要注意的是,项目未提供 Docker 容器化,所有依赖(特别是 CUDA、PyTorch)需要手动安装。这对没有深度学习环境的用户来说有一定门槛。不过,requirements.txt 依赖列表清晰,Python 3.12 + CUDA 11.8 环境下的安装流程较为顺畅。如果在大陆网络,可以切换阿里云 pip 镜像加速。
Spark-TTS 所在的赛道是当前 AI 语音领域最活跃的方向之一。相比微软 VALL-E、Meta Voicebox 等方案,Spark-TTS 的优势在于:参数规模更小(0.5B vs 通常 1B+)、推理效率更高、代码完全开源且附带详细 benchmark 数据。对于想要快速尝鲜 LLM-TTS 的开发者来说,是一个低门槛的优质起点。
当然,零样本克隆的质量上限仍受限于参考音频的质量和语音多样性,且目前缺乏训练代码意味着研究者无法在此基础上继续微调。若团队后续开源 VoxBox 数据集和训练流程,该项目的完整价值才会真正释放。
综合来看,Spark-TTS 是一个技术扎实、文档完善、demo 丰富的高质量开源 TTS 项目,适合语音合成研究者、内容创作者以及 AI 应用开发者关注。