MOSS-TTSD
开源最长对话语音生成模型,支持60分钟多人对话和零样本音色克隆
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源最长对话语音生成模型,支持60分钟多人对话和零样本音色克隆
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,如果把一篇新闻稿交给AI,它不仅能读懂内容,还能用两个人的声音展开一场生动的辩论?MOSS-TTSD 正在做这件事。这个来自 OpenMOSS 团队的开源项目,把文字对话变成了有血有肉的多人语音对话,支持长达60分钟不间断的连贯输出,还能用几秒钟的参考音频克隆任意音色。
传统的文本转语音(TTS)系统擅长的是"朗读"——把一段文字变成单个人的声音输出。但现实中的对话远比朗读复杂:两个人、三个人甚至五个人轮流发言,打断、接话、语气起伏,这些才是真实交流的样子。
OpenMOSS 团队在开发 MOSS-TTS 基础模型的过程中,发现了一个巨大的需求空白——业界缺少一个真正面向"长对话"场景的开源方案。2025年6月,他们发布了 MOSS-TTSD v0,随后在一年内快速迭代至 v1.0,每次更新都显著提升了语音质量、克隆能力和生成稳定性。2026年3月,团队进一步支持了 SGLang 推理加速,最高达16倍性能提升。
MOSS-TTSD 的架构基于 MossTTSDelay——一个8B参数的大型 Transformer 模型,配合独立的 MOSS-Audio-Tokenizer 音频编码器使用。
核心流程是这样的:首先,用户提供1到5位说话人的参考音频(每段仅需几秒钟)和对应文本;然后,Audio-Tokenizer 将这些音频压缩成离散的 token 序列;最后,主模型在给定文本和参考音频 token 的条件下,自回归生成目标对话的音频 token,再解码回 WAV 文件。
这种"语音Tokenizer化"的方案借鉴了 VQ-VAE 思想,大幅降低了音频建模的计算复杂度,也使得长音频生成在工程上变得可控。模型支持最长60分钟单次生成不间断,中途无需重启,这是当前开源方案中极为罕见的能力。
MOSS-TTSD 目前支持 20种语言(中文、英语、德语、西班牙语、法语、日语、韩语、俄语、阿拉伯语等),并在中文和英语上进行了大量评估。团队自建了 TTSD-eval 评测框架,结合 MMS-FA 词级对齐和 wespeaker 说话人嵌入,在 Speaker Similarity(音色相似度)和 Speaker Attribution Accuracy(说话人归属准确率)两个指标上均超越了多个商业方案。
例如,在中文测试中,使用豆包 Podcast 音色作为参考时,MOSS-TTSD 的相似度达到0.8226,超越豆包本身的0.8034;在英文测试中,使用 Gemini TTS 音色时,相似度0.7893,也超越了 Gemini 自身的0.6786。
对于生产环境而言,生成速度至关重要。2025年9月,团队引入了 OpenMOSS 定制的 SGLang 分支,支持流式推理和批量处理。根据官方数据,相比纯 PyTorch 推理,SGLang 可实现最高16倍加速。2026年3月,v1.0版本进一步支持了端到端 SGLang 推理服务,只需启动一个服务器即可接受 API 请求,模型自动切换到 voice_clone_and_continuation 模式。
MOSS-TTSD 并非只有一个命令行工具。官方提供了 Gradio Web UI Demo(gradio_demo.py),用户可以直接在浏览器中上传参考音频、输入对话脚本、点击生成。社区开发者还贡献了多个衍生项目:ComfyUI-MOSS-TTS 将其集成到流行的 AI 图像工作流平台;MOSS-TTS-OpenAI 提供了 OpenAI 兼容的 TTS API,方便已有应用快速接入;AnyPod 则将 MOSS-TTSD 作为后端,实现自动从 PDF、URL 或长文本生成播客节目。
MOSS-TTSD 目前不提供 Docker 镜像,需要手动配置 Python 环境。推荐使用 conda 创建 Python 3.12 环境,通过 pip 安装 requirements.txt,额外安装 flash-attn 以启用 GPU 加速推理。硬件门槛较高:至少需要一块 NVIDIA GPU(推荐 A100/H100),显存不低于16GB,内存32GB以上,磁盘空间20GB+用于存放模型权重(两个模型合计约16GB)。
对于没有 GPU 的用户,可以访问 Hugging Face Spaces 上的在线 Demo 体验基础功能,或者通过 SiliconFlow API 接口(v0.5版本提供)远程调用。
项目仓库和论文末尾均明确声明了用途免责条款:严禁用于未经授权的声纹克隆、身份冒充、欺诈或 deepfake 制作。技术层面,模型在极端长音频(超过60分钟)时仍可能出现音色漂移问题;此外,极端噪声环境或非标准语言变体的参考音频会显著降低克隆质量。作为开源方案,当前缺乏企业级的 SLA 保障和商业支持。
MOSS-TTSD 的出现,填补了开源社区在"长对话语音生成"领域的能力空白。它不仅是 MOSS-TTS 家族(涵盖基础TTS、实时TTS、声音设计、音效生成)的关键一环,更代表了一种趋势——将大型语言模型的多模态生成能力,从文本扩展到高表现力的语音层面。随着多模态Agent的快速发展,能够生成自然多人对话的TTSD模型,将在播客自动化、音频内容创作、无障碍辅助等领域发挥越来越重要的作用。
项目基本信息
| 项目 | 说明 |
|---|---|
| 开发方 | OpenMOSS 团队(Fudan University 相关) |
| 开源协议 | Apache 2.0 |
| 核心架构 | MossTTSDelay Transformer (8B params) |
| 编程语言 | Python |
| 主要依赖 | PyTorch 2.9.1, Transformers 5.0.0, Gradio 6.5.1, librosa |
| 模型尺寸 | 8B 参数 |
| 硬件需求 | NVIDIA GPU (16GB+ VRAM), CUDA 11.8+ |
| 当前版本 | v1.0(2026-02-10 发布) |
| 论文 | arXiv:2603.19739 |
核心文件
inference.py — 批量推理入口,支持 JSONL 批量处理gradio_demo.py — Web UI 演示generation_utils.py — 音频预处理、采样参数解析等工具函数scripts/ — 模型融合、SGLang 请求示例等脚本