MOSS-TTS-Nano
0.1B 参数实时多语言 TTS,CPU 可跑,支持音色克隆
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
0.1B 参数实时多语言 TTS,CPU 可跑,支持音色克隆
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:MOSS-TTS-Nano 核心架构 — Audio Tokenizer + LLM 双模块串联,输出流式语音
凌晨两点,产品经理李明在赶一个明天要演示的概念产品。产品是一款多语言客服 AI,竞品演示需要现场展示「听过」用户说话后、立刻用同一种音色回复的功能。
他心里盘算:调 API?网络延迟太高。接开源大模型?服务器只有一台 4GB 内存的旧笔记本,根本跑不动。然后他发现了 MOSS-TTS-Nano——一个只有 0.1B 参数(约 200MB)的多语言 TTS 模型。实测在 MacBook Air M4 上,只用了 1 核 CPU,就做到了实时语音合成。演示全程离线跑完所有 demo。这不是科幻,这是 2026 年开源社区真实发生的事情。
语音合成(TTS, Text-to-Speech)早已不是高不可攀的技术。但当前主流开源方案(如 VALL-E、XTTS、CosyVoice)普遍面临两难:性能强的模型体量大(1B+ 参数),部署门槛高;体量小的模型质量差,难以用在真实产品里。
MOSS-TTS-Nano 的出现,正是为了解决这个矛盾。它来自 MOSI.AI(上海人工智能实验室关联公司)和 OpenMOSS 开源团队。OpenMOSS 团队的打法很清晰:不做最大的,只做最容易部署的。0.1B 参数听起来小,但在这个架构设计里,这个规模恰好覆盖了最有价值的语音生成任务——日常对话、多语言播报、语音克隆——而不需要为边缘场景浪费算力。
MOSS-TTS-Nano 采用业界主流的「音频分词器 + 大语言模型」双模块架构:
MOSS-Audio-Tokenizer-Nano:将语音信号压缩为离散 token(类似 LLM 的词表),大幅降低后续模块的计算量。这是整个 MOSS 语音家族(包含 TTS、VoiceGenerator、SoundEffect 等)的共享底层组件。
MOSS-TTS-Nano(LLM 模块):以文本为条件,生成对应的音频 token 序列。采用纯自回归方式,逐帧输出,支持流式生成(一边生成一边播放,延迟可低至数百毫秒)。
声码器解码:音频 token 再通过声码器还原为波形。模型支持 HuggingFace Transformers 生态,直接调用 .generate() 即可完成从文本到 WAV 的全流程。
技术栈方面,核心依赖为 PyTorch 2.7 + Transformers 4.57 + FastAPI。ONNX 推理版本已独立发布,推理阶段完全不依赖 PyTorch,在 Apple Silicon MacBook Air M4 上仅用 1 核 CPU 就能跑到实时速度,吞吐量比原 PyTorch 版本提升近 2 倍。架构示意如下:
图2:MOSS-Audio-Tokenizer-Nano 采用离散 token 表示,将语音压缩至低比特率
根据官方文档和 GitHub 仓库标注,模型支持英语、汉语、日语、韩语、德语、法语、西班牙语等 10 种语言的实时合成,且支持音色克隆——用户只需提供 3~10 秒的参考音频,就能让模型用该音色说任何内容。
这对于需要个性化语音产品的团队极具吸引力:不再需要为每种音色单独训练模型,一套参数,多种声音,部署一次,随处使用。模型已在 HuggingFace 和 ModelScope 双平台托管,并提供完整 ONNX 导出工具(位于 onnx/ 目录)。
方式一:pip 安装(推荐,5 分钟可跑通)
pip install moss-tts-nano
moss-tts-nano --text "你好,欢迎使用 MOSS-TTS-Nano" --output output.wav
方式二:本地 Web 服务(支持音色克隆)
python app.py
基于 FastAPI + Uvicorn 启动本地 Web 界面,上传参考音频、输入文本,即可在线体验音色克隆。上传参考音频后,模型会提取音色特征并在后续合成中复用。
方式三:ONNX CPU 推理(无 PyTorch,适合边缘设备)
python infer_onnx.py --text "Hello world" --backend onnx
ONNX 版本推理效率最高,适合边缘设备和浏览器扩展(MOSS-TTS-Nano-Reader 可在浏览器内直接运行,无需本地推理服务)。硬件门槛:只需 4GB 内存、2GB 硬盘空间,CPU 即可运行,完全不需要 GPU——这在同类开源 TTS 中极为罕见。
合成质量上限:0.1B 参数决定了其合成质量无法与 VALL-E 等 1B+ 级模型相提并论。对于高质量长音频需求,仍需更大参数的模型。
流式延迟有下限:虽然在高性能设备上表现流畅,但在低性能设备(如树莓派)上,实测端到端延迟仍在 1~2 秒区间,对实时电话客服等场景尚有压力。
中文韵律自然度:部分用户反馈,在长句中文合成时,韵律重音偶尔不够自然,需要通过文本规范化(Text Normalization)进一步优化。
Docker 支持缺失:目前官方未提供 Dockerfile 或 docker-compose,对于需要容器化部署的企业用户,需要自行封装。
MOSS-TTS-Nano 的出现,是 2025-2026 年开源 AI「轻量化运动」的一个缩影。从 LLaMA 到 Mistral,再到视觉模型的 SAM,再到 TTS 领域的 MOSS-TTS-Nano——业界越来越清晰地认识到:不是每个场景都需要 100B 参数。
MOSS-TTS 家族的产品线也印证了这一点:从 1.7B 的 MOSS-TTS-Full,到 0.6B 的 MOSS-TTS,再到 0.1B 的 MOSS-TTS-Nano,用户可以根据自己的硬件条件和质量需求,在精度和效率之间自由选择。从趋势看,2026 年将会有更多小参数、强能力的端侧 AI 模型出现,MOSS-TTS-Nano 提前卡住了 TTS 这个高频场景。
图3:MOSS-TTS 完整产品家族,从旗舰到 Nano,覆盖不同部署场景
GitHub 仓库现已有超过 3300 star,fork 数 435,issue 49 个(持续活跃),说明这个项目已经进入了不少开发者的工具箱。
MOSS-TTS-Nano 是一款定位清晰的端侧实时 TTS 工具,核心优势是:
不足之处在于合成质量上限受参数规模限制,且缺乏官方 Docker 支持。对于需要高质量语音合成的场景,建议搭配更大参数的 MOSS-TTS 模型使用;对于需要快速原型、低成本部署的产品,MOSS-TTS-Nano 已经是目前最值得尝试的开源方案之一。