SuperTonic
99M参数的端侧多语言TTS引擎,31语言实时合成,ONNX Runtime驱动,数据完全本地处理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
99M参数的端侧多语言TTS引擎,31语言实时合成,ONNX Runtime驱动,数据完全本地处理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Supertonic 3 官方宣传图
你有没有想过,手机上那些正在加载的语音助手,每次出声都要把数据送到云端再返回——延迟高、隐私差、没网就罢工。而 Supertonic 3 告诉你:不需要了。
Supertonic 是由韩国 AI 音频公司 Supertone 开源的多语言文本转语音(TTS)系统。2026年4月发布第三代 Supertonic 3,支持 31种语言,参数量仅 9900万(约99M),却能达到与 0.7B~2B 参数大模型相当的语音质量,所有推理完全在本地运行,不依赖任何云端 API。
延迟之痛:传统云端 TTS 的网络往返延迟通常在 300ms~2s 以上,Supertonic 3 实现了本地实时合成,官方 benchmark 显示其延迟远低于云端方案。对于需要实时交互的场景(语音助手、播报机器人、无障碍阅读器),这是一个本质区别。
隐私之痛:医疗、金融、客服等场景下,用户语音数据不能出境。Supertonic 3 完全离线运行,数据永远不离开设备。
体积之痛:传统端侧 TTS 模型动辄几百MB甚至数GB,Supertonic 3 的 99M 参数模型体积大幅缩小,Raspberry Pi 这类边缘设备也能跑。
Supertonic 3 的核心是 ONNX Runtime——一个跨平台、高性能推理引擎,Supertone 将训练好的神经网络导出为 ONNX 格式,实现了硬件无关的本地部署。

图2:模型参数量对比(来源:官方 benchmark)
项目采用多语言联合训练策略,一个统一模型覆盖全部 31 种语言,无需针对每种语言单独微调。输入端支持语言标签指定(lang=zh),也支持 lang=na(not applicable)模式,由模型自动判断输入文本的语言类型并自适应合成——这对混语内容创作者非常友好。
在音频表达层面,Supertonic 3 引入了一套 Expression Tags 机制:<laugh>、<breath>、<sigh> 等10种内联标签,可以精准控制合成语音的情感风格,无需额外的参考音频或提示工程。
输出规格为 44.1kHz 16-bit WAV,属于录音棚级别采样率,可直接用于生产环境,无需额外的音频上采样步骤。
Supertonic 3 罕见地提供了 11种语言/平台的官方 SDK:
Python SDK 在 2026年5月新增了 supertonic serve 命令,可一键启动本地 HTTP 服务器,同时暴露 /v1/tts(原生)和 /v1/audio/speech(OpenAI 兼容)两个端点,无缝替换 OpenAI TTS API,现有基于 OpenAI 的应用无需改代码即可迁移。
Web 版通过 ONNX Runtime Web + WebGPU 在浏览器中直接运行 ONNX 模型,无需服务器中转,打开网页即可体验完整 TTS 功能。

图3:CPU/GPU 延迟与内存占用 benchmark(来源:官方 benchmark)
Python 快速开始(3步完成):
pip install supertonic
supertonic generate --text "你好世界" --lang zh
Web 在线 Demo:直接访问 HuggingFace Spaces(https://huggingface.co/spaces/Supertone/supertonic-3),浏览器中体验,无需安装任何依赖。
硬件需求:CPU 推理即可,无需 GPU。推荐 2GB RAM + 1GB 磁盘空间。树莓派 4、骁龙芯片手机均可运行。
局限性:
Supertonic 3 的出现,标志着 TTS 领域从云端垄断向端侧普及的转变。它证明了:在语音合成任务上,足够小的模型配合足够好的训练,可以兼顾质量、速度与隐私三要素。
从开源社区角度看,Supertone 同时维护 11 个语言 SDK,这在 AI 开源项目中极为罕见,体现了团队对开发者体验的高度重视。尤其是 OpenAI-compatible API 端点的加入,让生态迁移成本几乎为零。
随着 Supertonic 3 于 2026年5月正式登陆 Supertone Play 和 Supertone API 商业平台,其开源模型与商业服务形成了完整的组合拳——开源版本满足隐私敏感场景,商业版本提供托管服务和音色克隆能力。