KittenTTS
仅25MB的轻量级英文TTS模型,pip一键安装,CPU高效推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
仅25MB的轻量级英文TTS模型,pip一键安装,CPU高效推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你正在开发一款智能助手,需要为它添加语音播报功能。主流方案要么依赖云端 API(意味着隐私风险和费用),要么需要 10GB+ 的本地模型(普通电脑根本跑不动)。而 KittenTTS 打破了这两个困境——一个只有 25MB 的模型,在你的笔记本电脑 CPU 上就能跑出媲美云端效果的英文语音。
KittenTTS 由初创公司 KittenML(关联企业 Stellon Labs)于 2025 年 8 月开源,是当前开源社区中最轻量的 TTS(Text-to-Speech)模型之一。它的核心设计思路是「小而美」:不追求生成数十种语言,也不追求高保真音乐合成,而是专注于英文语音合成这一个场景,做到极致轻量化。项目采用了 Apache-2.0 开源协议,但同时提供商业支持渠道(付费定制声音和企业授权),这种开源加商业的双轨模式在 AI 领域越来越常见。
打个比方:如果把 GPT-4 这样的通用大模型比作一位什么都懂的全科医生,那 KittenTTS 就像是专攻英文朗读的播音员——它只会说英语,但说得清晰、标准、省资源。一个 Python 包,几行代码,就能让任何应用开口说话。
KittenTTS 提供三个参数规模的模型供用户选择:最轻量的 nano 版本只有 15M 参数(int8 量化后仅 25MB),适合资源极度受限的边缘设备;micro 版本 40M 参数(41MB),在体积和质量之间取得平衡;mini 版本 80M 参数(80MB),提供最高的合成质量。所有模型均基于 ONNX 格式导出,这意味着它们可以在 ONNX Runtime 上运行,兼容 CPU 和 GPU 推理,无需 PyTorch 或 TensorFlow 等重型依赖。
核心技术栈分为三层。最底层是 espeakng,用于将输入文本转换为国际音标(IPA),这一步叫「音素化」(phonemization)。中间层是 ONNX 推理引擎,负责将音素序列转化为梅尔频谱图(Mel-spectrogram)。最上层是 vocoder,将频谱图转换为实际的音频波形。值得注意的是,项目采用了流式生成(streaming)设计,通过 generate_stream() 方法可以边生成边播放,实现接近实时的语音播报体验。
内置 8 种音色:Bella(女声,明亮)、Jasper(男声,沉稳)、Luna(女声,柔和)、Bruno(男声,温暖)、Rosie、Hugo、Kiki、Leo,覆盖不同风格场景。支持语速调节(0.5x 到 2.0x)和文本预处理(数字自动展开为英文单词、货币符号转换、时间格式规范化等),开箱即用。输出格式为 24kHz 采样率 WAV 文件,满足大多数应用场景的音频质量要求。
上手门槛极低。如果只需要快速体验,无需克隆仓库或编译代码,直接一行 pip 安装 wheel 包即可运行。对于 GPU 加速场景,需要额外安装 CUDA 相关依赖。整个安装过程在 2 分钟内完成,生成一段 10 秒音频在 CPU 上耗时约 1 到 2 秒。
当然,KittenTTS 也有其局限性。首先,它仅支持英文,多语言支持在 Roadmap 上但尚未实现——中文用户若要语音合成中文文本,还需要先将文字翻译成英文再合成,语音流畅度会打折扣。其次,作为新兴项目(2025年8月首次提交),API 仍在活跃迭代中,不同版本之间可能存在 Breaking Changes,生产环境使用需要锁定版本号。第三,目前没有提供 Android 或 iOS 等移动端 SDK,移动端集成需要等待官方 Roadmap。
从行业角度看,KittenTTS 的出现折射出一个趋势:AI 能力正在加速下沉到端侧。随着 ONNX 和 MobileLLM 等技术的成熟,5 年前需要服务器集群才能运行的 AI 模型,如今可以装进一个 iOS App 里。这类「小于 100MB 的 AI 模型」正在形成一个全新的生态位——它们比 API 便宜、比云端安全、比本地大模型轻便,特别适合隐私敏感型应用(医疗、法律、金融)和离线场景(车载系统、IoT 设备)。KittenTTS 在这个生态位中占据了英文 TTS 这个高频需求点,14000 多 GitHub Stars 证明了开发者的认可。