AivisSpeech
基于 ONNX Runtime 的日语 TTS 桌面应用,兼容 VOICEVOX 模型生态,支持多风
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于 ONNX Runtime 的日语 TTS 桌面应用,兼容 VOICEVOX 模型生态,支持多风
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,自己动手做一段带有情感起伏的日语配音,而不需要专业录音棚?AivisSpeech 正是为这个需求而生——这是一款基于 AI 的日语文字转语音(Text-to-Speech)桌面应用,用户输入文本,就能生成自然流畅的日语语音。支持 Windows 和 macOS,提供图形化界面,操作门槛低至"下载安装即可使用"。

图1:AivisSpeech 主界面,支持音频波形可视化与语调参数调节
AivisSpeech 并非凭空诞生,它的"基因"里流淌着日本开源语音合成项目 VOICEVOX 的血液。项目作者在 README 中直言不讳:AivisSpeech 是以 VOICEVOX 编辑器 UI 为基础进行 rebranding 的产品,目的是在 LGPL-3.0 单一许可证下提供更纯粹的开源选择——VOICEVOX 本身采用双许可证(LGPL + 商业闭源许可),而 AivisSpeech 只保留 LGPL-3.0,降低了企业合规门槛。
AivisSpeech 的技术核心是配套项目 AivisSpeech Engine,一个基于 ONNX Runtime 的推理引擎,支持 AIVMX(Aivis Voice Model for ONNX)格式的语音合成模型。这一设计选择至关重要:将模型格式从 PyTorch 迁移到 ONNX,意味着引擎完全摆脱了 Python 运行时依赖,可以用纯 C++/ONNX Runtime 分发,体积更小、启动更快、部署更简单。
表面上,AivisSpeech 看起来只是一个音频生成工具。但在实际使用中,它的价值在于精细化的语音参数控制:
1. 多风格语音模型支持 AivisSpeech 支持 Style-Bert-VITS2 和 Style-Bert-VITS2 (JP-Extra) 两种架构的 AIVMX 模型文件。用户可以从 AIVM Generator 在线工具,将已有的语音合成模型(如 GPT-SoVITS、Whisper 等)转换为 AIVMX 格式,导入 AivisSpeech 中使用。这意味着用户不必被限死在官方模型上,可以自由探索社区模型生态。
2. 音频波形实时可视化 底层使用 pixi.js(高性能 2D WebGL 渲染库)实现音频波形的实时渲染,用户可以直观看到生成音频的声学特性。这在专业配音场景中非常重要——配音员需要看到语音的停顿、重音位置是否符合预期。
3. 日语文本分词与语调编辑 集成了 kuromoji(工业级日语分词器),对输入文本进行自动分词和音素标注,支持用户逐音节调整语速、音高、音量参数。这是区分"普通 TTS"和"专业 TTS"的关键能力。
4. 引擎热插拔架构 支持同时管理多个语音合成引擎实例,可以切换不同版本的引擎,或同时运行 VOICEVOX 引擎和 AivisSpeech Engine。这意味着它不仅服务于 AivisSpeech 自身生态,还兼容 VOICEVOX 生态积累下的丰富模型资源。
5. 跨平台构建 使用 electron-builder 进行跨平台打包,支持 Windows(NSIS 安装包)、macOS(dmg)、Linux(AppImage/deb)三种平台。Windows 10(22H2+)、macOS 13+、Linux 均在支持范围内。
AivisSpeech 的前端架构是研究桌面 AI 工具代码组织的优秀样本。368 个源文件分布在以下核心模块中:
| 模块 | 文件数 | 说明 |
|---|---|---|
src/domain/ | ~100+ | 业务逻辑层,核心状态管理 |
src/components/ | ~80+ | Vue 组件库,UI 原子化设计 |
src/backend/electron/ | ~26 | Electron 主进程,IPC 通信 |
src/composable/ | ~30+ | Vue 3 组合式 API 复用逻辑 |
src/openapi/ | ~60+ | 从引擎 OpenAPI 自动生成的 API 客户端 |
关键技术栈:
代码质量评分:85/100。项目拥有完整的 ESLint + TypeScript 类型检查 + 格式化(Prettier)+ Typo 检查(typos)+ Markdownlint 的质量门禁,测试覆盖率达到较高水平。文档质量极高——30+ 份文档覆盖架构设计、UX 规范、开发者指南、API 使用说明。
硬件需求极低:官方要求仅 1.5GB 以上空闲内存,无需 GPU。ONNX Runtime 的 CPU 推理优化使得普通办公电脑就能流畅运行。
安装步骤:
Models 目录开发者本地构建需要 Node.js >= 22.14.0、pnpm 包管理器,整体构建约需 30 分钟。
局限性需要正视:
AivisSpeech 的出现丰富了开源语音合成工具链。在它之前,VOICEVOX 几乎是日语 TTS 开源领域唯一的主流选择(另一竞争者是 COEIROINK,但生态较小)。AivisSpeech 的核心贡献在于:
1. ONNX 格式推动部署简化 将语音模型从 PyTorch 迁移到 ONNX 是一个技术判断而非营销噱头。ONNX 模型可以在任何支持 ONNX Runtime 的平台上运行——Windows、Linux、macOS、iOS、Android,甚至嵌入式设备。这意味着 AIVMX 格式的模型天生具有跨平台部署能力,而不需要 Python 环境。
2. 单一许可证降低企业合规风险 LGPL-3.0 允许商业使用且要求源码公开(若修改则需公开修改部分),相比 VOICEVOX 的双许可证,对不需要商业闭源授权的企业来说更加友好。
3. 模型格式标准化尝试 AIVM/AIVMX 不仅仅是一个文件格式,还附带完整的话者元数据(名称、简介、许可证、图标、语音样本),相当于给每个语音模型打上了"身份证"。这种标准化有助于构建可信赖的模型交易市场。
当前 GitHub 452 stars,项目处于活跃开发中(持续更新 release),配套的 AIVM Generator 在线工具和 AivisSpeech Engine 引擎项目也在同步推进,形成了较为完整的语音合成产品矩阵。
AivisSpeech 是一款以 VOICEVOX 编辑器为基础、专为日语语音合成设计的 Electron 桌面应用。它通过 ONNX Runtime 驱动的 AivisSpeech Engine 和标准化的 AIVMX 模型格式,在 LGPL-3.0 单一许可证下为用户提供了稳定、高效、跨平台的语音合成编辑体验。适合日语内容创作者、配音爱好者、以及需要在日语环境中集成 TTS 能力的开发者。部署难度中等(需安装编辑器+引擎双组件),无 Docker 支持,硬件要求极低,是普通 PC 即可运行的轻量级工具。
| 维度 | 评分 |
|---|---|
| 功能完整性 | 4/5 |
| 技术架构 | 4/5 |
| 文档质量 | 5/5 |
| 部署便捷性 | 3/5 |
| 社区生态 | 3/5 |