Verbify-TTS
AI 驱动的本地 TTS 工具,一键朗读屏幕上任何选中文本
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI 驱动的本地 TTS 工具,一键朗读屏幕上任何选中文本
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Verbify-TTS 项目 Logo
深夜研读一篇 50 页的英文论文,密密麻麻的 PDF 让人眼酸不已。你会不会想:要是有人能把这些文字念给我听就好了?盲人用户、无障碍需求者、 multitasking 重度用户都有同样的诉求。传统 TTS 引擎机械生硬,读出来的英文满是机器腔;商用语音服务要么按次收费,要么需要复杂 API 注册。MattePalte/Verbify-TTS 正是为解决这个痛点而生——它能把屏幕上任何选中的文字,用 AI 生成的高自然度语音朗读出来,完全免费、无需注册、离机运行。
Verbify-TTS 由独立开发者 Matteo Paltenghi 创建,GitHub 主页显示其头像与项目同名。项目创立于 2022 年 7 月,至今已获得 137 Stars、16 Forks,23 个 open issues 说明社区参与度不低。README 中特别提到"不注册、不订阅、不追踪"——在 AI 服务普遍走向订阅制的时代,这种隐私优先的设计理念本身就是一种差异化竞争。
从 server.py 的源码结构来看,Verbify-TTS 的技术栈非常清晰:
# 核心模型加载
from tensorflow_tts.inference import TFAutoModel
fastspeech2 = TFAutoModel.from_pretrained("tensorspeech/tts-fastspeech2-ljspeech-en")
mb_melgan = TFAutoModel.from_pretrained("tensorspeech/tts-mb_melgan-ljspeech-en")
processor = AutoProcessor.from_pretrained("tensorspeech/tts-fastspeech2-ljspeech-en")
这意味着整个 TTS 管道分为两阶段:
FastSpeech2(文本→梅尔频谱图):FastSpeech2 是微软 & 浙江大学 2020 年提出的非自回归 TTS 模型,相比 WaveNet 等自回归模型,推理速度快 10 倍以上。它将文本转为频谱图特征,同时支持语速控制(speed 参数)。
MB-MelGAN(梅尔频谱图→音频波形):Multi-Band MelGAN 是高通 2020 年提出的轻量级声码器,比 Real-Time VGAE 快 6 倍,在 CPU 上也能实时合成。生成的音频通过 pygame.mixer 播放。
整个推理链路:文本输入 → idioms 替换 → 缩写拆分 → FastSpeech2 → MelGAN → pygame 播放,全部在本地运行,音频数据从不离开用户设备。
| 功能 | 说明 |
|---|---|
| 全屏文本朗读 | 复制屏幕上任意文字,脚本自动朗读,支持 PDF、浏览器、Word 等任何桌面应用 |
| 语速调节 | config.yaml 中 reading_speed: 1.45(默认快速),支持 API 层面 speed 参数 |
| idioms 定制 | 修改 configuration/idioms.csv,自定义特殊词汇发音(如"e.g."读作"for example") |
| 命令行工具 | command_read.py / command_stop.py 支持 Linux,command_read_win.py / command_stop_win.py 支持 Windows |
| REST API | Flask 服务暴露 5069 端口,支持 HTTP 请求调用 TTS 能力 |
这是 Verbify-TTS 最大的限制。requirements.txt 显示依赖包含 tensorflow-gpu==2.6.0,FastSpeech2 和 MelGAN 模型推理完全依赖 GPU 加速。官方安装脚本(INSTALL_LINUX.sh)提供了虚拟环境 + pip 安装的完整流程,但没有提供 Docker 化部署,GPU 环境需要用户自行配置 CUDA/cuDNN。
安装步骤简述:
INSTALL_LINUX.sh(自动创建虚拟环境并安装依赖)configuration/config.yaml 配置语速和端口python3 server.py,Flask API 监听 5069 端口对于没有 NVIDIA GPU 的用户,这个项目实际上无法运行——CPU 模式下 FastSpeech2 推理会极慢(单句可能需要几十秒),官方也未提供任何云端 API 调用方式。
tensorspeech/tts-fastspeech2-ljspeech-en 专门在 LJ Speech 数据集上训练,对中文、日文等其他语言支持为零。tensorflow-gpu==2.6.0 版本较旧(发布于 2021 年),与新版 CUDA 存在兼容性问题。Verbify-TTS 代表了一种端侧 AI 语音合成的趋势——在本地运行、无需网络、保护隐私。与 Coqui TTS、ESPnet 等学术框架相比,Verbify-TTS 的优势在于开箱即用的"屏幕文字→语音"场景封装,而非通用 TTS 工具箱。对于需要无障碍辅助、专注模式阅读(focus reading)、或者想让论文自动朗读给眼睛放假的研究者,它是一个值得一试的轻量方案。
分析时间:2026-07-30 | 技术栈:TensorFlow 2.6 / FastSpeech2 / MB-MelGAN / Flask 2.0 | 许可:MIT