echogarden
跨平台语音处理工具集,npm安装即用,离线运行TTS/ASR/对齐/去噪等九大类语音能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
跨平台语音处理工具集,npm安装即用,离线运行TTS/ASR/对齐/去噪等九大类语音能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你是一名播客博主,刚刚录制完一期 90 分钟的访谈音频,却发现里面有大量口语填充词、背景噪音,以及一段需要替换的出错段落。传统做法是打开 Audacity 一帧帧手动处理——这意味着几个小时繁琐的精剪工作。而如果有一款命令行工具,能够自动检测并去除填充词、将语音精准转写为带时间戳的字幕、甚至把中文语音翻译成英文配音,你只需要几行命令就能完成这一切,那会怎样?
Echogarden 正是这样一款工具。它是一个功能完备的语音处理工具集,覆盖从语音合成(TTS)、语音识别(ASR)、强制对齐、语音翻译、语言检测、语音去噪、源分离到字幕生成的全链路能力。最特别的是,它既不需要 Python 环境,也不需要 Docker 或 GPU——只需要 Node.js,就能在一台普通电脑上跑起来。
Echogarden 由独立开发者 Rotem Dan 创建,仓库于 2023 年 4 月上线,至今(2026年6月)已积累约 446 个 GitHub Star 和 43 个 Fork。项目最初的设计目标是解决一个实际痛点:当时市面上的语音处理工具要么依赖云端 API(需要付费和网络),要么依赖复杂的 Python 生态(需要配置 CUDA、PyTorch 等),对于只是想快速处理一段音频的普通用户来说,门槛太高了。
Rotem 的思路很清晰:用 TypeScript 重写核心算法,借助 WebAssembly(WASM)和 ONNX Runtime 实现跨平台运行,把所有依赖都打包进 npm 包里,用户 npm install -g echogarden 就能用。这种"零门槛本地运行"的理念贯穿整个项目,也是它与同类工具最本质的区别。
Echogarden 的功能可以分为九个主要模块,每个模块都整合了多种底层引擎,用户无需关心技术细节,直接调用即可。
TTS 是 Echogarden 最亮眼的功能。它支持超过 18 种语音合成引擎,包括两大高性能离线模型:
此外还支持 ElevenLabs、OpenAI、Microsoft Azure、Amazon Polly、Google Cloud 等云端服务,覆盖英语、中文、日语、韩语等数十种语言。对于追求音质的用户,Kokoro 模型的表现已经可以媲美商业云服务,且完全离线运行。
Echogarden 内置了多个语音识别引擎:
Whisper 的集成最为完整,支持 word-level timestamps(词级时间戳),这对后续的字幕生成和强制对齐至关重要。
这是语音处理中的"对齐"问题:给定一段音频和对应的文本,自动标出每个词在音频中的起始和结束时间戳。Echogarden 实现了多种对齐算法:
对齐是制作精准字幕、语音数据标注、有声书时间轴同步的核心能力。Echogarden 支持 100+ 语言的对齐,这在开源工具中非常少见。
支持将一种语言的语音翻译成英文文本(通过 Whisper),并保持接近词级的时间同步。这意味着可以直接从一段西班牙语音频中提取英文字幕,时间轴与原音频对应,而不是传统方案中常见的"翻译完时间轴全乱了"的问题。
支持两种检测场景:
这对于多语言混合的音视频内容处理尤为重要。
VAD 负责在音频中找出"有人在说话"的片段,用于语音分割、静音去除和为后续识别/对齐预处理。Echogarden 集成了 4 种 VAD 引擎:WebRTC VAD、Silero VAD、RNNoise VAD,以及 Echogarden 自研的 Adaptive Gate 算法。
通过 RNNoise(基于 RNN 的噪声抑制)和 NSNet2(神经网络语音增强)减少背景噪声。对于录制的访谈、播客等非专业环境下的音频,去噪是提升可听性的关键步骤。
将混合音频中的不同声音层分离出来,例如从"人声+背景音乐"的混合中提取纯净的人声。Echogarden 集成了 MDX-NET 深度学习架构,这也是 Demucs 等知名音乐源分离工具的底层模型。
基于前述所有能力(识别 + 对齐 + 翻译),Echogarden 可以生成带时间轴的 SRT/VTT 字幕文件,支持句子级和短语级断句,并能处理多语言翻译字幕的场景。

Echogarden 项目维护组织头像
Echogarden 的代码库完全用 TypeScript 编写,源码目录 src/ 下包含 150 个模块文件,结构清晰:
src/synthesis/:17 种 TTS 引擎实现(AwsPollyTTS、AzureCognitiveServicesTTS、KokoroTTS、VitsTTS 等)src/recognition/:6 种 STT 引擎(WhisperSTT、WhisperCppSTT、SileroSTT 等)src/alignment/:5 种对齐算法(DTW、DTW-RA、Levenshtein、SemanticTextAlignment 等)src/voice-activity-detection/:3 种 VAD + 自研 AdaptiveGatesrc/denoising/:RNNoise、NSNet2src/source-separation/:MDX-NETsrc/nlp/:中文分词(jieba-wasm)、日文分词(kuromoji)、音素转换(IPA/Espeak)src/dsp/:FFT、MFCC、MelSpectrogram 等信号处理模块src/api/:统一 API 接口层(API.ts 是主入口)src/cli/:命令行界面src/server/:可选的 Server 模式,支持 HTTP API 服务关键的跨平台能力来自三方面:
onnxruntime-node 包提供了 CPU 推理能力,Whisper、Kokoro 等深度学习模型以 ONNX 格式运行这种架构的优势在于:开发者不需要懂 C++ 或 CUDA,只需要会 TypeScript 就能扩展新的语音引擎。
Echogarden 提供了两种使用模式:
# 安装
npm install -g echogarden
# 语音合成
echogarden synthesize -i input.txt -o output.wav --engine kokoro --voice af_heart
# 语音识别
echogarden recognize -i speech.mp3 -o transcript.json --engine whisper
# 强制对齐
echogarden align -i audio.wav -t transcript.txt -o aligned.srt
# 语音翻译
echogarden translate -i french_speech.mp3 -o english_subtitles.srt
import { synthesize, recognize } from 'echogarden';
const audio = await synthesize('你好,世界', {
engine: 'kokoro',
voice: 'zh_female_warm',
});
const transcript = await recognize('podcast.mp3', {
engine: 'whisper',
language: 'zh',
});
CLI 适合一次性批处理,API 适合集成到其他应用(如播客剪辑工具、有声书生成系统)。
离线 vs 云端的选择困境:虽然 Kokoro 和 VITS 等离线 TTS 质量已经很高,但与 ElevenLabs、OpenAI TTS 等商业方案相比,在音色的丰富度(多情感、多风格)和自然度上仍有差距。对于追求最高音质的内容创作者,可能仍需要商业云服务。
Whisper 推理性能:Whisper 在 CPU 上推理较慢,Echogarden 通过 ONNX 优化了性能,但长音频(1小时+)的识别时间仍然可观,没有 GPU 加速的情况下建议分段落处理。
Windows 特定依赖:Windows 平台需要额外安装 Microsoft Edge WebView2(用于某些 TTS 引擎),首次配置稍繁琐。
文档门槛:Engine 文档和 Options 参考虽然全面,但缺少面向新手的"从零到第一个 demo"的快速上手教程,对非语音技术背景的用户仍有学习曲线。
Echogarden 的出现填补了一个重要空白:此前,开源语音工具要么是 Python 生态中的一个个独立库(如 faster-whisper、pyttsx3),要么是商业云 API,都没有提供一个统一、本地、无依赖的解决方案。Echogarden 将这些能力用 TypeScript/WASM/ONNX 重新封装,意味着任何熟悉 JavaScript/Node.js 的开发者都可以参与到语音工具的开发和定制中,而不必学习 Python + CUDA 的复杂生态。
项目自 2023 年上线以来持续活跃维护,截至 2026 年 6 月已发布 v2.10.2,最近更新为 2026 年 4 月。GitHub 上的活跃 issue 包括添加 MiniMax 云 TTS 引擎、日语 Kokoro 音色扩展等,生态正在逐步丰富。
对于需要本地语音处理能力的企业或个人开发者,Echogarden 是一个值得关注的技术选型——它用 npm 一样的安装体验,换来了专业级的语音处理能力。