ClearerVoice-Studio
阿里开源的 AI 语音处理工具箱,一站式解决降噪、去混响、超分辨率与目标说话人提取
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里开源的 AI 语音处理工具箱,一站式解决降噪、去混响、超分辨率与目标说话人提取
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你在咖啡馆里用手机录制了一段播客,但背景里有磨豆机的轰鸣、邻桌的聊天声,人声被淹没了大半。你把这段音频发给 ClearerVoice-Studio,30秒后,它把背景噪音、杂音全部抹掉,只留下你清晰的人声——就像在专业录音棚里录的一样。
这就是 ClearerVoice-Studio 做的事:一个由阿里云通义实验室(Alibaba Group)开源的 AI 语音处理工具箱,能够对含噪、混响、带宽受限的真实世界音频进行「一键修复」。
现实世界的录音环境远比实验室复杂。手机录制会有环境底噪,视频会议会有回声,历史档案录音可能采样率极低,多人同时说话时声源还会互相干扰。这些问题不是简单的「音量调大」能解决的——降噪、去混响、超分辨率、说话人分离是四个独立又互相叠加的技术挑战。
阿里通义实验室从 2022 年起陆续开源了 FRCRN(用于语音去噪)和 MossFormer(用于语音分离)两个模型,仅在 ModelScope 平台就分别被调用超过 300万次和 250万次。开发者们不断在 issue 里问:「有没有一个统一的平台能同时用这些模型?」2024年11月,ClearerVoice-Studio 正式发布,将这些分散的 SOTA 模型整合到一个统一工具箱中,并配套开源了训练代码和评测工具。
如果把语音处理比作修图,ClearerVoice-Studio 就像 Photoshop 中的 Camera Raw 面板——不只是一支「降噪笔刷」,而是集成了曝光、锐化、超分辨率、人像分离等多个工具的统一工作区。你可以在同一个流程里,先分离多说话人音频,再对每个人声单独降噪,最后提升采样率输出高清音频。
相比 SpeechBrain、ESPnet 等通用语音框架,ClearerVoice-Studio 的定位更垂直:专注于语音质量提升这一件事,并把效果做到 SOTA 级别。它不像通用框架那样需要学习复杂的配置语法,普通 Python 开发者花 10 分钟就能跑通 demo。
这是工具箱最核心的功能。模型会对输入音频的频谱进行分析,预测一个「理想比值掩码」(Ideal Ratio Mask),从而将噪声成分过滤掉、保留纯净语音。支持从 16kHz 到 48kHz 全频段处理,后者即专业录音棚级别的「全带」(Full-band)音质。
代表模型 FRCRN 采用了复数卷积-循环网络架构:用复数 CNN 捕捉局部频谱模式,复数 RNN(FSMN)建模时序依赖,配合频率维度上的递归机制,对细粒度频谱进行精准分离。在 DNS-Challenge 2020 盲测数据集上,FRCRN 的 PESQ 分数达到了 3.42,远超传统方法。
当一段音频里有多人同时说话时(比如会议录音),语音分离能把每个人声轨道单独剥离出来。工具箱采用 MossFormer2 模型,这是阿里巴巴自研的混合 Transformer-循环架构,用单头门控注意力替代传统多头注意力,配合卷积增强的局部注意力块和线性化跨序列注意力,在效率与效果之间取得平衡。
又称带宽扩展(Bandwidth Extension)。如果原始音频采样率只有 16kHz(即电话音质),MossFormer2_SR_48K 可以将其上采样到 48kHz(蓝光音质)。模型架构结合了 MossFormer2 的序列建模能力和 HiFiGAN 的上采样器,loss 设计融合了 GAN 对抗训练 + 多尺度梅尔频谱损失,训练数据来自 LJSpeech 增强版 48kHz 数据集。
这是最具差异化的功能:给定一段参考语音或一段人脸视频,模型能从混合音频中精准提取目标说话人的声音。它支持四种条件信号:
其中,AV_MossFormer2_TSE_16K 模型融合了音频和视频两个模态的信息,在 MossFormer-Recurrent 模块处进行跨模态融合,在 Aishell-4 等数据集上取得了 SOTA 表现。
工具箱内置了 SpeechScore 评测工具包,集成了 DNSMOS、PESQ、STOI、SI-SDR 等多个业界标准指标,支持无参考(Non-intrusive)评测,用户无需干净参考音频也能评估处理后的语音质量。
ClearerVoice-Studio 提供了两条上手路径:
路径一:pip 一键安装(最简单)
pip install clearvoice
然后在 Python 中两行代码调用:
from clearvoice import ClearVoice
myClearVoice = ClearVoice(task='speech_enhancement', model_names=['MossFormer2_SE_48K'])
output = myClearVoice(input_path='input.wav', online_write=False)
myClearVoice.write(output, output_path='output.wav')
预训练模型会自动从 HuggingFace 下载,无需手动管理权重文件。
路径二:Streamlit WebUI(可视化交互)
cd clearvoice && python streamlit_app.py
打开浏览器即可上传音频文件、选择模型、实时预览处理效果。同时阿里在 HuggingFace Space 和 ModelScope 上也提供了在线 Demo,无需任何安装即可体验。
训练脚本(给研究者):项目还开源了完整的训练代码,覆盖语音增强、语音分离、语音超分辨率、目标说话人提取四个任务的微调和全量训练。训练数据合成脚本支持生成带噪语音或带噪-混响混合语音,支持 NCCL 多卡分布式训练,并提供完整的学习率调度和 checkpoint 管理方案。
尽管功能强大,ClearerVoice-Studio 也有其局限性:
1. GPU 是必须的:所有推理模型均基于 PyTorch 和 CUDA,CPU 推理速度极慢。对于没有 NVIDIA GPU 的用户,在线 Demo 是唯一可行的体验方式,而这又受限于 HuggingFace 的 GPU 配额(ModelScope 配额更充裕)。
2. 非 WAV 格式依赖 FFmpeg:如果你处理的是 MP3、AAC、FLAC 等格式,必须预先安装 FFmpeg,增加了环境配置的复杂度。
3. 多模态模型的隐私风险:AV-TSE 等需要上传人脸视频的模型,涉及生物特征数据的处理,在企业合规场景下需要额外的安全评估。
4. 缺乏生产级部署方案:没有 Dockerfile、docker-compose 或 Kubernetes manifest,对于需要在服务器上长期部署的应用场景,需要用户自行容器化。
ClearerVoice-Studio 的发布标志着阿里在语音处理领域从「论文 → 开源 → 平台」的全链路打通。截至 2025 年 1 月,项目已在 GitHub 获得 2800+ stars,FRCRN 和 MossFormer 系列模型在 ModelScope 的累计调用量超过 550 万次。
从技术趋势看,多模态(音视频融合)目标说话人提取是当前最活跃的研究方向。ClearerVoice-Studio 在这一方向上不仅开源了模型,还开源了基于脑电信号(EEG)的神经导航提取(NeuroHeed),代表了该领域的未来探索方向。同时,语音超分辨率与带宽扩展的结合,也将成为高清语音通话、播客制作、有声书录制等领域的基础设施。
对于 AI 开发者而言,ClearerVoice-Studio 的核心价值在于:它是目前门槛最低、效果最好的中文语音增强开源方案。无论是做语音识别(ASR)预处理、会议录音后处理,还是短视频音频优化,它都能提供开箱即用的 SOTA 模型支撑。