VibeVoice
微软开源的前沿语音 AI,支持 60 分钟长音频识别和多语言实时合成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
微软开源的前沿语音 AI,支持 60 分钟长音频识别和多语言实时合成
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你可以用任何语言和机器对话,它不仅能听懂,还能记住一小时对话里的每个细节,精准分辨出是谁在什么时候说了什么。这不再是科幻——微软开源的 VibeVoice 正在把这件事变成现实。
VibeVoice 诞生于 2025 年 8 月,由微软研究院团队开源发布。项目最初定位为长文本语音合成(TTS)模型,能一次性合成最长 90 分钟的对话语音,支持 4 人同时对话,并在 ICLR 2026 上获得了 Oral 论文的殊荣。然而团队很快发现,开源的 TTS 代码存在被滥用的风险——高质量合成语音可能被用于深度伪造。为此微软做出了一个重要决定:主动下架 TTS 核心代码,但保留了推理工具,并将其演化为一个专注于语音识别的开放平台。
这个决定展现了微软对 AI 安全的重视,也让 VibeVoice 转型为 ASR 领域的重要力量。
VibeVoice 的核心创新在于它的语音分词器设计。传统 ASR 模型通常将音频切分成极短的片段(25-50ms),导致上下文丢失和计算量爆炸。VibeVoice 则采用了连续语音 Tokenizer,将音频以 7.5Hz 的极低帧率压缩——每秒只提取 7.5 个离散标记,却能保留几乎全部的声音细节。
这相当于把一部 2 小时的电影压缩成 54,000 个精心设计的「电影画面的摘要」,而传统方法可能需要数百万个片段。这个设计让 VibeVoice 能在单次前向传播中处理长达 60 分钟的连续音频,同时保持完整的说话人识别和时间戳信息。
在生成模型层面,VibeVoice 采用了 Next-Token Diffusion 框架:先用大型语言模型(LLM)理解文本语义和对话逻辑,再用扩散头(Diffusion Head)生成高保真的声学细节。这种「语言理解 + 声学生成」的分层架构,是 VibeVoice 在长音频场景下保持准确性的关键。

图1:VibeVoice 官方 Logo
VibeVoice-ASR 在多项语音识别基准测试中表现优异。在 Diarization Error Rate(DER,说话人分离错误率)测试中,VibeVoice 显著优于主流开源方案,这意味着它能更准确地判断「这句话是谁说的」。在字符级词错误率(cpWER)和时间对齐词错误率(tcpWER)上,VibeVoice 同样达到了前沿水准。

图2:DER 性能对比
此外,VibeVoice-ASR 支持自定义热词(Customized Hotwords),用户可以注入特定领域术语、人名或背景知识,显著提升专业场景下的识别准确率。支持 50+ 语言的多语言原生识别,让它可以处理多语言混合的国际会议和跨国对话场景。

图3:语音合成效果展示
除了 ASR,VibeVoice 还保留了 2025 年 12 月发布的 VibeVoice-Realtime-0.5B 模型。这是一个仅 5 亿参数的轻量级实时 TTS 模型,支持流式输入——用户可以边打字边听到合成的语音,首音延迟低至 300 毫秒以内。它能在消费级 GPU(如 RTX 3090)上流畅运行,且支持最长 10 分钟的连续语音生成。
VibeVoice 已集成到 Hugging Face Transformers 官方库中,用户可以直接通过 pipeline("automatic-speech-recognition") 调用微软的语音识别能力,无需额外部署。
从代码结构来看,VibeVoice 采用了高度模块化的设计:
| 模块 | 职责 |
|---|---|
modular/tokenizer.py | 连续语音 Tokenizer,将音频编码为离散 token |
modular/text_tokenizer.py | 文本 Tokenizer,处理语义输入 |
modular/diffusion_head.py | 扩散头,负责声学细节生成 |
modular/modeling_vibevoice*.py | 核心模型实现(ASR/Streaming/TTS) |
processor/ | 音频预处理和后处理 |
configs/ | 模型配置 |
vllm_plugin/ | vLLM 推理加速插件 |
依赖栈:PyTorch + Transformers + Accelerate + Diffusers,推理端支持 Gradio Web UI 和 FastAPI 服务。
方式一:Gradio 在线体验(推荐零技术背景用户)
微软提供了 ASR Playground,用户可以直接上传音频文件(最长 60 分钟),获得包含说话人、时间戳和内容的结构化转录结果,全程无需安装任何软件。
方式二:Colab 笔记本(适合开发者)
VibeVoice 提供了 Google Colab 教程,在免费的 T4 GPU 上就能跑通流式 TTS 推理,15 分钟内完成首次体验。
方式三:本地 pip 安装
pip install vibevoice
需要 Python 3.10+、CUDA 11.8+ 和至少 8GB 显存的 NVIDIA GPU。模型权重从 HuggingFace 自动下载。
VibeVoice 官方明确声明:不建议用于商业或现实世界应用,当前版本仅供研究和开发目的。微软特别强调了深度伪造(Deepfake)和虚假信息传播的风险,要求用户确保转录内容可靠、准确,避免以误导方式使用生成内容。
此外,VibeVoice 的语音合成(TTS)部分代码已被主动下架,当前开源仓库中仅保留了 ASR 和 Realtime 模型。如需商用语音合成能力,建议关注微软官方商用许可条款。
截至目前,VibeVoice 在 GitHub 上已获得 47,000+ Stars 和 5,000+ Forks,社区活跃度极高。项目已被收录进 Hugging Face Transformers 官方发行版,并持续有来自全球开发者贡献的 Finetuning 代码和实验模型。