ultravox
端到端语音理解大模型,音频直接映射到 LLM 空间,实现百毫秒级低延迟语音对话
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
端到端语音理解大模型,音频直接映射到 LLM 空间,实现百毫秒级低延迟语音对话
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你一定见过这样的场景:对着智能助手说话,它先把你的语音转成文字,再让大模型"读"文字,最后生成回答。这种"语音→文字→理解→回答"的三段式流程听起来合理,但有一个致命的弱点——慢。每次对话都要等 ASR(语音识别)模型先跑完,大模型的响应至少延迟 1-2 秒。更糟糕的是,在这个过程中,语音里那些能传达情绪和意图的停顿、语气、笑了一声,都被白白丢掉了。
Fixie.ai 团队推出的 Ultravox 带来了完全不同的思路:它是一个原生多模态语音大模型,直接把音频映射到 LLM 的语义空间,不需要中间的 ASR 环节。这意味着模型"听到"和"理解"几乎是同时发生的,端到端延迟从秒级压缩到了百毫秒级别。
.png)
图1:Ultravox 项目概览
Ultravox 的核心创新在于音频到 LLM 空间的直接映射投影器(Audio-to-LLM Projector)。在此之前,AudioLM、SeamlessM4T 等工作已经证明神经网络可以将语音直接转为语义 token,但 Ultravox 的关键突破是将这一能力嫁接到了任意开源 LLM 之上——Llama 3.3 70B、Mistral、Gemma,通过轻量级投影器训练,让这些模型获得了"听"的能力。
项目从 2024 年持续迭代,截至 2025 年 12 月已发布至 v0.7 版本,GitHub 获星 4400+。Fixie.ai 团队背后有多年的对话 AI 积累,创始成员来自 Google、Meta 等公司,在语音和 NLP 领域有深厚的学术和工程背景。
| 方案 | 代表项目 | 延迟 | 端到端优化 | 多语言支持 |
|---|---|---|---|---|
| ASR + LLM 串联 | Whisper + GPT-4 | 2-3s | 无 | 好 |
| 原生多模态 | Ultravox | <500ms | 端到端 | 中(依赖训练数据) |
| SeamlessM4T | Meta Seamless | ~1s | 部分 | 极好 |
Ultravox 的默认模型基于 Llama 3.3 70B,输入是原始音频波形的特征(如 log-mel 频谱),输出是流式文本。你可以直接用 WAV 文件测试,也可以通过 Gradio 界面进行交互式对话体验。
# 安装
git clone https://github.com/fixie-ai/ultravox.git
cd ultravox && pip install poetry==1.7.1 && poetry install
# 启动 Gradio Web UI
just gradio
# 命令行推理
just infer --audio_path your_voice.wav
虽然 Ultravox 不是专门的 ASR 模型,但它展现出了令人惊讶的语音转写能力。在多个基准测试中,基于 70B 模型的结果与专业 ASR 系统(如 Whisper)相当,同时拥有更快的推理速度。
Ultravox 提供了完整的训练代码和数据处理流程,支持用户在自己的数据上微调投影器,从而适配特定语言、领域或说话风格。项目使用 Poetry 管理依赖,训练配置通过 YAML 文件定义,支持 WandB 日志和分布式训练(torchrun)。
Ultravox 的技术核心是音频投影器(Audio Projector)——一个小型神经网络,负责将音频编码器(如预训练的 HuBERT 或 MERT)的输出,转换为 LLM 能够理解的 token 嵌入。这一设计与 LLaVA 等视觉-语言模型中的视觉投影器思路一致,属于"模态对齐"的经典范式。
图2:Ultravox 模型架构(音频→投影器→LLM)
投影器的训练数据来源广泛,涵盖了多语言语音数据集,模型能够处理英语、日语、韩语等多语种语音输入。
项目提供了 ultravox/tools/infer_tool.py 和 ultravox/tools/gradio_demo.py 两套推理入口:
Ultravox 分为两个规格:
| 模型 | 显存需求 | 推荐硬件 | 适用场景 |
|---|---|---|---|
| Llama 3.3 70B | 80GB+ | A100/H100 × 1 | 最高质量对话 |
| 8B 变体 | 16GB+ | RTX 3090/4090 | 本地体验 |
较困难,原因如下:
cd ultravox/docker
docker build -t ultravox .
docker run --gpus all -p 7860:7860 ultravox
容器内已包含 Gradio Web UI,访问 http://localhost:7860 即可体验。
Ultravox 的出现代表了多模态 AI 的一个重要方向——从"拼接"走向"融合"。过去几年,AI 行业习惯于将不同模态交给不同的专用模型处理(ASR + LLM + TTS),但这种方法天然存在延迟瓶颈和信息损失。Ultravox 证明,通过统一的嵌入空间,语音可以直接参与 LLM 的推理过程,这在技术路径上与 GPT-4o、Claude 的语音能力探索方向一致。
从生态角度看,Ultravox 的开源策略让开发者可以在本地部署和微调自己的语音对话模型,这在企业级应用中具有重要价值——医疗问诊、法律咨询、教育陪练等场景都需要高度定制化的语音 AI,而不是通用 API 能满足的。
作者团队 Fixie.ai 也同步提供了 Ultravox Realtime 平台(ultravox.ai),为需要快速集成语音能力的开发者提供云端 API 服务。
本报告基于 GitHub 公开信息和项目 README 生成,数据截至 2025 年 12 月。