SenseVoice
多语言语音理解基座模型,一站式支持 ASR、情感识别、语种检测、事件检测,比 Whisper 快 15 倍
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
多语言语音理解基座模型,一站式支持 ASR、情感识别、语种检测、事件检测,比 Whisper 快 15 倍
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,当你上传一段包含多人对话、背景音乐和情绪起伏的音频时——传统方案需要调用多个模型:先跑语音识别,再接情感分类,还要处理噪音分离。而 SenseVoice 的做法是:一次输入,同时输出文字、语种、情感和事件标签。这不是简单的"缝合怪",而是从预训练阶段就将多任务能力内化到模型权重中的原生多模态架构。
SenseVoice 由阿里巴巴通义实验室旗下的 FunAudioLLM 团队开源,GitHub 累计获得超过 8000 颗星,是目前开源社区中功能最全面的语音理解模型之一。
2022 年底 OpenAI 发布 Whisper 后,全球开发者普遍将其视为语音识别的"银弹"——高精度、多语言、零样本能力,几乎统一了行业基线。然而,Whisper 的本质是一个纯语音识别模型:它只负责"把听到的声音转成文字",至于这句话是高兴还是悲伤、背景里有没有狗叫、说话人用的是粤语还是普通话,统统不在它的职责范围内。
这催生了一个强需求:能否有一个模型,在保持 Whisper 精度优势的同时,原生支持情感识别、语种判断、事件检测等附加任务?FunAudioLLM 团队正是带着这个问题,在 2024 年 7 月正式发布了 SenseVoice 系列。
项目的技术路线选择了一条"小步快跑"的务实路径:SenseVoice-Small 版本在参数量与 Whisper-Small 相当的情况下,通过非自回归(Non-Autoregressive)端到端架构,实现了比 Whisper-Large 快 15 倍的推理速度,同时在中文、粤语等语种上取得了明显更优的识别效果。

图1:SenseVoice 模型定位——多任务语音理解基座
SenseVoice-Small 采用了CTC(Connectionist Temporal Classification)+ 自监督预训练的技术路线。与 Whisper 基于 Transformer 的自回归解码不同,SenseVoice 的推理过程是一次性并行输出所有 token,不需要逐帧生成后再预测下一个。这种架构选择带来两个直接收益:
推理速度大幅提升:官方 benchmark 显示,处理一段 10 秒音频,SenseVoice-Small 仅需约 70ms,而 Whisper-Large 需要超过 1000ms。更关键的是,随着音频时长增加,SenseVoice 的耗时几乎保持线性(得益于 batch 处理),而自回归模型的延迟会随序列长度二次增长。
多任务输出统一建模:情感标签(<|HAPPY|>、<|SAD|>、<|ANGRY|>、<|NEUTRAL|>)和音频事件标签作为特殊 token 内嵌到输出序列中,与文字内容一同由 CTC loss 联合优化。这种设计避免了训练多个独立模型的高成本,也保证了各任务之间的信息共享。
SenseVoice 支持超过 50 种语言,在中文(AISHELL-1/2、 WenetSpeech)和粤语识别上表现尤为突出,超越了 Whisper 的基线水平。英文识别上与 Whisper 基本持平。对于需要处理跨境客服、多语种会议记录等场景的用户,这套模型可以直接替代 Whisper + 多个语种专项模型的组合。
SenseVoice 的情感识别能力是它区别于 Whisper 的核心亮点。在多个中文/英文 benchmark 数据集上,SenseVoice-Large 均达到了最优效果,SenseVoice-Small 也能在多数数据集上超越其他开源情感识别方案。

图2:情感识别 benchmark 结果,SenseVoice-Large 在多数数据集上达到 SOTA
在实际使用中,情感标签会附加在识别文本的末尾(如 今天真高兴。<|HAPPY|>),开发者可以直接提取用于情感分析、客服质检或舆情监控。
SenseVoice 虽然主要在语音数据上训练,但仍然具备一定的音频事件检测能力。在 ESC-50 环境音分类数据集上,SenseVoice 的效果接近专业事件检测模型 BEATS 和 PANN,能够识别音乐、掌声、笑声、哭声、咳嗽、喷嚏等常见人机交互事件。

图3:音频事件检测性能对比
需要注意的是,SenseVoice 的 AED 能力受限于训练数据规模,与专业事件检测模型相比仍有差距,适合作为辅助功能而非专项事件检测的替代方案。

图4:推理延迟对比,SenseVoice-Small 在长音频场景优势显著
非自回归架构的另一个直接优势在于推理效率。对于实时字幕、直播转写、语音助手等低延迟场景,15 倍的速度差意味着 SenseVoice 可以在消费级 GPU(如 RTX 4060 Ti)上实现实时流式推理,而 Whisper-Large 则需要专业级算力才能堪用。
SenseVoice 提供了完整的部署方案,对于没有深度学习工程经验的用户非常友好。
克隆仓库后,运行 python webui.py 即可启动 Gradio 图形界面。界面包含音频文件上传、实时录音、语种选择、ITN(逆文本正则化)开关等选项。

图5:SenseVoice Gradio WebUI 界面
对于需要集成到生产系统的用户,api.py 提供了一个基于 FastAPI 的 HTTP 服务接口。配合 docker-compose.yaml,可以一键启动带 GPU 加速的容器化服务,支持多并发请求。
Dockerfile 使用 pytorch/pytorch:2.3.1-cuda12.1-cudnn8-runtime 作为基础镜像,依赖通过 requirements.txt 管理,核心依赖包括 funasr、torch、torchaudio、fastapi 和 gradio。
硬件要求:至少需要 NVIDIA GPU(建议 4GB+ 显存),搭配 CUDA 12.1 环境。对于中小批量音频处理场景,RTX 3060 以上的消费级显卡完全够用。
finetune.sh 提供了完整的微调脚本,支持用户基于自有数据对模型进行领域适配。FunASR 框架提供了完善的数据预处理、梯度累积和混合精度训练支持。对于需要处理医疗口音、法律术语或行业黑话的用户,微调是提升识别准确率的必经之路。
SenseVoice 的出现代表了语音模型从"单任务专家"向"多任务通才"的演进趋势。在过去,语音技术栈通常需要多个独立模型串联工作:ASR + VAD + LID + SER + AED,每个模型单独部署、独立维护,延迟累加且错误会级联传播。
SenseVoice 的思路是用一个模型承接多种任务,通过多任务联合预训练实现能力融合。这与大型语言模型(LLM)领域从 BERT/RoBERTa 单任务模型向 GPT/Claude 通才模型演进的方向高度一致。
同时,SenseVoice 开源了完整的模型权重(基于超过 40 万小时的多语言语音数据训练)和推理代码,配合 ModelScope 和 Hugging Face 双平台托管,降低了用户的使用门槛。这对于需要快速验证语音 AI 能力的创业团队和研究机构来说,是目前性价比最高的选择之一。
非实时流式:SenseVoice 的推理以批量处理为主,对于真正的流式语音输入(如实时通话转写)支持有限,需要配合 VAD 模型做分段处理。
情感识别的主观性:情感判断本身具有较强的主观性和文化差异,模型输出的情感标签仅供参考,不宜作为高精度情感分析的唯一依据。
事件检测非专项:如前所述,SenseVoice 的 AED 能力不如专业事件检测模型,对于需要精细化音频事件分析的场景,建议使用 BEATS、PANN 等专项模型。
模型体积:虽然 SenseVoice-Small 相对轻量,但完整部署仍需要下载约 1GB 的模型权重,在网络受限环境下首次部署需要耐心等待。
SenseVoice 是目前开源社区中功能最全面、部署最友好的语音理解模型之一。它以非自回归架构实现了速度与精度的兼顾,原生支持语音识别、情感识别、语种判断和事件检测四大任务,配合 Gradio WebUI 和 FastAPI 可以快速落地。对于需要构建智能语音应用的企业或开发者,SenseVoice 提供了一条"开箱即用"的低门槛路径,值得优先尝试。