FunASR
比 Whisper 快 170 倍的工业级语音识别工具包,支持 50+ 语言和说话人分离
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
比 Whisper 快 170 倍的工业级语音识别工具包,支持 50+ 语言和说话人分离
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:ModelScope 团队 — FunASR 的背后组织
想象一下:Whisper 处理一段 1 小时会议音频需要约 5 分钟,而 FunASR 仅需 21 秒。同样的结果,效率相差 14 倍。这不是实验室数据,而是 FunASR 团队在 NVIDIA RTX 3090 GPU 上,用 SenseVoice-Small 模型实测的公开 benchmark 数据。
FunASR(Fundamental End-to-End Speech Recognition Toolkit)由阿里云 ModelScope 团队开源,是一个专注于工业级语音识别的端到端工具包。项目于 2022 年在 GitHub 发布,核心作者为阿里巴巴达摩院语音实验室。ModelScope(魔搭)是阿里旗下的开源模型平台,FunASR 是其语音方向的核心项目之一,也是国内最活跃的语音识别开源项目之一。
打个比方:FunASR 像是一套「傻瓜式」的多功能厨房设备——你只需要把食材(音频文件)放进去,按一个按钮,它就能自动完成洗菜(VAD 语音活动检测)、切菜(说话人分离)、烹饪(语音识别)、摆盘(标点恢复)等全套流程,输出可以直接端上桌的成品。Whisper 则更像一把瑞士军刀——功能强大,但你得自己搭配辅助工具才能完成同样效果。
FunASR 的核心优势在于「All-in-One」的端到端设计。它将语音活动检测(VAD)、说话人分离(Diarization)、语音识别(ASR)、标点恢复(Punctuation)四个环节整合为一个连贯流程,用户只需调用一个 AutoModel 接口,传入音频路径,即可获得带时间戳、说话人标签和标点符号的结构化文本输出。项目支持 SenseVoice、Paraformer、Whisper 等多种前端模型,其中 SenseVoice-Small 是团队自研模型,在中文场景下性能对标甚至超越 Whisper-large-v3,而体积更小、速度更快。此外,FunASR 还内置情感识别(开心/悲伤/愤怒检测),这是 Whisper 完全不支持的能力。
FunASR 提供多种部署形式。Python 用户可通过 pip install funasr 一键安装,配合 ModelScope 平台自动下载模型权重,3 行代码即可完成推理。开发者也可将 FunASR 部署为 OpenAI 兼容的 HTTP API 服务(funasr-server),对接 LangChain、Dify、AutoGen 等 Agent 框架,或通过 MCP Server 接入 Claude Desktop / Cursor 等 AI 编程工具。硬件方面,SenseVoice-Small 在 RTX 3090 上达到 170 倍实时转写速度,即使在 CPU 模式下也能达到 17 倍实时,适合没有 GPU 的个人用户。FunASR 支持 50+ 语言,提供 ONNX 运行时和 WebSocket 流式接口,可用于实时字幕、会议记录等场景。唯一的门槛是需要先安装 PyTorch 2.0+,项目未提供 Docker 一键部署。
FunASR 代码库采用标准 Python 包结构,funasr/ 为主模块目录,核心子目录包括:
setup.py 定义了 funasr[all] 完整依赖包(含 transformers、accelerate 等训练套件),基础安装仅依赖 scipy、librosa、PyYAML、soundfile 等音频处理库。runtime/ 目录提供了丰富的多语言部署方案(Python HTTP 服务、gRPC、ONNX 运行时、WebSocket 流式接口、iOS/Android 移动端),说明项目在工业部署上投入了大量工程资源。
FunASR 的崛起反映了端到端语音模型从「云端垄断」向「私有化部署」迁移的大趋势。随着 SenseVoice 等国产自研模型在公开 benchmark 上逐步超越 Whisper,开发者有了更多高质量、开源可用的选择。FunASR 的 MCP Server 支持使其能无缝接入 AI Agent 工作流,这在 AI Native 应用爆发的当下尤为重要——语音输入正在成为 Agent 的重要交互通道。