Qwen2.5-Omni
阿里通义千问端到端多模态旗舰模型,同时理解文字/图片/音频/视频并流式生成语音回复
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里通义千问端到端多模态旗舰模型,同时理解文字/图片/音频/视频并流式生成语音回复
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你在手机里发一段语音、附上一张图片和一段视频,问它"这段视频里的人在做什么,请用中文总结"——模型不仅能用文字回答,还能直接开口说话,把回答说给你听。这不是科幻,这是 Qwen2.5-Omni 已经开源的事实。

图1:Qwen2.5-Omni 官方品牌标识
2025年3月,阿里云通义千问团队正式开源了 Qwen2.5-Omni,这是千问系列的端到端多模态旗舰模型,能够同时处理文字、图片、音频、视频四种模态,并以流式方式实时生成文本回复和自然语音,在同类开源模型中尚属首次。该模型在 GitHub 上线后迅速获得超过 4000 颗星,成为多模态 AI 领域的现象级开源项目。
在 Qwen2.5-Omni 之前,业界主流的多模态方案通常将不同模态分开建模——视觉模型处理图片,语言模型处理文字,语音模型处理音频,再通过复杂的 adapter 连接。这种拼接式方案有两个天然缺陷:一是推理延迟高,跨模态信息传递需要多级中转;二是语音指令遵循能力弱于文字,因为语音信号在被转录成文字的过程中会丢失韵律、情感等信息。
阿里通义千问团队的核心创新在于提出了 Thinker-Talker 架构,从根本上解决上述问题。Thinker 负责理解所有模态的输入并生成思想,Talker 则将 Thinker 的输出转化为流式语音,两个模块以端到端联合训练方式协同工作。这意味着模型在听到你的语音指令时,不需要先转文字再理解,而是直接捕捉语音中的语义和情感,从而实现真正意义上的语音指令遵循。
Qwen2.5-Omni 的技术架构是理解这个项目的核心。与传统的单模型多模态方案不同,它将模型拆分为两个功能角色:
两者以 generate_speech special token 区分——Thinker 生成到这个 token 后,控制权移交给 Talker。这个设计的好处是:Thinker 和 Talker 可以共享大部分视觉/音频编码器权重,避免了 1:1 的双模型开销,同时 Talker 的流式解码让用户在模型思考的过程中就能听到语音,响应体验接近实时对话。
在基准测试中,Qwen2.5-Omni-7B 的表现令人印象深刻:

图2:Qwen2.5-Omni 官方演示视频封面,展示了音视频多模态交互能力
Qwen2.5-Omni 的功能边界远超一般的多模态模型,以下几个场景最具代表性:
1. 语音指令遵循(Speech Instruction Following) 这是 Qwen2.5-Omni 最具差异化的能力。用户可以直接用语音提问,模型以语音回应,效果接近文字交互。在 MMLU、GSM8K 等权威基准上,语音指令的准确率与文字指令几乎持平——这对语音助手类产品具有重要意义,意味着可以用更小的模型(7B)实现过去需要几十B参数才能达到的语音交互质量。
2. 音视频联合理解 给定一段视频和配套的音频轨道,Qwen2.5-Omni 能理解画面内容、人物对话、背景音效之间的语义关联。例如输入一段 vlog 视频,模型可以描述视频中的人物在厨房做菜,同时背景播放着轻音乐。在视频信息提取 Cookbook 中,官方演示了如何从屏幕录制中提取操作步骤并自动生成解说。
3. 音乐理解与生成 基于官方 Cookbook 中的 Music Cookbook,Qwen2.5-Omni 能够理解音乐的情感风格、曲式结构,并支持以语音形式描述音乐特征。这个能力对于音乐推荐系统、音乐教育等场景有直接应用价值。
4. 数学推理 通过 Omni Chatting for Math Cookbook,模型展示了在多模态场景下进行数学推理的能力——输入包含图表、公式图片的问题,模型能给出逐步推理的文本和语音解答。
Qwen2.5-Omni 在部署友好性上做了大量工作,官方提供了五种主要部署路径,用户可以根据自己的硬件条件选择:
路径一:官方 Docker(推荐生产使用) 项目提供了完整的 Dockerfile-omni-2.5-cu121 多阶段构建镜像,基于 CUDA 12.1 + cuDNN 8,包含完整依赖(PyTorch 2.6、transformers 4.52.3、Flash Attention 2 等)。配合 docker_web_demo.sh,拉取镜像后只需一行命令即可启动 Gradio Web 界面。Dockerfile 内置了 vLLM 推理加速阶段的构建,支持高性能服务化部署。
路径二:低显存方案(AWQ/GPTQ 4-bit 量化) 对于没有大显存显卡的用户,Qwen2.5-Omni 从 2025年5月16日起支持 4-bit 量化模型(GPTQ-Int4 / AWQ),实测可将 GPU 显存需求从 16GB+ 降低至 8GB 左右,性能损失在可接受范围内。项目仓库中的 low-VRAM-mode 目录提供了专门的低显存推理脚本。
路径三:vLLM 高性能推理 vLLM-Omni 项目提供了 Qwen2.5-Omni 的 vLLM 后端集成,支持 PagedAttention、连续批处理等优化,吞吐量比原生 HF Transformers 高出数倍,适合高并发服务场景。
路径四:MNN 边缘部署 2025年5月13日起,阿里 MNN(Mobile Neural Network)团队实现了 Qwen2.5-Omni 在端侧设备上的部署,支持 Android/iOS,可在手机等移动设备上运行推理。这对端侧 AI 应用具有里程碑意义。
路径五:本地 Python 推理 通过 web_demo.py 和 requirements_web_demo.txt,用户可以直接在本地环境运行 Gradio Web 界面。依赖包括 Gradio 5.23、transformers 4.52.3、librosa、ffmpeg 等,需要手动下载模型权重(Hugging Face / ModelScope)。
项目代码结构清晰,采用模块化设计:
代码质量方面,项目遵循阿里巴巴开源规范,Apache-2.0 许可证,文档质量极高(英文 + 中文双语文档,官方博客详细解释架构设计),测试覆盖包括各 Cookbook 示例和基准评估脚本。唯一的局限是:代码以模型推理和 Demo 为主,不包含预训练代码,核心模型权重需要从 Hugging Face 或 ModelScope 下载。
尽管 Qwen2.5-Omni 表现优异,仍有几个现实挑战值得关注:
Qwen2.5-Omni 的开源对行业有三重意义:
第一,它是开源社区大一统多模态路线的重要里程碑。 Google 的 Gemini、OpenAI 的 GPT-4o 曾代表闭源最前沿;Qwen2.5-Omni 以 7B 参数规模实现了与 GPT-4o 类似的多模态能力,让听见、看见、说出来不再是超大公司的专利。
第二,Thinker-Talker 架构为语音交互 AI 提供了新范式。 端到端语音指令遵循意味着语音助手不需要先转文字再理解,语音中的情感和韵律信息可以被模型原生感知。这对车载语音、智能客服、儿童教育等场景有直接影响。
第三,MNN 边缘部署验证了端侧大模型的可行性。 当 7B 多模态模型可以跑在手机上,端侧 AI 的想象空间骤然打开——实时翻译、视觉障碍辅助、增强现实交互,这些场景的落地时间线被大幅提前。
随着量化技术的持续优化和 vLLM 等推理框架的成熟,Qwen2.5-Omni 预计将在 2025-2026 年成为开源多模态 AI 的基准参考模型,吸引更多开发者在其上构建应用。