Qwen3-Omni
首个开源原生端到端全模态大模型,同时理解文本、音频、图片、视频并实时语音回复
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个开源原生端到端全模态大模型,同时理解文本、音频、图片、视频并实时语音回复
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1: Qwen3-Omni 官方 Logo
想象一下这个场景: 你在开车时突然想起一个问题, 张口就问, AI不光能听懂你说的每一个字, 还能实时用语音回答你——这背后需要同时处理文本, 音频, 视频三种信息流。传统做法是把这些模态分开建模, 再拼接在一起, 就像让三个翻译员接力工作, 既慢又容易出错。
阿里巴巴通义实验室推出的 Qwen3-Omni 就是来解决这个问题的——它是真正意义上端到端的原生全模态大模型, 一个模型同时看, 听, 读, 说, 不需要任何后处理环节。
在 Qwen3-Omni 出现之前, 即使是最强大的多模态模型, 也大多采用分立式架构: 视觉编码器处理图片, 语言模型处理文字, 语音模块另外单独运行。
这种方式有三个根本性缺陷:
Qwen团队在2025年9月发布的Qwen3-Omni, 通过统一架构设计, 在36项音视频基准测试中取得了22项SOTA, ASR, 语音理解等能力与Gemini 2.5 Pro持平。
Qwen3-Omni 的核心架构包含两个关键组件:
Thinker(思考者): 这是模型的主体部分, 基于Qwen3系列语言模型, 负责文本生成和复杂推理任务, 采用了MoE(混合专家)架构来控制计算成本。
Talker(说话者): 轻量级流式语音合成模块, 负责将Thinker生成的文本实时转化为自然语音。Thinker和Talker协同工作: Thinker边推理边产出文本token, Talker同步流式生成音频波形。
这种设计保证了语音输出的低延迟——用户不需要等待Thinker完成全部推理才能听到回复, 而是可以边推理边听, 实现了类似真人对话的体验。
Qwen3-Omni 提供两种推理后端:
Transformers 模式(适合研究和小规模推理): 使用Hugging Face Transformers加载模型, 支持Flash Attention 2加速。最低显存需求约24GB(使用30B-A3B稀疏激活版本), 适合单卡A100或双卡4090。
vLLM 模式(适合生产级高吞吐): 使用阿里巴巴定制的vLLM分支(qwen3_omni branch), 支持Tensor Parallel分布式推理, GPU Memory Utilization可配置到0.95, 吞吐量大但是显存要求更高。
项目提供了多阶段Dockerfile, 基础镜像为 nvidia/cuda:12.4-devel-ubuntu22.04, 内置CMake 3.26, Python 3, ffmpeg, libsndfile1等依赖, 可直接 docker build 构建。
图2: Qwen3-Omni 官方介绍视频封面
项目内置 web_demo.py, 基于Gradio 5.44构建Web界面, 支持:
Dockerfile已内置Gradio及其依赖, 构建好镜像后可直接启动Web Demo。
项目提供了18个Jupyter Notebook教程, 覆盖丰富场景:
| 教程 | 说明 |
|---|---|
| speech_recognition | 语音识别 |
| audio_caption | 音频描述 |
| speech_translation | 语音翻译 |
| video_description | 视频描述 |
| image_question | 图片问答 |
| ocr | 文字识别 |
| music_analysis | 音乐分析 |
| object_grounding | 物体定位 |
每个教程都可以直接在Jupyter环境中运行, 非常适合学习全模态模型的实战方法。
显存门槛高: 30B-A3B模型即使使用稀疏激活, 也需要至少24GB显存, 这将大多数个人开发者拒之门外——没有高性能GPU就无法本地运行。
中文语音效果: 模型支持多语言, 但实测中文语音的自然度相比英文仍有提升空间, 部分用户反馈中文音色略显生硬。
vLLM定制分支: 生产环境推荐使用vLLM推理, 但需要使用阿里巴巴维护的定制vLLM分支, 而非官方vLLM, 维护成本和升级风险略高。
Qwen3-Omni的发布标志着开源多模态模型正式进入原生端到端全模态时代。此前类似能力(GPT-4o, Gemini)均为闭源, 而Qwen3-Omni首次将实时语音+全模态理解的能力开源。
从增长曲线看, Qwen3-Omni于2025年9月26日冲上Hugging Face Trending Top 1, GitHub星标在数月内突破3800+。这说明开源社区对全模态实时交互的需求极为旺盛。
总体而言, Qwen3-Omni是一个技术上具有里程碑意义的项目, 它用一套统一架构替代了传统的多模型拼接方案, 为实时全模态AI交互树立了新标杆。对于想深入研究全模态大模型的开发者而言, 它既是优秀的基准模型, 也是极佳的学习素材。