Qwen-Audio
阿里开源通用音频理解大模型,统一处理语音/音乐/环境声等30+音频任务,多项基准达到SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里开源通用音频理解大模型,统一处理语音/音乐/环境声等30+音频任务,多项基准达到SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,对着一段音频直接提问——"这段音频里的人在说什么情绪"、"这首歌的高潮部分从几分几秒开始",甚至让AI帮你总结一段播客的核心内容?
这不再是科幻场景。2023年11月,阿里云通义千问团队开源了Qwen-Audio——一个通用的大规模音频语言模型(Large Audio Language Model),它能同时理解和处理语音、音乐、自然声音等多种音频输入,并以自然语言文本作为输出。更进一步,基于Qwen-Audio微调的Qwen-Audio-Chat还支持多轮对话、多语言问答、语音时间戳定位等交互能力,在GitHub上迅速积累了近2000颗星。
传统的音频AI模型往往是"专精一个任务"——语音识别模型只做ASR、音乐分类模型只打标签、情感识别模型只判断情绪。这种"烟囱式"架构的问题是:每新增一个任务就要重新训练一个模型,数据难以复用,部署成本极高。
Qwen-Audio团队的做法是:用一个统一的框架同时训练30多种音频任务。具体架构上,它以阿里自研的Qwen-7B(70亿参数的大语言模型)作为"大脑",以OpenAI的Whisper-large-v2作为"耳朵"——Whisper负责把原始音频信号转成高维特征向量,这些特征与文本token在嵌入层对齐后,一起送入Qwen的语言模型进行联合训练。
这个"听觉+语言"的双塔设计带来了一个关键优势:不同任务的知识可以共享。比如,让模型学会理解中文语音的语义后,它在做中文情感识别时也能受益;再比如,识别说话人性别这类副语言线索,在音乐欣赏任务中同样有用。团队通过设计统一的多任务学习框架,让30多种任务在训练过程中相互促进,而非相互干扰。
从学术基准测试来看,Qwen-Audio在多项任务上达到了SOTA水平:在Aishell-1中文语音识别任务上,WER(词错误率)仅为1.2%—1.3%,超越Paraformer等专用ASR模型;在LibriSpeech英文语音识别上,test-clean达到2.0%的WER,同样刷新记录;在Clotho音频字幕任务上,BLEU-4分数也名列前茅;在情感识别(Aishell-2)、声音场景分类(cochlscene)、VocalSound等数据集上同样表现领先。
图1:Qwen-Audio 整体架构——音频编码器(Whisper) + 语言模型(Qwen-7B) 的联合训练框架
对于普通开发者而言,Qwen-Audio的上手门槛相对友好。项目提供了完整的HuggingFace和ModelScope模型权重下载,通过几行Python代码即可加载模型:
from transformers import AutoModelForCausalLM, AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen-Audio-Chat", trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen-Audio-Chat", device_map="cuda").eval()
然后,用统一的tokenizer.from_list_format接口传入音频文件和文本问题,就能获得回答:
response, history = model.chat(tokenizer, query=query, history=None)
Qwen-Audio-Chat的交互能力相当丰富。它支持多轮对话——在第一轮问"这段音频里的人在说什么",第二轮追问"那个人是什么情绪",模型能结合上下文给出连贯答案。它还支持语音时间戳定位(speech grounding)——直接问"'middle classes'这个词从几分几秒开始",模型会给出精确的时间区间,甚至可以用来做音频标注工具。此外还支持多语言理解(中英日韩德西意等)以及方言识别(如重庆话)。
不过,Qwen-Audio也有明显的局限。首先,它不是生成式模型——无法生成音频,只能理解和分析。其次,作为2023年11月发布的模型,其7B参数规模在复杂推理任务上可能不如同期的GPT-4级别模型。再次,本地部署需要GPU:推荐16GB以上显存(实测Qwen-7B全参数加载需要约14GB显存),没有GPU的开发者只能借助云端API。此外,Whisper编码器的30秒音频分块机制限制了单次输入的最大长度,长音频需要分段处理。
从行业视角看,Qwen-Audio代表了"LLM for Audio"这一新范式——用大语言模型统一处理多种音频理解任务,打破了传统音频AI的"一个模型一个任务"模式。它的多任务学习框架为后续的AudioLM、Wav-Chat等项目提供了重要的参考。随着开源社区持续优化量化推理(如llama.cpp GGUF量化),未来在中低端硬件上本地运行音频大模型将成为可能。