Qwen1.5
阿里开源大语言模型系列,率先支持双模式(思考/即时),MoE 架构领先开源基准评测
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里开源大语言模型系列,率先支持双模式(思考/即时),MoE 架构领先开源基准评测
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Qwen3 官方 Logo

2025年5月,阿里云通义团队正式发布 Qwen3,这是继 Qwen1.5、Qwen2 之后代号命名规则调整后的第三代开源大语言模型系列。在开源社区等待 GPT-4 开源的漫长岁月中,Qwen 系列已经悄然完成了从追赶者到领跑者的角色转换——全球开发者累计 Star 数超过十万,GitHub 累计 Fork 数破万,被广泛应用于企业知识库、代码助手、智能客服、科研文献分析等场景。
与前代 Qwen2.5 相比,Qwen3 并非简单的参数堆叠。它首次引入了 Thinking Mode(思考模式)和 Non-Thinking Mode(即时响应模式)的双模式设计:前者适用于复杂推理、数学证明、代码调试等需要「深思熟虑」的任务;后者则像一位训练有素的速记员,秒级响应简单问答。这种「快思考 + 慢思考」的双轨制,让 Qwen3 在保持低延迟的同时,在权威基准评测中超越了包括 GPT-4o 和 Claude 3.5 Sonnet 在内的多个闭源模型。
如果说普通大模型是一套只有「直觉」的系统——看到问题直接给答案——那么 Qwen3 的双模式设计,就像给 AI 同时配备了:
① 直觉脑(Non-Thinking):遇到「北京今天天气怎样」这类简单问题,毫秒级响应,不需要过度思考;
② 理性脑(Thinking):遇到「用微积分证明傅里叶变换的收敛性」这类复杂问题,自动切换深度推理模式,逐步拆解、反思、验证,最终输出严谨答案。
这种设计的巧妙之处在于:用户无需手动切换——模型根据问题复杂度自动选择最合适的处理路径。像一位经验丰富的老中医,面对感冒和疑难杂症都能从容应对。
Qwen3 基于纯 Transformer Decoder-Only 架构,并引入了多项前沿优化:
混合专家(MoE)架构:Qwen3-235B-A22B 采用 MoE 设计,总参数量 235B,但每次推理仅激活 22B 参数,大幅降低计算成本。换算成生活场景:这相当于一个图书馆(235B 参数)里只派了 3 名管理员(22B 活跃参数)来回应读者的每次查询。
扩展上下文窗口:支持高达 128K tokens 的上下文长度,足以一次性处理一部中篇小说、完整的技术文档集,或长达数小时的多轮会议记录。
多语言预训练:覆盖 119 种语言和方言,不仅包括中文、英文,还包括斯瓦希里语、豪萨语等低资源语言,展现了阿里全球化 AI 布局的战略眼光。
Qwen3 的开源仓库提供了完整的训练工具链:
预训练(Pre-training):支持大规模语料库预训练,仓库内置 eval/ 评估框架,支持标准基准测试(MMLU、HumanEval、GSM8K 等)。
微调(Fine-tuning):examples/llama-factory/ 目录提供了与 LLaMA-Factory 的集成配置,支持 SFT(有监督微调)和 RLHF(人类反馈强化学习);deepspeed 和 peft 库支持 LoRA / QLoRA 高效微调,普通消费级 GPU 也能微调小型模型。
量化(Quantization):支持 GPTQ、AWQ 和 GGUF 格式量化,4-bit 量化后的 7B 模型可在 Mac M系列芯片或单卡 RTX 3090 上流畅运行。
推理框架集成:官方文档推荐使用 SGLang、vLLM、Text Generation Inference(TGI)、llama.cpp、Ollama 等推理引擎,覆盖从生产级到本地轻量级的全场景。
从仓库结构来看,Qwen3 的工程化水平较高:
模块化目录设计:docker/(容器化)、examples/(示例代码)、eval/(评测框架)、docs/(文档),职责清晰。
多阶段 Dockerfile:提供的 Dockerfile-cu121 采用多阶段构建(base → dev → bundle_req → bundle_finetune → bundle),体积优化良好,生产镜像和开发镜像分离。
预构建 Docker 镜像:官方在 DockerHub 发布 qwenllm/qwen:2-cu121,配合 docker/docker_web_demo.sh 脚本,用户可在 3 分钟内启动 Gradio Web 界面,无需手动安装 CUDA 环境。
但同样值得注意的是,仓库未提供 docker-compose.yml(多服务编排)和 K8s 部署清单,这对需要集群化部署的团队来说是额外工作量;评测框架虽完整,但单元测试覆盖率信息不透明,中小开发者介入代码贡献有一定门槛。
# 克隆仓库
git clone https://github.com/QwenLM/Qwen1.5.git
cd Qwen1.5
# 启动 Web 界面(自动拉取官方镜像)
bash docker/docker_web_demo.sh \
-c Qwen/Qwen2.5-7B-Instruct \
--port 8901
浏览器访问 http://localhost:8901 即可看到 Gradio 对话界面。整个过程约 5-10 分钟(含镜像拉取)。
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_name = "Qwen/Qwen2.5-7B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype=torch.bfloat16,
device_map="auto"
)
prompt = "请用 Python 写一个快速排序算法"
messages = [{"role": "user", "content": prompt}]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
这种方式灵活性最高,适合需要定制推理流程、接入 LangChain、AutoGen 等 Agent 框架的场景。
| 模型规模 | 最低 GPU | 推荐配置 | 量化后最低 |
|---|---|---|---|
| Qwen3-4B | RTX 3060 (12GB) | 单卡 A10G | Mac M1 Pro |
| Qwen3-30B-A3B | A10G / RTX 4090 | 双卡 A100 40G | 单卡 3090 + GPTQ |
| Qwen3-235B-A22B | 多卡 A100 80G | 8xA100 80G NVLink | 不建议本地运行 |
Qwen3 的发布,在开源大模型生态中具有标志性意义。
首先,它证明了开源模型可以与闭源模型正面竞争。 在 MMLU、HumanEval、Math 等权威基准上,Qwen3-235B-A22B 超越了 GPT-4o 和 Claude 3.5 Sonnet,而其 MoE 架构使得部署成本大幅低于同性能闭源方案。
其次,多语言支持是阿里的差异化优势。 不同于 Meta LLaMA 系列以英文为核心,Qwen3 特别优化了中文和多种小语种能力,这让它在东南亚、中东、非洲等新兴市场的 AI 应用中占据天然优势——这些地区对本地语言模型的需求正高速增长。
第三,双模式设计为 Agent 应用打开了新空间。 Thinking Mode 让 Qwen3 能够处理复杂的多步推理任务(如自动化测试生成、科学文献综述),这正是当前 AI Agent 架构最需要的能力。可以预见,未来大量开源 AI Agent 项目将以 Qwen3 为底层模型构建。
当然,挑战依然存在:开源协议的模糊性(License: N/A)让商业应用存在法务风险;235B MoE 模型的部署门槛仍然较高;在中国以外的海外开发者社区,文档和社区运营相比 Meta LLaMA 仍有提升空间。
但无论如何,Qwen3 已经成为了开源大模型世界里不可忽视的一极。它不仅是阿里云技术实力的集中体现,更是中国 AI 开源力量走向全球的一张名片。