Qwen3
支持「思考模式」深度推理的国产开源大模型,Dense+MoE 双架构,0.6B~235B 全规格覆盖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
支持「思考模式」深度推理的国产开源大模型,Dense+MoE 双架构,0.6B~235B 全规格覆盖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025 年 4 月,阿里云通义千问团队正式开源 Qwen3。一时间 GitHub Star 火箭式蹿升,全球开发者社区的讨论帖几乎刷屏——不是因为"国产大模型终于追上 GPT-4"这类标题党,而是因为 Qwen3 真正做到了Dense 和 MoE 双轨并行 + 思考模式无缝切换,同时把参数规格从 0.6B 一路拉到 235B,提供了开源大模型历史上最完整的家族谱系。

图1:Qwen3 官方 Logo
截至 2026 年 6 月,Qwen3 已在 GitHub 收获超过 27,000 颗 Star,成为全球最受关注的开源大语言模型之一。Hugging Face 上的 Qwen3 系列模型下载量持续攀升,被无数开源项目直接引用。
通义千问团队的崛起,本身就是中国 AI 发展史的一个缩影。2022 年 ChatGPT 爆发时,彼时国内的大模型研发刚刚起步,Qwen 1.0 还只是一个 140 亿参数的中文对话模型,能力有限、生态孱弱。
但阿里云的优势在于:拥有国内最完整的云端算力基础设施 + 国内最大的企业级 AI 应用场景。这意味着团队可以从真实业务中迭代模型能力,同时有足够的 GPU 集群支撑预训练规模快速扩张。
从 Qwen 1.5 到 Qwen 2.0,再到 Qwen 2.5,每一代都有明显的能力跃升:
Qwen3 的发布时机也耐人寻味——正值 OpenAI GPT-5 发布前夜、Meta LLaMA 4 蓄势待发的空窗期。团队选择主动出击,用"全规格覆盖 + 双模式切换"这一差异化策略,在开源社区抢占了极其有利的生态位。
Qwen3 最大的产品创新,是将"深度推理"和"高效对话"做成了两个可以随时切换的模式,而不是两个完全独立的模型。
开启思考模式后,模型面对复杂问题时,会先生成一段完整的"思维链"(Chain-of-Thought),模拟人类拆解问题的过程:理解题意 → 列出步骤 → 逐项验证 → 得出结论。这不是简单的"先想后答",而是经过自我纠错和交叉验证的深度推理。
这背后的技术支撑包括:
在实际体验中,思考模式特别适合:数学证明(IMO 级别题目)、复杂代码调试、多步骤逻辑推理、长文档分析等任务。
切换到普通对话模式后,模型直接给出答案,延迟大幅降低,适合:
这种设计真正解决了"推理模型太慢、普通模型不够聪明"的矛盾。开发者只需一行配置,就能根据任务类型动态选择最优模式。
Qwen3 提供了业界最完整的大模型规格矩阵:
| 类型 | 规格 | 激活参数量 | 典型使用场景 |
|---|---|---|---|
| Dense 稠密 | 0.6B, 1.7B, 4B, 8B, 14B, 32B | = 总参数量 | 通用对话、嵌入式部署 |
| MoE 混合专家 | 30B-A3B | ~3B | 高效率推理,性价比最优 |
| MoE 旗舰 | 235B-A22B | ~22B | 企业级推理,逼近 GPT-4 水平 |
MoE 架构的核心价值是"稀疏激活":虽然总参数量高达 235B,但每次前向传播只激活 22B 参数。这意味着:
Qwen3 依然基于 Transformer Decoder 架构(因果语言模型,Causal LM),在以下方面进行了核心改进:
预训练阶段采用 DeepSpeed ZeRO-3 + Flash Attention,在数千 GPU 规模下实现高效分布式训练。后训练阶段支持:
Qwen3 提供了极其丰富的推理后端支持:
| 框架 | 特点 | 适用场景 |
|---|---|---|
| Transformers | 官方 SDK,最完整的功能支持 | 通用推理、微调 |
| vLLM | PagedAttention,高吞吐量 | 高并发 API 服务 |
| SGLang | RadixAttention, Prefix Caching | 长上下文任务 |
| TGI | HuggingFace 官方推理服务器 | 快速部署 |
| llama.cpp | GGUF 量化,CPU/GPU 混合 | 本地/边缘部署 |
| Ollama | 一键运行,社区活跃 | 开发者快速体验 |
Qwen3 所有规格均有 GGUF 量化版本(Q8_0、Q4_K_M 等),llama.cpp >= b5401 完全支持:
Transformers 推理(Python):
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-8B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3-8B-Instruct")
# 普通对话
prompt = "请介绍一下量子计算的基本原理"
# 思考模式:加入 thinking 标签
think_prompt = "<|think|>\n请证明费马小定理"
Ollama(无需任何配置):
ollama run qwen3:8b
# /set think # 开启思考模式
# /set nothink # 关闭思考模式
llama.cpp CLI:
./llama-cli -hf Qwen/Qwen3-8B-GGUF:Q8_0 -ngl 99 -c 40960 -n 32768
如果不想写代码,Qwen3 提供了 gradio Web 界面,配合 Docker 或直接 pip 安装即可:
# Docker 方式
bash docker/docker_web_demo.sh -c /path/to/Qwen3-8B-Instruct --port 8901
# pip 方式
pip install gradio transformers
python examples/demo/web_demo.py -c Qwen/Qwen3-8B-Instruct
浏览器打开 http://localhost:8901,即可与 Qwen3 对话。
| 维度 | 评估 |
|---|---|
| 硬件需求 | 最低 8GB VRAM(8B Q4 量化),推荐 16GB+ |
| 软件依赖 | Python 3.9+ / Docker |
| 模型获取 | HuggingFace / ModelScope 自动下载 |
| 量化方案 | GGUF 成熟,4-bit 量化效果稳定 |
| 综合难度 | 中等(需要一定工程经验) |
Qwen3 虽然在很多方面领先,但也有一些客观局限:
在超长上下文(> 100K token)场景下,部分开发者反馈存在"中间信息遗忘"现象。这是 Transformer 架构固有的注意力分散问题,Qwen3 虽然通过 RoPE + 扩展上下文做了优化,但在某些极端场景下仍不如专用长上下文模型。
开启思考模式后,模型的推理 token 数量会显著增加(有时生成数千 token 的思考过程才给出一个简短答案)。这在高并发 API 场景下意味着成本翻数倍。适合离线深度分析,不适合实时客服等低延迟场景。
Qwen3 全系列采用 Apache 2.0 许可证,是真正的"宽松开源"。但需要注意的是:
Qwen3 的发布,对开源 AI 生态有以下几个层面的深远影响:
凭借最全规格矩阵(0.6B~235B)和最丰富推理生态(vLLM/llama.cpp/Ollama),Qwen3 真正实现了**"从手机到集群的全场景覆盖"**。开发者可以根据硬件条件选择最优规格,而不必被"要么小模型太弱、要么大模型跑不动"卡住。
Qwen3 的 Thinking Mode 将"慢思考"能力带入了开源社区。这在此前只有 OpenAI o1/o3 和 DeepSeek-R1 等少数闭源模型具备。开源社区现在可以:
阿里云将 Qwen3 完全开源,并同时在 HuggingFace 和 ModelScope 双平台发布,这种"不绑平台"的姿态赢得了开发者信任。同时,ModelScope 为国内开发者提供了无障碍的下载通道,弥补了 HuggingFace 在国内的访问问题。
Qwen3 是 2025 年开源大模型领域的里程碑项目。它不只是在某个 benchmark 上刷了个高分,而是真正解决了几个核心问题:规格不完整、推理模式单一、部署门槛高。从 0.6B 的手机端小模型,到 235B 的企业级旗舰,Qwen3 提供了真正意义的全谱系覆盖;思考模式和非思考模式的切换,则让"聪明"和"快"不再是非此即彼的选择。
对于 AI 爱好者:Qwen3 是目前最容易本地部署、最具性价比的高质量开源大模型,适合日常使用和个人学习研究。对于 AI 开发者:Qwen3 的丰富推理生态(vLLM/SGLang/llama.cpp/Ollama)和完整的微调工具链(Axolotl/UnSloth/LLaMA-Factory),为构建生产级 AI 应用提供了坚实基础。
推荐星级:⭐⭐⭐⭐⭐(强烈推荐)