Qwen2
阿里通义千问开源大模型,支持119种语言,覆盖4B到235B全参数谱系,提供Instruct与Thi
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
阿里通义千问开源大模型,支持119种语言,覆盖4B到235B全参数谱系,提供Instruct与Thi
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Qwen3 系列模型官方 Logo
2025年5月,阿里巴巴通义千问团队正式发布 Qwen3 系列开源大语言模型,GitHub 迅速斩获 27,000+ Stars。这一数字背后,是国产开源 LLM 从「追赶者」到「并跑者」乃至「领跑者」的身份转变。Qwen3 不仅是参数的堆砌,更代表了国产团队在大模型预训练、后训练、推理优化全链路上的系统性突破。
阿里巴巴通义千问团队从 2023 年起持续深耕开源大模型领域。Qwen1 初代发布时,业界尚将其定位为「中文领域的 GPT-3 替代品」;Qwen1.5、Qwen2 逐步补齐多语言能力和代码能力;到了 Qwen2.5 时代,团队已开始在数学推理、长上下文等硬指标上与国际顶流掰手腕。
Qwen3 的发布,标志着通义千问正式进入「Thinking + Instruct」双模式时代。其中 Qwen3-Thinking-2507 专门针对复杂推理任务优化,在 AIME 24/25 数学竞赛、GPQA 等权威基准上逼近 o1/o3 闭源模型水平。而 Qwen3-Instruct-2507 则专注于通用对话与任务完成,覆盖从 4B 到 235B-A22B 的完整参数谱系,让从个人开发者到企业级部署都能找到合适的选择。
从 GitHub 仓库的组织结构来看,Qwen3 已形成一套成熟的开源发布范式:技术报告(Qwen3_Technical_Report.pdf)、完整文档(docs/)、评测套件(eval/)、示例代码(examples/)一应俱全,这本身也是对开源社区的尊重。
Qwen3 全系列基于 Transformer 解码器架构,采用分组查询注意力(GQA)、RoPE 旋转位置编码等现代 LLM 标配设计。从 README 披露的信息看,Qwen3-2507 在以下几个方面实现了显著提升:
团队在 Qwen3 的后训练阶段下了大量功夫。README 提到支持 SFT(有监督微调)和 RLHF(人类反馈强化学习),文档中还特别提到了与 Axolotl、LLaMA-Factory 等主流微调框架的集成指南。对于希望在特定领域定制模型的开发者,这意味着可以低门槛复用社区成熟工具链。
Qwen3 的另一大亮点是完善的推理生态:
| 推理框架 | 支持方式 | 适用场景 |
|---|---|---|
| vLLM | 官方 Dockerfile 集成 | 高吞吐批量推理 |
| SGLang | 文档专项介绍 | 复杂推理管线 |
| Transformers | 原生支持 | 灵活实验、小规模部署 |
| ** llama.cpp/Ollama** | 本地 CPU/GPU 运行 | 个人开发者快速原型 |
| LM Studio | 第三方集成 | 非技术用户图形界面 |
| TGI (Text Generation Inference) | 文档专项介绍 | 生产级推理服务 |
量化方面,Qwen3 全面支持 GPTQ、AWQ 以及 GGUF 格式,涵盖 INT4/INT8 等常见精度。Dockerfile 中集成了 auto-gptq 和 autoawq 工具链,开发者可以在容器内完成量化全流程。
Qwen3 提供了成熟的多阶段 Dockerfile(cuda121 版本),构建管线极为清晰:
base (CUDA 12.1 + cuDNN8)
↓
dev (工作目录 + 数据卷)
↓
bundle_req (torch 2.2.2 + transformers/accelerate)
↓
bundle_finetune (DeepSpeed + PEFT + Q-LoRA + 分布式训练依赖)
↓
bundle_vllm (vLLM 0.4.3 + fchat)
↓
bundle_flash_attention (Flash Attention 2.5.8)
↓
final (示例脚本 COPY)
开发者可以根据需要通过 --build-arg 控制构建阶段:例如只需推理可跳过 bundle_finetune,节省构建时间。Dockerfile 还附带了 docker_cli_demo.sh 和 docker_web_demo.sh 两个快速启动脚本,分别覆盖命令行和 Web 界面两种使用模式。
配合 FastChat (fchat) 组件,Qwen3 支持一键启动 Web 聊天界面。对于非技术用户而言,这是最友好的上手路径——拉取镜像、运行脚本、浏览器打开,三步完成本地对话助手部署。
| 模型尺寸 | 最低显存 | 推荐显存 | 典型 GPU |
|---|---|---|---|
| Qwen3-4B | 8GB | 12GB | RTX 3060 / A10G |
| Qwen3-30B-A3B | 24GB | 40GB+ | A100 40GB / H100 |
| Qwen3-235B-A22B | 多卡 | 8×A100 80GB | H100 集群 |
值得注意的是,MoE(混合专家)架构的 235B-A22B 通过稀疏激活大幅降低了单次推理的算力需求,使得超大模型的实用化门槛显著降低。
Qwen3 的文档体系是笔者见过的最完善的开源 LLM 文档之一,涵盖 Quickstart、Inference、Run Locally、Deployment、Quantization、Training、Framework 七个板块,且提供英中文双语版本。文档使用 Sphinx + Furo 主题构建,技术团队在文档上的投入肉眼可见。
从 examples/ 目录可以看出,Qwen3 积极拥抱开源生态:
README 明确提到 Qwen3 支持 RAG(检索增强生成)和 Agent(智能体)开发框架。结合其工具调用能力,开发者可以将 Qwen3 作为 Agent 的核心大脑,配合外部工具实现复杂的自动化任务链。
尽管 Qwen3 取得了令人瞩目的成绩,仍有一些值得关注的议题:
Qwen3 的 27,000+ Stars 不是偶然。这个数字背后是:
未来,随着 Qwen3 微调生态(Axolotl、LLaMA-Factory)的持续完善,以及更多垂直领域适配模型的涌现,Qwen3 有望成为中文开源 LLM 生态的「Android 时刻」——不是所有人都会用基础模型,但大多数人会基于它构建自己的应用。
相关资源