qwen3.6-windows-server
解压双击即用,把Qwen3.6-27B跑在Windows上的零门槛推理工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
解压双击即用,把Qwen3.6-27B跑在Windows上的零门槛推理工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
深夜,开发者的显卡风扇呼呼作响。他不想把公司机密数据上传到云端API,但也不想折腾 Linux 双系统、WSL、Docker——只是想在自己的 Windows 工作站上跑一个 270 亿参数的大模型,回答几个内部技术问题。
这就是 devnen/qwen3.6-windows-server 诞生的背景:为零配置 Windows 本地 AI 推理而生。
Qwen3.6-27B 是阿里巴巴通义千问团队发布的超大语言模型,270 亿参数,默认运行在 Linux + CUDA 环境下。要在 Windows 上跑通这个量级的模型,长期以来只有两条路:要么装 WSL(学习成本高、路径兼容麻烦),要么用 Docker(重、性能损耗明显)。
devnen(一个 Windows 原生开发工具链的老兵)决定打破这个僵局。他 fork 了 vLLM 引擎,针对 Windows 做了大量底层 patch,包括:内存分配绕过、进程间通信修复、Qwen3 推理结果解析器、CPU 中继分布式框架等,最终打造出这个"零门槛 Windows 原生推理工具"。
项目在 GitHub 获得了 220 颗星,跻身 Windows 平台本地 LLM 推理工具的第一梯队。
这是最主流的使用路径。用户只需:
VLLM_MODEL_DIR 指向模型权重(或让 TUI 引导下载)start.bat,一切自动完成TUI 启动器会依次引导:GPU 型号检测 → 选择推理快照 → 首次运行时自动引导嵌入 Python 安装必要依赖 → vLLM wheel 部署 → 一键运行一致性检查。
对于已有 Python 虚拟环境的高级用户,可以直接 pip install 预编译 wheel,跳过整个 TUI 引导流程,通过环境变量精准控制模型路径和运行参数。
项目保留了完整的 fork 源码树和构建脚本,适合需要自定义引擎行为或在 Blackwell 新架构上调试 patch 的开发者。
性能是这款工具最令人印象深刻的地方。官方 benchmarks 实测数据:
| GPU | 推理速度 | 备注 |
|---|---|---|
| RTX 5090(Blackwell) | 158 tok/s | 全新架构,表现最强 |
| RTX 3090(Ampere) | 72 tok/s | 30系列也能流畅运行 |
在 RTX 3090 上每秒 72 token 的速度,意味着生成一段 500 字的技术回答只需约 7 秒,已经接近可用的交互式响应速度。
背后的技术支撑是 vLLM 0.19/0.20 的 PagedAttention 内存管理,以及 devnen fork 中针对 Windows 环境的专项优化(TRITON_ATTN 后端、FP8_E4M3 KV 缓存、自动 Round 量化等)。
qwen3.6-windows-server/
├── launcher/ # Textual TUI 启动器
│ ├── app/ # Python 应用逻辑(screens/widgets)
│ ├── configs.yaml # 预验证 GPU+配置组合
│ └── start.bat # TUI 入口
├── snapshots/ # 各版本 vLLM 推理快照
├── wheels/ # 预编译 wheel 包
├── windows_tools/ # 性能评测 / 一致性检查工具
└── docs/ # 硬件兼容性 / 模型选择 / 安装指南
launcher/app/inference.py — 推理会话管理,启动 vLLM 引擎并管理生命周期。
launcher/app/config.py — 配置加载与验证,读取 configs.yaml 中预验证的参数组合。
launcher/app/gpu_arch.py — GPU 架构检测,自动识别 Ampere(sm_86)/Ada(sm_89)/Blackwell(sm_100)并匹配合适的 CUDA 工具链版本。
launcher/app/model_setup.py — 模型权重下载与路径管理,支持 HuggingFace 格式权重自动下载。
windows_tools/bench.py 系列 — 完整的性能评测工具集,涵盖 decode/prefill/summarize 等多种场景。
默认使用 INT4 AutoRound 量化(由 Lorbus/Qwen3.6-27B-int4-AutoRound 提供),18GB+ VRAM 即可运行。configs.yaml 中指定 quantization: auto-round,KV 缓存使用 FP8_E4M3 格式,在精度与速度间取得良好平衡。
这个项目最难得的地方在于安装体验的设计。整个过程不需要用户了解:
用户只需要:下载 → 解压 → 双击。这在 AI 开源工具领域极为罕见。
| GPU 系列 | 架构 | SM 代号 | 状态 | 推荐版本 |
|---|---|---|---|---|
| RTX 50 | Blackwell | sm_100 | 全面支持 | Blackwell ZIP + CUDA 13.2 |
| RTX 40 | Ada | sm_89 | 全面支持 | Ampere ZIP |
| RTX 30 | Ampere | sm_86 | 全面支持 | Ampere ZIP |
| 低于 sm_86 | — | — | 不支持 | — |
注意:RTX 5080/5090 用户需安装 NVIDIA Driver 596+,Blackwell ZIP 内置了 CUDA 13 运行时兼容层。
Qwen3.6-27B-int4-AutoRound 做了端到端调优,换模型需要手动调整参数devnen/qwen3.6-windows-server 代表了一个趋势:AI 推理工具正在从"极客专属"走向"普通用户可及"。当一款 270 亿参数的大模型可以在普通 Windows PC 上双击运行,数据隐私保护与本地 AI 推理的门槛被大幅降低。
随着 RTX 5090 等新一代消费级 GPU 的普及,千亿参数模型的 Windows 原生推理将成为越来越多开发者和企业的选择。这个项目为这一趋势提供了目前最成熟的 Windows 端解决方案。