vLLM-2080Ti-Definitive
让双 RTX 2080 Ti 改装卡变身 27B 大模型推理利器,100+ tok/s 超越想象的性
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让双 RTX 2080 Ti 改装卡变身 27B 大模型推理利器,100+ tok/s 超越想象的性
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:vLLM 2080 Ti Definitive Edition 项目封面
你手里有两张 2018 年发布的 NVIDIA RTX 2080 Ti。2026 年的今天,AI 圈都在聊 H100、A100、RTX 5090,这两张 Turing 架构的老卡,似乎早就该退役了——显存只有 11GB,FP64 算力弱,在大模型时代几乎无人问津。
但如果有人告诉你:用不到 RTX 3090 Ti 一半的价格,这两张卡组成的双卡阵列(22GB×2 + NVLink),可以在本地跑出 Qwen3.6 27B,推理速度超过 100 tok/s,你的反应是什么?
这正是 weicj/vLLM-2080Ti-Definitive 做的事情——一个专为双 RTX 2080 Ti 22GB + NVLink 硬件形态量身定制的 vLLM 分叉项目。它把一张本该淘汰的显卡,变成了能在本地跑 27B/35B 大模型的性价比怪兽。
RTX 2080 Ti 于 2018 年 8 月发布,是 NVIDIA 将消费级 GPU 引入光线追踪时代的标志产品。当年售价高达 999 美元,2021 年ETH 矿潮后大量流入二手市场,如今 22GB 改装版在海鲜市场仅需 500-600 美元(含 NVLink)。
这个项目的作者 weicj 做了一个简单的成本/性能分析:用约 1/3 的 RTX 3090 Ti 预算,获得双 2080 Ti(44GB VRAM + NVLink),在张量核数量、显存带宽等对 LLM 推理至关重要的指标上,实际上不输甚至超过单卡 3090 Ti。
| 指标 | 双 RTX 2080 Ti 22GB + NVLink | RTX 3090 Ti 24GB 基准 | 倍数 |
|---|---|---|---|
| 物理 CUDA 核心数 | 8,704 | 5,376 | 1.62x |
| SM 数量 | 136 | 84 | 1.62x |
| 物理张量核数量 | 1,088 | 336 | 3.24x |
| 稠密张量 FP16 矩阵吞吐 | 228 TFLOPS | 160 TFLOPS | 1.43x |
| 总显存带宽 | 1,232 GB/s | 1,008 GB/s | 1.22x |
| 总 VRAM 容量 | 44GB | 24GB | 1.83x |
双卡 2080 Ti 在张量核数量上是单卡 3090 Ti 的 3.24 倍,VRAM 容量达到 44GB——这正是它能跑 27B 大模型的关键。
图2:单请求解码吞吐量演示(Qwen3.6 27B 实测超过 100 tok/s)
本项目基于上游 vLLM v0.21.0 进行深度定制(分叉版本 v0.1.14),在保留原版 vLLM 整体架构的基础上,加入了大量针对 SM75( Turing 架构代号)的专用优化:
1. 量化权重路由(Weight Routing)
支持 FP8、INT4(AWQ/GPTQ)、NVFP4 等多种量化格式,配合 Marlin 量化内核实现高效矩阵运算。对于显存受限的场景,可以用 INT4 量化将 27B 模型压缩到 44GB VRAM 内运行,同时保持可接受的精度。
2. KV Cache 量化
支持 FP16、INT8(TurboQuant)、NVFP4 三种 KV Cache 精度策略。INT8 KV 可显著降低显存占用,支持更长的上下文窗口(256K 原生支持);FP16 KV 提供最高输出质量;TurboQuant KV 则在质量和压缩率之间取得平衡。
3. MTP(Multi-Token Prediction)+ CUDAGraph
MTP 是一种多 token 预测加速技术,配合 CUDAGraph 可以减少 GPU kernel 发射开销。实测在 GPTQ-INT4 4096/128 配置下,同一硬件平台上的解码速度从 56 tok/s(无 MTP)提升至 91 tok/s,提升超过 60%。
4. FlashQLA / FlashInfer 快速 Prefill
Prefill(首 token 预填充)是长上下文场景的性能瓶颈。该项目集成了 FlashQLA(来自 QwenLM)和 FlashInfer 的优化 attention kernel,专门加速 Prefill 阶段的计算。针对 SM75 架构,FlashQLA 还有专门的适配版本(weicj/FlashQLA-SM70-SM75)。
5. 交互式启动器(Launcher)
launcher.sh 是项目的服务管理入口,提供交互式菜单,支持:选择模型检查点、应用或编辑 profile、切换 safe/normal/fast/aggressive 运行模式、选择 GPU/TP 设备、配置端口、开启 OpenAI 兼容 API 等。对于非交互式脚本使用,还支持通过环境变量直接启动。
6. 模型 Profile 系统
项目提供预调好的 profile 配置,按 profiles/<model>/<mode>/<weight>/<route>.env 组织。例如 qwen27b/normal/int4/fp16kv-256K-mtp3-text-only.env 对应 Qwen3.6 27B 的 INT4 量化版本,256K 上下文、MTP3 加速、纯文本模式。这些 profile 都经过实测验证,用户无需手动调参。
这是整个项目最核心的限制——不是所有人都能玩。
硬件要求:
软件环境:
部署难度:困难。 虽然提供了 Dockerfile 多阶段构建,但整个构建过程涉及 CUDA 源码编译(CUTLASS、Triton、FlashQLA 等),首次 build.sh 可能需要数小时。docker-compose.yml 存在但不足以脱离硬件条件运行。
CPU 要求其实很低: 官方实测在 Intel Core i3-9100T + 16GB RAM 上就能正常运行,解码速度 91 tok/s。CPU 主要影响编译缓存和模型下载,对推理性能影响不大。
| 模型 | 量化方式 | 推荐状态 |
|---|---|---|
| Qwen3.6 27B | FP8 | 🟢 推荐 |
| Qwen3.6 35B A3B | FP8 | 🟢 推荐 |
| Qwen3.6 27B | AWQ INT4 | 🟢 推荐 |
| Qwen3.6 27B | GPTQ INT4 | 🟢 推荐 |
| Qwen3.6 27B | NVFP4 | 🟡 可用 |
| Gemma4 31B | QAT | 🟡 可用(实验性) |
主力推荐是 Qwen3.6 27B FP8——精度损失极小,显存刚好装下,速度超过 100 tok/s,是性价比最优解。
项目代码完全基于 vLLM,上游更新会定期 merge 回本地 SM75 分支。主要代码结构:
vLLM-2080Ti-Definitive/
├── vllm/ # 核心推理引擎
│ ├── entrypoints/ # OpenAI API server、gRPC、CLI
│ ├── engine/ # LLM 引擎核心(async_llm_engine、llm_engine)
│ ├── model_executor/ # 模型执行器(layers、kernels、models)
│ └── multimodal/ # 多模态支持
├── docker/ # Dockerfile(CUDA 12.8 多阶段构建)
├── profiles/ # 预调好的运行时 profile
├── docs/ # 技术文档
├── build.sh # 源码编译 + 依赖安装
├── launcher.sh # 交互式服务管理器
└── update.sh # 版本更新脚本
关键依赖:FlashInfer(attention 优化)、FlashQLA(Qwen 专用 linear attention)、Marlin(INT4 量化 kernel)、CUTLASS(CUDA 模板库)、Triton(kernel 编写框架)、TurboQuant(KV 量化)。
1. 硬件门槛极高 没有 NVLink 的双 2080 Ti 改装卡,就失去了这个项目的核心价值。改装显存本身有风险,NVLink 桥接器也不好找。如果只有单卡,这个项目不适合你。
2. 不是通用 vLLM 替代品 这是一个高度特化的 fork,不是为通用场景设计的。混用其他 GPU(如 3090、4090)未经验证,其他 SM 架构(Turing 以外)的表现也没有保证。
3. 构建复杂度高 从源码构建涉及大量 CUDA 编译,没有预编译 wheel 分发。初次部署门槛很高,不适合 Docker 新手。
4. 上游跟进存在延迟 作为 vLLM 的特化 fork,不能实时跟随上游更新,所有上游合并都需要在 SM75 环境下重新验证。
这个项目的意义,不仅在于让两张「过时」显卡焕发第二春,更在于它揭示了一个重要趋势:大模型推理的硬件门槛正在快速下降。
2024 年跑一个 7B 模型还需要 A100,到 2026 年两张改装老卡就能跑 27B 了。FP8 量化、KV 量化、MTP 加速……这些软件优化技术正在以惊人的速度榨取硬件潜力。vLLM-2080Ti-Definitive 正是这一趋势的典型案例:它不是靠更贵的硬件,而是靠更聪明的软件,让更多人以极低成本接入本地大模型推理。
对于预算有限但有一定硬件 DIY 能力的用户,这是一个值得关注的开源项目。它的价值不在于「能跑大模型」,而在于用几百美元的成本,实现了原本需要数千美元才能达到的推理性能。