vllm
基于PagedAttention技术的高吞吐量LLM推理引擎,支持200+模型架构和OpenAI兼容
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于PagedAttention技术的高吞吐量LLM推理引擎,支持200+模型架构和OpenAI兼容
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:vLLM 官方 Logo — 简洁有力,视觉识别度高
想象一下这个场景:你的团队训练出了一个表现优异的 LLM 大模型,但当几十个用户同时请求推理服务时,服务器显存告急、响应时间从毫秒级暴涨到分钟级——这正是 2023 年以前大多数 LLM 部署面临的困境。vLLM 的诞生,就是为了解决这个问题。
vLLM 起源于加州大学伯克利分校 Sky Computing Lab,由 Woosuk Kwon 等研究者于 2023 年发表论文《Efficient Memory Management for Large Language Model Serving with PagedAttention》,并同步开源了代码库。该论文被 ACM SIGOPS 29th Symposium on Operating Systems Principles(SOSP 2023)录用,标志着学术界对这项工作的认可。
短短两三年间,vLLM 已从实验室项目成长为全球最活跃的 LLM 推理引擎之一。根据 GitHub 数据,项目拥有超过 2000 名贡献者,支持 NVIDIA、AMD、Intel 等多厂商 GPU,以及 Google TPU、华为昇腾等异构硬件,社区生态极为庞大。
vLLM 的核心创新是 PagedAttention,灵感来源于操作系统的虚拟内存分页管理机制。传统 LLM 推理框架将 KV Cache(Key-Value 缓存)连续存储在 GPU 显存中,但由于生成文本长度不确定,往往需要预分配大量显存空间,造成浪费。
PagedAttention 将 KV Cache 拆分为多个固定大小的"页"(Page),按需动态分配,就像操作系统管理内存页一样。这种设计带来了几个关键优势:
显存利用率大幅提升:相同显存可支持更多并发请求,实测吞吐量比 HuggingFace Transformers 高出 24 倍。
连续批处理(Continuous Batching):新的请求可以随时插入正在处理的批次中,无需等待整个批次完成,充分利用 GPU 算力。
前缀缓存(Prefix Caching):对于具有相同系统提示(System Prompt)的请求,共享 KV Cache,避免重复计算。
分段预填(Chunked Prefill):将长文本预填操作拆分为小块,平衡预填与解码阶段的资源竞争,降低首 token 延迟波动。
vLLM 内置了业界最全面的量化支持,几乎覆盖了所有主流方案:FP8、MXFP8/MXFP4、NVFP4、INT8/INT4,以及社区主流的 GPTQ、AWQ、GGUF 格式。这意味着无论是追求速度还是节省显存,开发者都能找到合适的方案,无需引入额外的量化工具链。
在注意力内核层面,vLLM 整合了 FlashAttention、FlashInfer、FlashMLA、Triton 等业界最优实现,配合 CUDA/HIP 图编译优化,在各种硬件上都能榨取最高性能。
虽然名字里只有 "LLM",vLLM 的野心远不止文本。它原生支持:
支持模型总数超过 200 个,涵盖了 HuggingFace 上主流的 decoder-only、encoder-decoder、纯编码器等各类架构。
对于已经基于 OpenAI API 构建应用的开发者,vLLM 提供了一个零改造迁移路径:只需将 base_url 指向 vLLM 服务端点,即可直接复用现有代码。vLLM 的 API 兼容 OpenAI Chat Completions 和 Completions 接口,同时支持 Anthropic Messages API 和 gRPC。
此外,vLLM 还支持结构化输出(xgrammar/guidance)、工具调用(Tool Calling)、推理解析器,以及多 LoRA 动态切换,在生产环境中极为实用。
从部署角度看,vLLM 不是一个"随手 run 起来"的项目。它明确要求 NVIDIA GPU(CUDA 12.1+)和足够大的显存(建议 24GB+),这将大多数个人开发者和中小团队挡在门外。
好在官方提供了覆盖 NVIDIA、AMD ROCm、CPU、TPU、Intel XPU 等多架构的 Dockerfile,对于有 GPU 集群的团队来说,通过 Docker 镜像部署相对顺畅。pip/uv 一键安装的便利性也对开发体验有所弥补。
vLLM 的出现重新定义了 LLM 生产级推理的标准。在它之前,TensorRT-LLM 是企业唯一靠谱的选择;而 vLLM 以 Apache-2.0 开源协议、持续迭代的社区支持和与主流模型生态(HuggingFace、vLLM Hub)的无缝衔接,成为了中小企业和研究机构的性价比首选。
它的发展轨迹也折射出一个趋势:在 LLM 时代,推理引擎和训练框架同等重要——模型效果再好,跑不动、跑不快,就无法创造价值。vLLM 正在这个赛道上持续领跑。

图2:vLLM 项目组织头像 — 来自 UC Berkeley Sky Computing Lab 的开源社区