sglang
高性能大模型推理框架,RadixAttention 实现 5 倍加速,NVIDIA/AMD/Inte
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
高性能大模型推理框架,RadixAttention 实现 5 倍加速,NVIDIA/AMD/Inte
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:SGLang 官方 Logo
想象这样的场景:深夜两点,你的团队刚完成一个大模型产品的核心功能开发,准备上线压测。测试脚本跑起来,10个并发请求过去——结果延迟从预期的 200ms 飙升到 8 秒,GPU 利用率却只有 30%。你开始怀疑:模型太大了?batch_size 设错了?还是推理框架本身有瓶颈?
这是每个 AI 工程团队都经历过的「推理地狱」。在 SGLang 出现之前,主流的选择是 vLLM 和 TensorRT-LLM。前者灵活性好但性能有天花板,后者在特定 GPU 上性能极致但部署复杂、改模型代价高。更关键的是,两者对前沿能力(如思维链、工具调用、多模态)的支持都存在不同程度的滞后。
SGLang 的诞生,正是为了解决这个痛点。它最初由 LMSYS 团队(也是著名的大模型匿名竞技场 Vicuna 的运营方)开发,最早在 2024 年 1 月亮相时,就以 RadixAttention 技术实现了 5 倍推理加速,直接在开源社区引爆。如今 SGLang 已经成为 xAI、AMD、NVIDIA、Intel、LinkedIn、Cursor、AWS、Azure、GCP 等数十家顶级机构的推理基础设施,日均处理 数万亿 tokens,运行在超过 40 万块 GPU 上。
SGLang 是一个面向大语言模型(LLM)和多模态模型的高性能推理服务框架。它的核心定位,可以类比为「给大模型用的 Nginx」——提供标准化的接入层、高效的调度策略和丰富的协议兼容,让开发者无需深入 CUDA 优化细节,就能跑出接近硬件极限的推理性能。
与 vLLM、TensorRT-LLM 等竞品相比,SGLang 的差异化在于三点:
大模型推理中,有一个高频场景是「带系统提示词的多轮对话」。传统做法是每次请求都把完整上下文重新计算,造成巨大浪费。RadixAttention 的做法是把所有前缀 KV-Cache 复用起来,自动识别重复前缀,仅计算新内容。官方数据显示,这一优化带来了 5 倍推理加速。
2024 年 12 月 v0.4 版本引入的核心特性。传统调度器需要在每次调度决策时遍历整个请求队列,SGLang 的零开销调度器通过将调度逻辑编译到批次管理器中,将调度开销降至接近零,结合连续批处理(Continuous Batching),实现了更高批次利用率和更低延迟。
LLM 推理分为两个阶段:Prefill(处理输入 prompt,计算首个 token)和 Decode(逐 token 生成)。两者对计算资源的需求模式完全不同——Prefill 是计算密集型,Decode 是内存密集型。SGLang 支持将两者分离到不同机器上处理,通过分布式调度实现资源的最优利用。在 DeepSeek 的 96 H100 集群测试中,结合大规模专家并行(Expert Parallelism),实现了 3.8 倍 Prefill 吞吐和 4.8 倍 Decode 吞吐提升。
SGLang 支持多种投机解码策略,包括 DFlash 和 Spec V2(2026 年 6 月最新发布),可以在保持输出质量的前提下显著提升解码速度。这一能力对于需要实时交互体验的应用场景(如聊天机器人)尤为重要。
对于需要结构化输出(JSON、代码等)的场景,SGLang 通过压缩有限状态机技术实现了 3 倍 JSON 解码加速,解决了正则约束下状态机膨胀的问题。
SGLang 的模型生态极为丰富,以下是核心支持列表:
| 模型类别 | 代表模型 |
|---|---|
| 主流 LLM | Llama、Qwen、DeepSeek、GLM、Mistral、Gemma |
| 思维链/RW | DeepSeek-R1、QwQ、Kimi |
| 多模态 | LLaVA-OneVision、Qwen2-VL、WAN(视频生成) |
| Embedding | E5-Mistral、GTE、MCDSE |
| Reward Model | Skywork |
| 扩散模型 | Qwen-Image、WAN |
特别值得一提的是,DeepSeek-V3/R1 发布当天 SGLang 就提供了支持,这得益于其模块化的模型接入架构。开发者只需要实现一个 ModelRegistry 插件,就可以快速接入新模型,无需修改核心推理引擎。
SGLang 的代码组织非常清晰,分为两个核心层次:
python/sglang/lang/)提供面向开发者的 Python API,包含:
sglang.gen() 调用,以及 openai SDK 的直接接入python/sglang/srt/)这是 SGLang 的性能核心,包含:
batch_invariant_ops(批处理无关算子)、batch_overlap(计算通信重叠)、Paged Attentiondisaggregation/ 模块实现 Prefill-Decode 分离hardware_backend/ 支持 CUDA/ROCm/NPU/XPU/TPU 等多种后端constrained/ 实现结构化输出的约束解析SGLang 不仅仅是一个推理服务器,它还深度集成到了 RL/Post-training 生态中:
lm-eval 集成,方便 benchmark 评估SGLang 的安装极为简单:
pip install sglang
python -m sglang.launch_server --model-path meta-llama/Llama-3.1-8B-Instruct
一条命令,模型就跑起来了。对于 Docker 爱好者,项目提供了 9 种多阶段优化的 Dockerfile,涵盖 CUDA(最新支持 GB200/B300)、ROCm(AMD MI300)、NPU(Ascend)、XPU(Intel)、ARM64 等,几乎覆盖所有硬件平台。docker-compose 也提供了开箱即用的组合方案。
Kubernetes 用户可以直接使用官方提供的 StatefulSet 和 Service manifest,快速在 K8s 集群上部署分布式 SGLang 推理服务。
需要注意的是,SGLang 是一个纯后端推理服务,没有内置 Web UI。对于需要可视化交互界面的场景,官方推荐配合 ChatBot-ClI 或其他前端项目使用。
SGLang 同样存在一些局限性,在选型时需要考虑:
GPU 显存要求高:虽然性能优秀,但 Paged Attention 等优化技术本身会占用额外的显存管理开销,在显存极度紧张的小显存 GPU 上表现可能不如预期。
生态成熟度:相比 vLLM(2022 年起步,社区更庞大),SGLang 的插件生态和第三方集成还在快速成长中,部分边缘场景的文档可能不够完善。
多模态仍处于快速迭代期:LLaVA-OneVision 等多模态模型的支持虽然已经集成,但在极端分辨率图像、超长视频等场景的处理上,与专用方案相比还有优化空间。
SGLang 的崛起,折射了大模型推理领域几个重要趋势:
从性能工具到基础设施:SGLang 不再只是一个「让推理更快的库」,而是被嵌入到了 RL 训练、Post-training、Agent 编排等多个关键环节,成为 AI 系统的基础设施层。
硬件多样化:NVIDIA 之外的所有主流 AI 芯片厂商(AMD、Intel、Ascend、Google)都在积极为 SGLang 提供优化,说明整个行业在推动推理基础设施的多元化。
开源生态的力量:从 2024 年初发布到 2026 年中,2 年多时间里 Star 数突破 29903,运行在 40 万+ GPU 上,被 10+ 顶级 RL 框架选为后端——这种增长速度在 AI 基础设施领域极为罕见。
2025 年 6 月,SGLang 获得了 a16z Open Source AI Grant 的第三批资助,这是继 vLLM 之后,又一个获得顶级 VC 支持的推理框架。其背后的 LMSYS 团队,正在用开源的方式推动大模型推理技术的民主化。
如果你在构建 AI 应用、需要高性能推理服务,或对 RL/Post-training 感兴趣,SGLang 都是一个值得深入了解的项目。