lmdeploy
上海 AI 实验室开源的大模型推理加速引擎,TurboMind C++ 引擎实现 1.8 倍于 vLLM 的推理速度
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
上海 AI 实验室开源的大模型推理加速引擎,TurboMind C++ 引擎实现 1.8 倍于 vLLM 的推理速度
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你训练了一个能力很强的大语言模型,但当它真正要跑起来服务用户时,却发现:响应太慢、显存不够用、部署方式太复杂——这几乎是每个 AI 开发者都会遇到的"最后一公里"难题。上海人工智能实验室推出的 LMDeploy(InternLM/lmdeploy),正是为解决这些问题而生。
LMDeploy 最初由上海人工智能实验室的 MMRazor 和 MMDeploy 团队开发。这两个团队在模型压缩和模型部署领域深耕多年,积累了丰富的经验。2023年8月,LMDeploy 正式开源,迅速成为大模型推理部署领域最受关注的工具之一。
截至目前,LMDeploy 在 GitHub 上已收获超过 7,800 颗星,fork 超过 600 次,被超过 600 个 issue 跟踪讨论,足以说明其在社区中的活跃度和影响力。团队持续高频更新,最新版本 v0.12.3 于 2026年4月发布。
LMDeploy 最具特色的设计是双引擎架构,针对不同的使用场景提供最优解。
TurboMind 引擎是 LMDeploy 的性能旗舰,采用 C++ 实现深度优化,专为追求极致推理速度的场景设计。它引入了多项业界领先的技术:
TurboMind 的 benchmark 数据显示,在 internlm2-20B 模型推理任务中,可达到 16+ RPS(每秒请求数),相比 vLLM 提速约 1.8 倍。在 H800 GPU 上,针对 gpt-oss 模型,LMDeploy 通过 MXFP4 量化可达 vLLM 的 1.5 倍性能。
PyTorch 引擎则采用纯 Python 开发,API 友好、易于调试、适合快速实验。开发团队还专门针对昇腾 Ascend 平台做了适配,使其在国产硬件上也能运行。
LMDeploy 的另一大核心能力是模型量化。它支持多种量化策略:
| 量化类型 | 说明 |
|---|---|
| W4A16 | 权重 4-bit 量化 + 激活 FP16,兼顾显存节省与精度 |
| Weight-Only | 仅量化权重,简化推理管线 |
| KV Cache 量化 | 对 Key-Value 缓存做 int8/int4 量化 |
| AWQ | 基于激活感知的权重量化算法 |
| GPTQ | 经典后训练量化方法 |
| vLLM Compressor | 与 vLLM 生态集成的 4-bit 量化 |
实测数据:LMDeploy 的 4-bit 推理速度是 FP16 基准的 2.4 倍,是目前开源最快的 4-bit LLM 推理实现。量化质量通过 OpenCompass 评测框架验证,确保精度损失在可接受范围内。
LMDeploy 支持的模型列表堪称豪华:60+ 大语言模型(包括 Llama 全系列、Qwen 全系列、InternLM 全系列、DeepSeek 全系列、Mistral、GLM-4 等)和 30+ 视觉-语言模型(InternVL 系列、Qwen-VL 系列、LLaVA 系列等)。
2025年新增了对 DeepSeek-V3、DeepSeek-R1 的支持;2026年新增 Qwen3.5 系列。团队还持续跟进最新的模型架构(如 MoE 混合专家模型、FP8 MoE 优化等)。
安装方式:最简单的方式是 pip install lmdeploy,Python 3.10-3.13 兼容。从 v0.13.0 起,PyPI 预编译 wheel 默认基于 CUDA 12.8,RTX 50 系列也能直接使用。对于需要特殊硬件(如昇腾、Mac)的用户,LMDeploy 提供了多套 requirements 文件。
推理服务:一行代码即可启动本地推理 pipeline:
import lmdeploy
with lmdeploy.pipeline("internlm/internlm3-8b-instruct") as pipe:
response = pipe(["Hi, pls intro yourself", "Shanghai is"])
print(response)
API 服务:通过 lmdeploy serve api_server 可一键启动兼容 OpenAI 接口的推理服务,支持多卡部署、多模型代理服务,并可通过 Swagger UI 或 OpenAOE 等前端进行交互。
容器化:docker/ 目录下提供了多个专业 Dockerfile,包括通用版、Jetson 嵌入式版、昇腾 A2/A3 版、开发版等,满足从桌面到服务器的全场景覆盖。
LMDeploy 的代码组织清晰:
src/turbomind/ — C++ 推理引擎核心,包含 comm(通信)、core(核心)、engine(引擎)、generation(生成)、kernels(CUDA kernels)、models(模型)六大子模块lmdeploy/ — Python API 层,包括 pipeline(推理管线)、serve(服务模块)、pytorch(PyTorch 引擎)、turbomind(TurboMind 接口)、vl(视觉语言)等docker/ — 多套 Docker 构建脚本项目使用 ruff 进行代码规范检查,强制 line-length=120、目标 Python 3.10+,体现了对现代 Python 生态的拥抱。
尽管 LMDeploy 表现亮眼,仍有一些值得注意的地方:
在 vLLM 一统大模型推理的格局下,LMDeploy 的出现打破了这个局面。它用实际 benchmark 数据证明,国产推理引擎不仅能做,而且能在特定场景下做得更好(1.8 倍于 vLLM 的 internlm2-20B 推理速度)。
更重要的是,LMDeploy 展现了上海 AI 实验室在大模型全栈技术上的积累——从模型训练(InternLM)到推理部署(LMDeploy),形成了完整的开源生态闭环。随着 DeepSeek-V3/R1、Qwen3 等新模型的持续跟进,LMDeploy 的生态价值还在持续扩大。
如果你正在为 LLM 推理速度发愁,或需要将模型部署到生产环境,LMDeploy 值得优先考虑。