xllm
面向国产AI加速卡优化的高性能LLM推理框架,支撑京东零售日均数十亿次业务调用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
面向国产AI加速卡优化的高性能LLM推理框架,支撑京东零售日均数十亿次业务调用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年双十一,京东每秒处理超过50万次商品推荐查询,每一次背后都有大语言模型的推理支撑。当全球目光聚焦在 NVIDIA H100 的算力神话时,很少有人注意到中国电商巨头京东已经悄然打磨出一套自研推理引擎,并在2025年10月发表技术报告、2026年7月正式将项目捐赠给开放原子开源基金会——它就是 xLLM。
这个项目并非从零起步的学术玩具,而是诞生于京东零售核心业务的生产级系统,支撑着AI客服、商品推荐、供应链优化等日均数十亿次调用的业务场景。选择开源,是因为京东希望推动国产AI芯片生态——项目名称中的"x"代表多样化(multi-accelerator support),目标是在华为昇腾NPU、寒武纪MLU、摩尔线程S5000、海光DCU等多种国产芯片上实现对标甚至超越国际主流框架的推理性能。
xLLM 采用业界领先的解耦式服务-引擎双层架构,这是它区别于 vLLM、TGI 等单层推理框架的核心差异。
xLLM-Service(服务层) 负责请求调度与可用性保障。其中的核心组件包括:
xLLM-Engine(引擎层) 专注于计算效率最大化:
xLLM 支持的模型范围极广,按场景可分为四大类:
在硬件加速方面,项目针对国产芯片做了深度优化:华为昇腾 NPU(A2/A3)、寒武纪 MLU、摩尔线程 MUSA S5000、海光 DCU(BW1000)、沐曦 MACA(MXC500)、芯动 ILU(BI150)——几乎覆盖了国内主要的 AI 芯片玩家。这意味着部署者可以在昇腾服务器上跑 Qwen,也可以在摩尔线程上跑 DeepSeek,而无需修改上层代码。
依赖技术栈上,xLLM 大量借鉴了开源社区的成熟组件:底层 Runtime 执行参考了 ScaleLLM,全局 KV Cache 基于 Mooncake 构建,HTTP 服务层使用 Apache brpc(百度开源的高性能 RPC 框架),分词器使用 MLC-AI 的 tokenizers-cpp,模型权重加载则依赖 Hugging Face 的 safetensors C binding。
xLLM 提供了完整的 Docker 镜像,支持 CUDA 12.8 环境下的快速验证。由于是 CMake 构建系统,需要从源码编译,依赖包括 CUDA、cuDNN、PyTorch 等,开发者在 Docker 环境中可以避免繁杂的本地环境配置。
核心推理服务通过 Python API 调用,支持流式输出(Streaming)与批量推理两种模式。服务端基于 C++ 实现,通过 pybind 与 Python 层桥接,兼顾开发效率与运行性能。
示例代码展示了纯 Python 调用接口的简洁性:加载模型、构造输入、调用推理——三步完成一次完整推理,对习惯了 PyTorch 风格的开发者非常友好。
xLLM 的定位是高性能生产级推理引擎,因此上手门槛较高:
xLLM 的出现填补了国产 AI 推理框架的一个关键空白——不是做另一个 vLLM,而是针对多硬件共存的国产算力生态设计的推理基础设施。随着开放原子开源基金会的托管,项目获得了更大的社区治理可信度,未来有望成为国产芯片厂商对接上层模型的统一推理底座。
从增长数据看,项目在 GitHub 上保持稳定活跃,核心开发来自京东零售技术团队,持续跟随主流开源模型做 day-0 支持,这对于企业级用户来说是重要的稳定性保障。

图1:xLLM 项目 Logo(来源:GitHub 仓库)

图2:xLLM 服务-引擎双层架构图(来源:GitHub 仓库)
图3:xLLM 开源贡献者图谱(来源:contrib.rocks)