FastDeploy
基于飞桨的大模型推理部署工具包,支持 PD 分离架构与多硬件后端
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于飞桨的大模型推理部署工具包,支持 PD 分离架构与多硬件后端
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你训练好了一个百亿参数的大语言模型,它能写文章、做分析、对话流畅——但这只是"能跑"。要让这个模型真正服务于用户,你需要把它从实验室搬到生产线:设计 API 接口、处理高并发请求、管理 GPU 显存、优化推理速度、保障服务稳定性。这不是简单地把模型文件放到服务器上,而是一整套系统工程。FastDeploy 就是来解决这个问题的。
大模型不同于普通软件。以GPT-4、ChatGLM、ERNIE这样的百亿参数模型为例:单个模型权重文件就超过 100GB,推理时需要大量显存;一次用户请求可能触发数十亿次浮点运算,延迟直接决定用户体验;而且实际生产环境里,模型不是孤立运行的——需要缓存、多用户共享、流量调度、监控告警……一个环节出问题,整个服务就可能崩溃。
百度飞桨团队在多年 AI 落地经验中发现,很多企业有好的模型,但部署环节成了瓶颈:要么买不对 GPU 配置,要么服务起来了但吞吐量极低,要么根本不知道怎么让模型对外提供服务。FastDeploy 因此诞生,目标是把模型部署这件事做到开箱即用。
如果把大模型比作一台超级精密的生产机器,FastDeploy 就是这座工厂的全套流水线和管理系统。它不只提供"机器"本身,还负责:物流通道(KV Cache 传输)、仓储管理(显存调度)、质检包装(量化压缩)、订单系统(API 接口)、多班倒制度(PD 分离部署)——让这台超级机器能够 7x24 小时稳定、高效地产出。
PD 分离部署架构:这是 FastDeploy 最具技术含量的设计之一。传统的大模型服务,"Prefill"(理解用户输入)和"Decode"(逐字生成输出)在同一 GPU 上串行进行,容易造成资源争抢。FastDeploy 将两者分离到不同实例:Prefill 实例专门处理输入理解,Decode 实例负责 token 生成,中间通过高效的 KV Cache 传输协议桥接。这就像把一条流水线的"来料检验"和"成品组装"分开,让各自专心做自己的事。
统一 KV Cache 传输:PD 分离后,Prefill 实例生成的 KV Cache 需要高效传输到 Decode 实例。FastDeploy 自研了传输库,自动选择 NVLink(单机内 GPU 间)或 RDMA(多机间)最优路径,延迟可降低 40% 以上。
全面量化支持:模型太大跑不动?FastDeploy 支持 W8A16、W4A16、W8A8、W4A8、W2A16、FP8 等多种量化格式,把模型精度从 FP32 压缩到 INT4/INT8,在大幅降低显存占用的同时尽量保持效果。其中 W4AFP8 是 v2.5 新引入的方法,专门针对国产硬件优化。
OpenAI API 兼容 + vLLM 接口兼容:这是 FastDeploy 对开发者最友好的设计。你不需要学习 FastDeploy 特有的 API,直接用 OpenAI 的标准接口就能调用。同时保持了对 vLLM 生态的接口兼容,很多基于 vLLM 的工具链可以无缝迁移。
多硬件后端支持:FastDeploy 支持 NVIDIA GPU(CUDA 12.x)、昆仑芯 XPU、曙光 DCU、沐曦 Iluvatar、燧原 GCU、Intel Gaudi 等多种国产与国际硬件。这意味着企业不必被某一家的芯片绑死,可以根据成本和供应情况灵活选择。
加速黑科技:Speculative Decoding(投机解码)让模型用小模型草稿+大模型验证的方式提速;Multi-Token Prediction(MTP)一次预测多个 token;Chunked Prefill 把长输入分段处理避免显存峰值;Prefix Caching 复用相同前缀的 KV Cache,显著提升多轮对话效率。
FastDeploy 原生支持百度 ERNIE 系列(ERNIE 4.5、ERNIE-4.5-VL-28B、ERNIE-4.5-VL-28B-A3B-Thinking),也兼容 HuggingFace 格式模型,并不断跟进最新模型:Qwen3-VL、Qwen3-VL MoE、DeepSeek V3 等主流模型均在支持列表中。此外还支持 PaddleOCR-VL-0.9B 等视觉语言模型,覆盖多模态场景。
FastDeploy 面向有 AI 部署经验的开发者,不建议纯新手直接上手。主要门槛在于:需要 Linux 环境和 GPU 硬件知识;需要准备对应版本的 CUDA 和 cuDNN;模型文件较大(可能需要下载数十GB);生产部署需要理解 PD 分离、负载均衡等概念。官方文档相对完善,但最佳实践需要阅读大量案例。
FastDeploy 主要面向企业内部生产部署,没有开箱即用的 Web UI(虽然有 Gradio 示例代码),非技术用户无法直接使用。此外,其核心优势(PD 分离、KV Cache 传输)需要多卡或分布式环境才能体现,单卡用户收益有限。由于深度依赖 PaddlePaddle 生态,对于主要使用 PyTorch 的团队来说,存在一定的学习迁移成本。
FastDeploy 代表了大模型工程化的一个重要方向——将部署能力标准化、产品化。随着 GPT-4、Qwen、DeepSeek 等模型不断刷新参数规模,如何高效、低成本地把这些"庞然大物"部署到生产环境,已成为整个 AI 行业最核心的工程挑战之一。FastDeploy 在这个方向的探索(尤其是 PD 分离架构和国产硬件支持),对推动大模型落地具有重要参考价值。项目在 GitHub 上持续活跃,最新 v2.5 版本(2026年3月)仍在快速迭代。