PaddleMIX
飞桨多模态大模型全家桶,一套代码搞定图文预训练、扩散生成、视频合成与文档理解
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
飞桨多模态大模型全家桶,一套代码搞定图文预训练、扩散生成、视频合成与文档理解
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你手头有一堆文档图片需要让AI理解,有视频需要生成,还有跨模态的图文匹配任务要做——每个任务都得去找不同的框架、安装不同的依赖、配置不同的环境,光是搭环境就花掉半天时间。更头疼的是,这些框架之间往往互不兼容,在A框架训练好的模型无法直接迁移到B框架使用。
PaddleMIX 正是为了解决这个痛点而生。它是百度飞桨(PaddlePaddle)官方开源的多模态大模型「全家桶」,将散落在各处的多模态能力整合到同一个代码仓库中,让开发者只需维护一套环境,就能完成从模型训练到推理部署的全流程。
PaddleMIX 由百度飞桨团队开发和维护,是 PaddlePaddle 生态中专门面向多模态场景的核心项目。项目始于 2023 年,最初定位为图文预训练模型的训练框架,随后逐步扩展到扩散模型、视频生成、文档理解等多个领域。到 2025 年已迭代至 v3.0-beta 版本,GitHub 获星 724 次,Fork 225 次,是国内最有影响力的多模态开源框架之一。
项目的核心维护团队来自百度 PARL(飞桨增强学习)小组,团队成员长期活跃在 AAAI、ICML 等顶会。值得关注的是,项目从 2024 年开始引入大量国产计算芯片支持,包括昇腾 910B,标志着百度在推动国产 AI 生态上的持续投入。
PaddleMIX 的代码仓库包含三大核心模块:
1. paddlemix(多模态理解模型库)
这是项目的主干模块,实现了当前主流的多模态理解模型。LLaVA 系列(1.5/1.6/1.7)让开源大语言模型(Llama/Qwen 等)获得「看图说话」的能力;Qwen-VL/2-VL/2.5-VL 则来自阿里通义千问团队,在视觉问答和图文检索上表现优异;InternVL2 来自上海人工智能实验室,在多图理解任务上领先同类方案。此外还有 DeepSeek-VL2、Qwen-Audio 等垂类模型。
所有模型的训练流程统一由 paddlemix/auto/ 模块管理,支持 SFT(有监督微调)和预训练两种模式。项目独创的 Mixtoken 训练策略可将 SFT 吞吐量提升 5.6 倍——原理是将多个短对话拼接成一个序列,用变长注意力掩码避免无效计算。
2. ppdiffusers(扩散模型工具箱)
对标 HuggingFace 的 Diffusers 库,是 PaddleMIX 中负责图像和视频生成的模块。实现了 Stable Diffusion 1.5/2/3、SDXL、FLUX 等主流文生图架构,以及 Wan2.1 等视频生成模型。
2025 年 7 月最新发布的 Fast-Diffusers 推理加速工具包引入了多项 SOTA 训练无关(Training-Free)加速算法:T-gate、PAB、TeaCache、TaylorSeer、BlockDance 等。其中自研的 SortBlock 和 TeaBlockCache 算法可在保证生成质量的前提下实现 2 倍以上端到端推理加速。基于 FLUX-dev 的 4 步蒸馏模型(PCM + DMD2)在飞桨深度学习编译器加持下,推理时延已降至 1.66 秒,接近实时水平。
3. DataCopilot(多模态数据处理工具箱)
处理 AI 模型的「燃料」——训练数据。支持数据清洗、格式转换、可视化统计和质量过滤。其中自研的 PP-InsCapTagger 数据能力标签模型,可在保持模型效果的前提下减少 50% 数据量,大幅提升训练效率。
PP-DocBee 文档理解模型:百度自研的端到端文档图像理解模型,支持复杂版面分析、多列排版、手写体识别。在学术界和内部业务场景的文档理解榜单上均达到同参数量级别的 SOTA 水平。
PP-VCtrl 视频生成控制模型:通用视频生成控制模型,支持人物动画、场景转换、视频编辑等场景。可基于骨骼点、边缘图、深度图等多种条件信号控制视频生成内容。
ComfyUI 插件:comfyui/ComfyUI_ppdiffusers/ 目录提供了完整的 ComfyUI 节点实现,支持 Stable Diffusion 系列、FLUX、Wan2.1 等主流生成模型的图形化工作流。通过拖拽节点即可搭建复杂的图像/视频生成 pipeline,降低了使用门槛。
PaddleMIX 本身是纯 Python 库,通过 pip install paddlemix 即可引入。依赖管理由 build_env.sh 和 build_paddle_env.sh 两个脚本自动化处理,会依次安装 PaddlePaddle 核心框架、paddlenlp 工具链及其他第三方库。
内置的 MULLM_WebUI(基于 Gradio)提供了零代码的多模态对话界面,用户可以直接上传图片并与模型交互。ComfyUI 插件则面向有工作流定制需求的高级用户。
需要注意的是,作为深度学习框架,PaddleMIX 必须有 NVIDIA GPU 才能运行。推荐配置为 RTX 3090 或 A100 以上级别显卡,显存 16GB+,内存 32GB+。项目未提供 Docker 镜像,部署需要手动配置 CUDA 环境,对新手有一定门槛。官方声称安装验证需要约 2-4 小时。
技术栈:Python + PaddlePaddle + PaddleNLP + Gradio + ComfyUI。选型飞桨而非 PyTorch/TensorFlow 是百度内部的战略决策,对于已经习惯 PyTorch 的开发者来说有一定迁移成本。
许可:Apache-2.0,可商业使用,但需遵守百度相关的模型权重许可(部分模型如 LLaVA 本身有额外限制)。
主要局限:
PaddleMIX 的出现填补了国内多模态开源框架的一个重要空白。在 Stable Diffusion 生态全面倒向 PyTorch 的背景下,飞桨团队持续投入开发 PaddleMIX,为百度云和昇腾芯片用户提供了一条无需跨框架迁移的多模态落地路径。其 2025 年的多项自研算法(PP-DocBee、PP-VCtrl、Fast-Diffusers)也展现了百度在多模态领域的原创能力。对于需要在飞桨生态内快速搭建多模态能力的团队,PaddleMIX 是目前最完整的选择。
图1:PaddleMIX 项目概览——展示多模态理解与生成的核心能力矩阵