ERNIE
百度自研旗舰大模型 ERNIE 4.5 配套工业级开发工具包,支持 4240 亿参数 MoE 模型的
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
百度自研旗舰大模型 ERNIE 4.5 配套工业级开发工具包,支持 4240 亿参数 MoE 模型的
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个拥有 4240 亿参数、能够同时理解文字、图片和视频的超级大脑,现在百度的工程师们把它做成了一个开源工具包,让任何人都可以用它来训练、定制和部署自己的大模型应用——这就是 ERNIE 4.5 + ERNIEKit。
ERNIE(Enhanced Representation through Knowledge Integration)是百度自 2019 年起自研的大语言模型系列,最初聚焦于中文语义理解,曾在 CLUE 榜单上长期占据榜首。随着 GPT-4 引领的多模态浪潮,ERNIE 团队在 2024-2025 年推出了 ERNIE 4.5,一个包含 10 个变体、横跨纯文本和图文视频的完整模型家族。
2025 年 11 月发布的 ERNIEKit v1.5 是该系列的工业级开发工具包,提供从数据处理、分布式训练到推理部署的全流程支持,底层基于百度自研的 PaddlePaddle 深度学习框架。ERNIE 4.5 的全部预训练权重已开源(Apache 2.0),开发者可直接从 Hugging Face 和百度 AI Studio 下载使用。

图1:ERNIE 4.5 模型参数规模对比与表格数据理解能力示例
ERNIE 4.5 的核心技术特征可以概括为三个层面:
1. 异构 MoE(Mixture-of-Experts)架构
最大的 ERNIE 4.5 模型拥有 4240 亿总参数,但每次推理或训练时只有 470 亿参数被激活(MoE 稀疏激活机制)。这意味着 ERNIE 4.5-424B 的计算成本接近一个 47B dense 模型,但能力上限远超同等规模的 dense 模型。百度采用了异构 MoE 设计:文本模态和视觉模态共享部分专家路由,同时保留各自模态专属的专家参数,通过模态隔离路由(modality-isolated routing)和路由器正交损失(router orthogonal loss)确保不同模态之间互不干扰、相互增强。
2. 多模态联合预训练
ERNIE 4.5-VL 系列同时在文本和视觉数据上进行预训练,文本模态输入文本和代码,视觉模态输入图片和视频片段。Context Window 统一为 128K tokens(纯文本和图文混合),支持超长文档理解。
3. 高效训练基础设施
百度在 ERNIE 4.5 训练中实现了 47% Model FLOPs Utilization(MFU),关键技术包括:
ERNIEKit 是 ERNIE 4.5 的配套开发工具,当前版本 v1.5 包含以下核心模块:
| 模块 | 功能 | 说明 |
|---|---|---|
| erniekit/train | 分布式训练 | 支持 SFT(全量微调)、LoRA、Prefix Tuning 等多种微调方式 |
| erniekit/eval | 模型评测 | 内置多 benchmark 评测脚本 |
| erniekit/export | 模型导出 | 导出推理格式,支持 FastDeploy 等推理引擎 |
| erniekit/chat | 在线推理 | 命令行对话界面 |
| erniekit/webui | Web 可视化界面 | v1.2+ 支持 VL 模型的训练与对话 |
| erniekit/cli | 命令行工具 | iluvatar GPU 支持 |
| tools/inference | 高性能推理 | FP8/Win8 量化推理 |
| data_processor | 数据处理 | Padding-free packing、无填充序列打包 |
支持的模型列表(2025-11 最新):
对于部署场景,ERNIEKit 提供了多种量化方案:
FP8 量化感知训练(QAT):在训练过程中直接使用 FP8 精度,量化误差在训练中被建模和补偿,最终模型可实现 INT8/INT4 量化推理,显存占用降低约 50%,推理速度提升 1.5-2 倍,同时保持精度损失小于 1%。
卷积码量化:百度自研的 4-bit/2-bit 无损量化算法,专为 ERNIE 4.5 MoE 模型设计,通过多专家并行协作机制,在低比特量化下保持模型表达能力。
推理部署可通过 FastDeploy 项目一键对接,支持 CPU/GPU/Kunlun 芯寒等多种硬件后端。
| 规格项 | 内容 |
|---|---|
| 开发框架 | PaddlePaddle(百度自研) |
| 最大参数量 | 424B(总参数)/ 47B(激活参数) |
| 模型架构 | 异构 MoE + 多模态联合训练 |
| Context Window | 128K tokens |
| 支持模态 | 文本、图像、视频 |
| 预训练框架 MFU | 47% |
| 微调方式 | SFT / LoRA / Prefix Tuning / 函数调用训练 |
| 训练优化 | FP8 混合精度、流水线并行、自动并行、Recomputation |
| 推理优化 | FP8 QAT、W8A8/W8A16 量化、PD 分离 |
| 许可证 | Apache 2.0 |
| 权重下载 | Hugging Face (baidu/)、AI Studio |
硬件门槛极高:424B MoE 模型至少需要 8x80GB GPU 才能运行推理,完整训练则需要数千 GPU 的分布式集群,普通开发者和中小企业难以承担。
部署复杂度大:ERNIEKit 是研发导向的工具包,缺乏 Docker 一键部署支持,需要手动配置 CUDA、cuDNN、NCCL、Python 环境,且依赖 PaddlePaddle GPU 版,安装流程与 PyTorch 生态不同。
社区生态相对封闭:相比 LLaMA/Mistral 生态有大量第三方工具支持,ERNIEKit 主要服务于百度自有模型,周边生态工具(如 vLLM 原生支持、LLaMA-Factory 适配等)还在建设中。
英文文档相对薄弱:ERNIEKit 大量核心文档仅有中文版,对非中文开发者存在一定门槛。
ERNIE 4.5 的开源在以下几个方面具有重要意义:
国产大模型能力的全面展示:424B MoE 模型在多项 benchmark 上达到 SOTA,填补了国内在超大规模多模态模型开源上的空白,对标 GPT-4o、Gemini 等国际顶级模型。
MoE 工程实践的参考价值:百度公开了异构 MoE 架构、模态隔离路由、FP8 训练等前沿技术的具体实现,对国内 AI infra 团队有重要参考意义。
垂直领域应用的基础:在金融、医疗、法律等领域,企业可基于 ERNIE 4.5 的开源权重,用 ERNIEKit 快速微调专属领域大模型,结合自有数据进行私有化部署。