LoongForge
百度百舸开源的统一大模型训练框架,基于 Megatron-LM 深度优化,支持 LLM/VLM/Diffusion/VLA 四大模态,最高加速 5.04×
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
百度百舸开源的统一大模型训练框架,基于 Megatron-LM 深度优化,支持 LLM/VLM/Diffusion/VLA 四大模态,最高加速 5.04×
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你要训练一个拥有数千亿参数的大模型——这不是在单台电脑上跑一个 Python 脚本那么简单,而是需要协调数十台甚至数千台 GPU 服务器,让它们像一个整体一样高效运转。梯度要同步、优化器要更新、Checkpoints 要保存,任何一个环节出了岔子,整个训练任务就可能前功尽弃。这就是大模型训练的核心挑战:如何让分布式并行计算既快又稳。
百度百舸交出了一份答卷:LoongForge —— 一个面向 LLM、VLM、Diffusion 模型与 Embodied AI 的统一训练框架,于 2026 年 4 月正式开源。它的前身是百度内部的 AIAK-Training-LLM,已在教育、计算机视觉、Embodied AI 等多家企业客户的实际生产训练中落地,最大规模达到 5000+ XPU,通常带来 30%~50% 的训练加速。
LoongForge 的核心引擎是 Loong-Megatron —— 一个基于 NVIDIA Megatron-LM 深度定制的 fork,引入了大量百度内部的优化积累。在开源前,它支撑了多个公开大模型的训练,包括 LLaVA-OneVision 1.5(2025年10月)和 LLaVA-OneVision 2.0(2026年5月)的训练与发布。
项目的命名也颇有意思:Loong 源于中国传统龙舟,象征多支船桨协同发力、破浪前行——这正是分布式训练的本质:众多计算节点协作完成单一任务。名字中的 Forge 则直指框架的核心定位:锻造(训练)大模型。
Megatron-LM 是 NVIDIA 出品的权威分布式训练框架,在工业界有广泛验证,社区活跃。从它出发进行定制,既能复用成熟的并行策略(TP/PP/EP),又能针对特定场景做深度优化。LoongForge 的策略是:不重复发明轮子,而是在关键瓶颈点做突破。
LoongForge 覆盖的模型类型极其广泛,用一个框架统一了此前需要多个工具才能完成的工作:
支持从 LLaMA、Qwen、DeepSeek 到 GLM 等主流开源 LLM,涵盖 Dense 和 MoE 架构。LoongForge 在 MoE 场景下做了大量优化:All2All 通信、激活卸载与计算全链路重叠,使 DeepSeek-V3、Qwen3-MoE 等模型的显存占用相对上游 Megatron-LM 进一步降低。
通过配置驱动的方式,将可互换的 ViT 与 LLM 组件自由组装为 VLM。内置 GR00T N1.6、Pi0.5、InternVL 系列、Qwen2.5-VL 等主流 VLM 的开箱即用配置。支持 Encoder-Decoder 解耦训练,将 ViT 与 LLM 拆分为独立任务,消除流水线气泡。
重点支持 Wan 2.2 等 Diffusion 模型训练,新增 CP(上下文并行)与数据 packing 策略,训练加速达 116%。这是 LoongForge 在 2026 年 5 月的最新特性。
支持 GR00T、Pi0.5 等机器人控制模型,在 8×A800 配置下,GR00T N1.6 相对 LeRobot 基线加速 2.31×,Pi0.5 相对 OpenPI 基线加速 1.65×。
LoongForge 支持对模型不同组件(如 ViT vs LLM)独立配置 TP / DP / 重计算策略,这是传统 Megatron-LM 难以实现的能力。在多模态训练中,ViT 和 LLM 的计算特性差异很大,统一并行策略往往不是最优解。LoongForge 的异构并行让每个组件都能获得最优吞吐与显存占用。
面向 LLM 和 VLM 的端到端 FP8 支持,包括标准 blockwise FP8 和自适应 FP8 模式——后者根据 GEMM 形状与效率逐算子选择最佳精度,在精度与速度之间找到平衡点。
序列打包(sequence packing)场景下,不同节点的序列长度分布可能差异很大,导致 DP 并行时各 GPU 负载不均。LoongForge 基于负载感知的数据重分发,显著提升多节点扩展效率。
为 DSA(Domain-Specific Architecture)类模型设计了 FusedDSA 融合 Kernel,TileLang 版本已开源,CUDA 高性能版本在百度百舸平台提供。这一优化在 DeepSeek-V3.2 Lite 的减层配置验证中带来了 ~5× 加速,并突破性地支持 64K 序列长度(基线 Megatron-LM 在 8K 以上即 OOM)。
支持离线 Megatron ↔ HuggingFace 双向转换,以及在线原生 HF 加载/保存,全流程无格式壁垒。这是降低用户迁移成本的关键特性——用户可以先用 HuggingFace 生态的模型和数据,预训练后直接转换为 HuggingFace 格式继续使用,无需担心格式锁定。
LoongForge 提供了两套 Dockerfile,分别面向 NVIDIA GPU(docker/Dockerfile)和 昆仑芯 XPU(docker/Dockerfile.xpu)。NVIDIA 版本基于 nvcr.io/nvidia/pytorch:25.06-py3,自动安装 Flash Attention 2 & 3,昆仑芯版本基于百度自研镜像仓库。
然而,这套框架的部署绝非一键可达。核心挑战包括:
Loong-Megatron 作为子模块,并配合特定版本的 TransformerEngine(v2.9),需要通过 setup_env.py 脚本处理编译构建。因此,LoongForge 的目标用户是具备分布式训练经验的团队,而非个人开发者独立上手。
在 v0.1.1 版本上,LoongForge 相对主流开源基线展示了显著的性能优势:
| 模型 | 类型 | 对比基线 | 配置 | 加速比 |
|---|---|---|---|---|
| Qwen3-30B-A3B (MoE) | MoE | Megatron-LM | 32×A800 · GBS1024 · 32K | 1.16× |
| DeepSeek-V3.2 Lite | MoE+DSA | Megatron-LM | 减层配置 · GBS128 · 8K | 5.04× |
| Qwen3-VL-30B-A3B | VLM | VeOmni | 32×A800 · GBS128 · 32K | 1.45× |
| GR00T N1.6 | VLA | LeRobot | 8×A800 · GBS128 · 224² | 2.31× |
| Pi0.5 | VLA | OpenPI | 8×A800 · GBS112 · 224² | 1.65× |
最亮眼的是 DeepSeek-V3.2 Lite 的 5.04× 加速,这是通过 DSA CUDA Kernel 优化实现的——在 64K 序列长度下,基线 Megatron-LM 直接 OOM,而 LoongForge 仍可正常运行。
1. 生态锁定风险:虽然 LoongForge 声称支持 HuggingFace 生态,但核心基于定制版 Megatron(Loong-Megatron),这意味着用户的技术栈与百度深度绑定。如果未来百度停止维护,迁移成本较高。
2. 文档质量不均衡:主文档(README、快速开始)质量极高,但部分子目录(如 ops/tilelang_ops)的注释较少,高级用户想要自定义融合算子时可能需要深入源码。
3. 昆仑芯 XPU 的开源局限:昆仑芯版本的 Dockerfile 依赖百度内部镜像仓库 loongforge/loongforge_kunlun,部分 XPU 相关工具链未完全开源,对于非百度内部用户存在一定的使用壁垒。
4. 子模块管理复杂性:需要同时维护 Loong-Megatron 子模块和 TransformerEngine 的 patch,生产环境依赖管理较繁琐。
LoongForge 的开源,是百度在大模型基础设施层面的一次主动出击。随着通义千问(阿里)、混元(腾讯)、智谱 GLM 等国内大模型竞争加剧,训练框架成为新的竞争高地。百度选择开源 LoongForge,一方面吸引开发者和企业用户建立生态锁定,另一方面通过社区反馈加速框架本身的迭代。
从技术角度看,LoongForge 的异构并行、自适应 FP8、DP 负载均衡等特性,在学术界和工业界都有较高参考价值。它代表了 Megatron-LM 最激进的工业优化方向,对其他训练框架(如 DeepSpeed、Megatron-DeepSpeed)有很强的对比参照价值。
如果你在构建大规模 AI 训练基础设施,LoongForge 值得重点关注。即使不使用它,其设计理念和性能优化思路也能为你的技术选型提供有价值的参考。