SLiME
清华大学开源的 LLM 后训练框架,通过强化学习 Scaling 让大模型自主优化推理策略
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
清华大学开源的 LLM 后训练框架,通过强化学习 Scaling 让大模型自主优化推理策略
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你教会了 AI 下棋的基本规则,但 AI 只能在固定棋盘上重复同样的走法,无法应对对手的创新战术。传统的大语言模型(LLM)后训练(post-training)就面临类似的困境——即便通过 SFT(监督微调)注入了知识,模型仍然缺乏动态适应和自我改进的能力。 SLiME(SGLang-Native post-Training framework for Megatron-based RL Scaling)正是为解决这一问题而生。它是清华大学自然语言处理实验室(THUDM)开源的 LLM 后训练框架,专注于将强化学习(RL)Scaling 真正落地,让模型能够在训练过程中持续优化自身策略,实现「越练越强」的效果。
大语言模型的能力跃升,往往不只靠「喂」更多数据,更靠后训练阶段的质量。2024-2025 年,清华 THUDM 团队先后发布了 GLM-4.5、GLM-4.6、GLM-4.7、GLM-5、GLM-5.1 等一系列前沿模型,这些模型背后的 RL 后训练基础设施,正是 slime。 slime 最初并非为单一模型设计。它的核心驱动力是解决一个行业级难题:如何在大规模 GPU 集群上,高效运行「训练-推理-数据生成」的完整 RL 循环,同时保持工程可复现性和调试便利性。 在 slime 出现之前,开源社区的 RL 后训练框架普遍存在两个极端:要么过于简化,只支持 toy 级别的单卡训练;要么过于重型,需要大量定制代码才能适配到实际模型训练流程。slime 则选择了一条中间路线——在保持足够通用性的同时,最大程度贴近工业级训练场景。
slime 的架构围绕三个核心模块展开: 1. Training(Megatron):负责主训练流程,从 Data Buffer 读取数据,完成梯度更新后,将模型参数同步到推理模块。采用 Megatron-LM 作为训练后端,支持张量并行(Tensor Parallelism)、流水线并行(Pipeline Parallelism)和 ZeRO 优化等分布式策略,能够在数百张 GPU 上完成千亿参数模型的训练。 2. Rollout(SGLang + Router):负责生成新的训练数据(包括奖励信号和验证器输出),并将结果写回 Data Buffer。通过 SGLang 作为推理引擎,支持高吞吐量的大批量 token 生成。Router 组件提供会话亲和性(session affinity)等策略,优化多轮 Agent 场景下的推理效率。 3. Data Buffer:连接训练和推理的桥梁模块,管理 prompt 初始化、自定义数据和推理生成方法的调度。特别值得注意的是,Data Buffer 采用了统一接口设计——无论是简单的单轮问答,还是复杂的多轮 Agent 推理流程,都通过相同的接口注入训练数据流。 这种设计的精妙之处在于:训练和推理是完全解耦的,但通过 Data Buffer 保持数据流的一致性。这意味着开发团队可以在完全隔离的环境中调试推理流程(rollout-only)或训练流程(train-only),而不必每次都启动完整的 RL 循环。
slime 最大的技术亮点是其「SGLang-Native」设计哲学。不同于其他框架将推理引擎视为可替换的后端,slime 从一开始就围绕 SGLang 构建推理层,并将其作为一等公民深度集成。
这种集成带来了显著的优势:所有 SGLang 支持的推理参数都可以通过 --sglang- 前缀直接传递,无需额外的抽象层。例如,传递 --sglang-mem-fraction-static 即可控制 SGLang 的静态显存分配比例。同样的设计也应用于 Megatron——Megatron 的所有并行策略、优化器配置、checkpoint 选项都保持原生可用。
此外,slime 还支持多项高级推理特性:
RL 后训练的核心在于「数据生成—奖励计算—策略更新」的循环。slime 在这一环节提供了极高的灵活性,支持多种数据生成和奖励计算模式:
multi_agent 示例,训练多 Agent 协同完成复杂任务。
这种灵活性使 slime 不仅仅是一个「RL 训练器」,更是一个可扩展的数据生成平台。任何能产生训练样本和奖励信号的工作流,都可以通过 slime 的自定义接口接入 RL 训练流程。RL 训练中的 bug 往往是「静默」的——训练脚本看似正常运行,但模型能力却在悄然退化。slime 团队将这一问题作为一等工程问题来对待:
slime 的开源生态正在快速扩展,已有多个基于 slime 构建的项目进入公众视野:
必须坦诚地说,slime 是一个面向专业 AI 团队的框架,而非开箱即用的产品。 部署 slime 需要满足以下条件:
2025 年,RL Scaling 被视为继 Scaling Law 之后,大模型能力提升的下一个主要驱动力。与 SFT 不同,RL Scaling 的核心在于通过环境反馈让模型自主探索更优的策略,而非被动模仿标注数据。 slime 的开源,意味着国内团队终于有了一个经过生产验证的 RL 后训练基础设施。在此之前,大多数 RL 后训练能力都是闭源的,或仅在小规模场景下验证。slime 的出现打破了这一局面,让更多团队有机会尝试 RL Scaling 的前沿方法。 从更宏观的视角看,slime 也是 THUDM「大模型开源生态」的重要一环。从 ChatGLM 系列模型,到 VisualGLM 多模态模型,再到 slime 训练框架,清华团队正在构建一个从模型训练到推理部署的完整开源闭环。 如果你正在探索 LLM 的能力上限,或者需要为特定领域定制一个「越用越聪明」的 AI 系统,slime 值得深入研究。即便当前没有大规模训练的需求,理解其架构设计思路,对于把握 LLM 后训练的技术走向也极有价值。