LMFlow
开源大模型微调工具包,支持全量/LoRA/QLoRA/LISA多种微调策略,覆盖主流开源LLM
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源大模型微调工具包,支持全量/LoRA/QLoRA/LISA多种微调策略,覆盖主流开源LLM
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:一家医疗创业公司,想要基于 ChatGPT 级别的模型,但需要在内部数据上训练——联系 OpenAI 成本高昂,使用通用模型又不够精准。怎么办?LMFlow 给出的答案是:自己动手,在自己的服务器上,微调出专属的大模型。

图1:LMFlow 项目 logo
2023年初,大模型微调还是少数科技巨头的专属能力。LLaMA 模型开源后,虽然weights可以获取,但要在消费级或科研级硬件上微调这些数十亿参数的模型,技术门槛极高——显存不够、速度太慢、配置复杂,各种坑让大多数研究者望而却步。
正是在这一背景下,香港科技大学(HKUST)的研究团队于2023年3月开源了 LMFlow。项目一经发布便引发关注,其微调后的 Robin-33B 模型在 HuggingFace 排行榜上超越了众多知名模型,甚至在医疗领域任务上超过了 ChatGPT。这让人们意识到:开源社区的集体智慧,完全可以和闭源大厂掰手腕。

图2:LMFlow 核心功能一览(支持微调加速、推理加速、长上下文、模型定制等)
如果把预训练大模型比作一台出厂的豪华轿车,性能卓越但千篇一律。那么 LMFlow 就是那套个性化改装套件——你不需要换车,只需要花几个小时微调,就能让这辆车完美适配你的使用场景:有的用户需要它当医疗助手,有的需要它当代码助手,还有的需要它精通特定行业的专业术语。
LMFlow 支持多种微调策略:
这套"改装套件"的核心优势在于覆盖面广——支持的模型从 GPT-2 到 LLaMA-3、ChatGLM、Baichuan 等几乎所有主流开源大模型;支持的功能从监督微调(SFT)到 DPO、RAFT 等对齐算法,从单卡训练到多卡分布式(DeepSpeed ZeRO),应有尽有。
从代码层面看,LMFlow 采用了典型的Pipeline 架构。核心模块位于 src/lmflow/pipeline/ 下,包括:
技术栈上,LMFlow 深度依赖 transformers、accelerate、peft 和 bitsandbytes。2025年7月的 v1.0.0 大版本更新后,全面拥抱 Accelerate 框架,使得分布式训练的配置复杂度大幅降低。
显存优化是 LMFlow 的一大工程亮点。通过梯度检查点(Gradient Checkpointing)技术,用计算换显存;通过 DeepSpeed ZeRO-3 Offload,将部分参数卸载到 CPU/内存;通过 Flash Attention-2,将注意力计算加速2-4倍。这些技术的组合,使得在消费级 RTX 3090(24GB)上微调7B模型成为可能。
对于普通用户,LMFlow 的安装流程已经比较友好:
conda create -n lmflow python=3.9 -y
conda activate lmflow
conda install mpi4py
pip install -e .
LoRA 微调 7B 模型的显存需求为 16GB(FP16)或 10GB(QLoRA 8bit),对于有 NVIDIA 显卡的用户来说,这个门槛已经相当亲民。官方还提供了 Gradio Web UI 和 Flask 部署方案,方便快速搭建对话机器人。
但需要注意的是:这不是一个开箱即用的 SaaS 产品。用户需要具备基本的 Linux 操作能力和 GPU 环境配置知识。此外,vLLM 和 SGLang 两种推理后端依赖不兼容的 CUDA/PyTorch 版本,若同时需要两种后端,需要创建独立环境。
LMFlow 的出现,让大模型微调从"高不可攀"变成了"触手可及"。它证明了在消费级硬件上微调顶级大模型完全可行。其提出的 LISA 算法(Layerwise Importance Sampling)更是在学术上获得了认可。
从更宏观的视角看,LMFlow 代表的趋势是:基础模型开源化 + 微调工具民主化。当每个人都能根据自己的数据定制专属模型时,AI 应用将真正进入百花齐放的时代。

图3:Robin-33B 在 HuggingFace Open LLM Leaderboard 上的评测表现,超越众多知名模型