LlamaFactory
一站式大模型微调平台,支持100+模型、多种微调方法,ACL 2024顶会发表
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一站式大模型微调平台,支持100+模型、多种微调方法,ACL 2024顶会发表
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,为什么同样一个问答模型,在通用场景下对答如流,换到医疗、法律等垂直领域就开始「一本正经地胡说八道」?根源在于通用大模型的训练数据无法覆盖所有专业场景。而微调(Fine-Tuning),正是解决这个问题的钥匙——它让开发者能够基于开源大模型,用自己的数据训练出一个「更懂行」的专属版本。
然而,传统微调大模型的门槛极高:需要精通分布式训练框架(如 DeepSpeed)、手动配置十余项超参数、编写大量胶水代码……一个模型训练脚本往往需要数百行,且换一个模型就要重来一遍。这让许多中小团队和个人开发者望而却步。
LLaMA Factory 正是为解决这一痛点而生。它是一个开源的大模型高效微调工具箱,由北京航空航天大学研究人员开发,在 GitHub 上斩获超过 7.1 万颗星,并发表于 NLP 顶会 ACL 2024。它的核心目标只有一个:让微调大模型变得像安装一个软件那样简单。

图1:LLaMA Factory 项目官方 Logo
LLaMA Factory 的本质是一个统一微调框架,它将市面上十余种主流微调方法抽象为标准化的命令行和 Web UI 操作流程。开发者无需关心底层实现细节,只需选择模型、配置数据、点一下「开始训练」,即可完成微调。
项目支持的模型阵容堪称豪华:覆盖 LLaMA、Qwen、DeepSeek、GLM、Yi、Phi、Gemma、Mistral 等 100+ 种开源大语言模型,以及 LLaVA、Qwen2-VL 等视觉-语言模型。无论你想微调哪个主流模型,LLaMA Factory 基本都有现成支持。
支持的训练方法同样全面,包括:
对于追求训练效率的团队,LLaMA Factory 支持 DeepSpeed ZeRO、Megatron-core 分布式训练加速,可高效利用多卡集群。训练过程中可通过 W&B(SwanLab) 实时可视化 Loss 曲线和 GPU 利用率,监控训练状态。
项目还提供了 OpenAI 风格 API 部署能力:微调完成后,可一键通过 vLLM 启动推理服务,其他应用通过 HTTP API 调用,无需额外部署。
如果说命令行是开发者的专属武器,那 LLaMA Board 就是面向所有人的微调「可视化面板」。它基于 Gradio 构建,提供了完整的浏览器端 Web UI。
在 LLaMA Board 中,你可以:
这种「所见即所得」的体验,极大降低了微调的技术门槛——即便没有深度学习背景的产品经理或领域专家,也能通过 LLaMA Board 完成一次有意义的微调实验。
LLaMA Factory 在部署方面也做了充分考虑。项目提供了 Docker + NVIDIA Container Toolkit 的完整方案:一个 docker-compose up 即可拉起包含所有依赖的训练环境,自动分配 GPU 资源,端口 7860 开放 Gradio Web UI 访问,端口 8000 开放推理 API。
部署核心硬件需求:
| 场景 | 最低配置 | 推荐配置 |
|---|---|---|
| QLoRA 微调 7B 模型 | RTX 3060 12GB | RTX 3090 / RTX 4090 24GB |
| 全量微调 7B 模型 | 单卡 A100 40GB | 多卡 A100 集群 |
| 全量微调 70B 模型 | 多卡 A100 80GB | 多卡 H100 集群 |
对于没有 GPU 的用户,项目还接入了魔搭社区(ModelScope)和魔乐社区(ModelLink) 的模型下载服务,可快速拉取预训练权重。线上用户可直接使用 LLaMA Factory Online(llamafactory.com.cn)云端微调,无需本地配置环境。
从代码结构看,LLaMA Factory 采用经典的模块化分层架构:
src/llamafactory/
├── train/ # 训练核心逻辑(支持多种训练后端)
├── model/ # 模型加载、量化、合并
├── data/ # 数据集加载与预处理
├── chat/ # 对话推理模块
├── eval/ # 评测任务(MMLU、CMMLU 等)
├── api/ # FastAPI 推理服务
├── webui/ # Gradio Web UI 入口
├── v1/ # 统一入口(整合训练/推理/对话)
└── extras/ # 工具函数(日志、绘图、包管理)
依赖方面,项目基于 PyTorch 2.4+、Transformers 4.55+、PEFT 0.18+、TRL 0.18+ 等主流库构建,版本约束清晰,依赖冲突较少。Python 版本要求 3.11 以上,保证了类型提示和运行时特性的完备性。
代码质量方面,项目使用 Ruff 作为 linter/formatter,覆盖复杂度、代码风格、导入排序等维度,并内置 pre-commit 钩子 确保提交代码符合规范。测试覆盖了主流训练流程的端到端用例。
尽管 LLaMA Factory 功能强大,但也存在一些需要注意的地方:
1. 生产级 MLOps 能力有限。 LLaMA Factory 定位是「微调工具」而非「训练平台」,缺乏模型版本管理、增量训练、A/B 测试、灰度发布等生产级功能。大规模训练场景仍需结合 MLflow、Ray 等框架。
2. 特定国产硬件适配需额外配置。 虽然项目支持华为 NPU(昇腾芯片)和壁仞 GPU,但需要从源码构建对应 Docker 镜像,对于没有相关硬件的团队存在一定上手成本。
3. 推理性能并非最优。 项目内置的 vLLM 推理服务主要用于快速验证,并非极致性能优化方案。高并发生产部署建议单独部署 vLLM 或 TensorRT-LLM。
LLaMA Factory 的出现,折射出当前 AI 领域的一个重要趋势:从「训练大模型」到「微调大模型」的工作重心迁移。随着 GPT-4、Claude、Qwen 等基础模型能力越来越强,行业意识到与其从零训练一个新模型,不如在开源大模型基础上用少量数据微调,快速获得垂类专家模型。
LLaMA Factory 正是这一趋势的代表性工具。它将微调的工程复杂度从「需要专业团队」降低到「个人开发者可及」的水平,极大加速了垂直领域 AI 应用的落地。7.1 万 Star、ACL 2024 论文发表、100+ 模型覆盖——这些数字背后,是整个开源社区对「高效微调」这一方向的强烈需求和高度认可。
未来,随着模型规模的持续增长和微调方法的持续演进,LLaMA Factory 这类工具的价值将进一步凸显——它不仅是一个软件工具,更是大模型走向普惠化、工程化的一把钥匙。