axolotl
开源最全面的 LLM 微调框架,一套 YAML 配置搞定全链路训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源最全面的 LLM 微调框架,一套 YAML 配置搞定全链路训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Axolotl 项目 Logo
你是一个 AI 开发者,手头有一个 70 亿参数的 LLaMA3 模型,想让它学会写更符合你产品风格的代码。但从头预训练一次要烧掉几十万元,GPU 集群、清洗数据集、超参调参——门槛高到让人望而却步。
Axolotl 就是来解决这个问题的:它是一个开源的 LLM 微调框架,让你只需写一个 YAML 配置文件,就能启动一次完整的微调训练流程——从数据预处理到模型量化,一气呵成。截至 2026 年初,该项目在 GitHub 上已积累近 12000 颗星,是开源 LLM 微调领域最活跃的项目之一。
2024 年开始,大语言模型的能力爆发式增长,但各家基座模型的通才能力与特定场景需求之间始终存在 Gap。预训练一个 7B 参数模型,保守估计需要 100 张 H100 GPU 运行一个月,费用轻松突破百万级别。相比之下,针对特定任务(如客服对话、代码补全、医疗报告生成)对已训练好的模型进行微调,成本可以压缩到几千元甚至更低。
Axolotl 诞生于 2023 年,由开源社区维护,最初是针对 LLaMA 系列模型的微调工具。随着生态扩展,它逐渐支持 Mistral、Mixtral、Qwen、GLM、Pythia 等几乎所有主流开源大模型,并从最初的 CLI 工具演变为一个完整的训练平台。2025 年起,团队将 Axolotl 重构为 uv-first 项目(使用 uv 作为 Python 包管理器),大幅提升了安装和依赖解析速度。
Axolotl 最大的技术优势在于覆盖了几乎所有主流的 LLM 微调范式,并且将它们封装成了声明式的 YAML 配置:
| 微调方法 | 说明 | 适用场景 |
|---|---|---|
| 全量微调 (Full Fine-tune) | 更新所有模型参数 | 数据量大、硬件充足 |
| LoRA / QLoRA | 低秩适配器,显存友好 | 消费级 GPU、个人开发者 |
| GPTQ / QAT | 量化感知训练,减少推理延迟 | 边缘部署、实时推理 |
| DPO / IPO / ORPO / KTO | 直接偏好优化,强化对齐 | RLHF 替代方案 |
| GRPO / GDPO | 强化学习策略优化 | 复杂推理任务 |
| Reward Modelling / PRM | 奖励模型构建 | 过程奖励引导 |
其中,QLoRA(量化 LoRA)是 Axolotl 最受欢迎的使用方式——它允许在一张 24GB 显存的消费级 GPU 上微调 70 亿参数模型。通过 4-bit NF4 量化加 LoRA 低秩分解,VRAM 占用从全量微调的约 60GB 压缩到约 14GB,几乎翻倍了可用用户群。
2025 年,Axolotl 还引入了 MoE Expert 量化(通过 quantize_moe_experts: true 配置),针对 Mixtral、Qwen3 MoE 等稀疏专家模型,大幅降低 VRAM 使用。SageAttention 和 Scalable Softmax 的集成则改善了长上下文注意力计算的效率。
图2:Axolotl 支持的训练方法与模型生态
2025 年 3 月,Axolotl 正式支持多模态训练,可以将视觉语言模型(VLM)纳入微调范畴。支持模型包括:LLaVA、Qwen2-VL、Pixtral、SmolVLM2、GLM-4.6V、InternVL 3.5、Gemma 3n,以及音频模型 Voxtral。用户可以针对图像描述、视觉问答、视频理解等任务进行微调。
2025 年 9 月,Axolotl 还引入了 Text Diffusion Training 支持,意味着它不再局限于语言模型的微调,还支持扩散模型的文本生成训练,进一步扩展了框架的能力边界。
Axolotl 的核心理念是配置即代码。用户只需要定义一个 YAML 文件,即可覆盖以下全链路:
base_model: meta-llama/Llama-3.1-8B-Instruct
model_type: LlamaForCausalLM
load_in_4bit: true
adapter: qlora
lora_r: 8
lora_alpha: 16
dataset_prepared_path: ./data/my_data
num_epochs: 3
optimizer: adamw_torch
learning_rate: 0.0002
这一设计的优势在于:任何一次训练的配置都可以完整保存、分享和复现。对于团队协作和学术研究而言,这种可复现性至关重要。框架底层基于 HuggingFace Transformers、PEFT、TRL、Accelerate 和 DeepSpeed/FSDP,最大化硬件利用率。
Axolotl 在多卡训练方面支持多种并行策略的组合:
此外,Multipacking 技术通过将多个短序列打包进同一批次,显著提升了训练吞吐量,在处理大量短对话样本时效果尤为明显。
Axolotl 提供两种启动方式:
方式一:本地 Docker 部署(推荐)
git clone https://github.com/axolotl-ai-cloud/axolotl.git
cd axolotl
docker compose up -d
docker compose exec axolotl bash
docker-compose.yaml 已配置好 NVIDIA GPU 挂载和 HuggingFace 缓存卷,开箱即用。
方式二:本地 Python 环境
pip install axolotl
axolotl train examples/llama3/qlora.yml
官方提供了 Google Colab Notebook,对没有本地 GPU 的用户非常友好,可直接在 Colab 的 T4 GPU 上跑通基础 QLoRA 训练流程。
硬件需求方面,使用 QLoRA 7B 模型至少需要 24GB 显存(如 RTX 3090/4090 或 A10G);全量微调 70B 模型则需要 8xA100 80GB。
配置复杂性:虽然 YAML 配置文件降低了上手门槛,但高级特性(如多模态、组合并行)仍需要深入理解底层原理,初学者容易在调试中迷失。
文档质量参差不齐:部分新特性(如 ND Parallelism、SageAttention)的文档描述有限,用户往往需要参考 GitHub Issue 和 Pull Request 才能理解用法。
与 Axolotl-Cloud 的关系:项目 2025 年起的更新中大量引入 Cloud 相关内容(如 Modal 集成),部分用户担忧框架是否会逐渐向云端商业化倾斜。
Axolotl 的增长曲线反映了 LLM 开源生态的一个重要趋势:从拼基座模型转向拼微调效率。随着基座模型能力趋于同质化(GPT-4o、Mistral Large、Qwen3 等差距越来越小),谁能以更低成本将模型适配到垂直场景,谁就拥有竞争优势。
Axolotl 以每月数个新模型适配的速度持续扩张,2026 年已支持 Gemma 4、Mistral Medium 3.5、Qwen3.5 等最新模型。这种模型覆盖广度和训练方法全面性的组合,是它相对于 HuggingFace PEFT、llamafactory 等竞品的核心差异化。
从 GitHub Stars 增长趋势看,Axolotl 在 2025 年全年保持了稳定的月均 500-800 星增长,进入 2026 年后增速有所放缓但仍维持正增长,表明项目已从早期爆发期进入成熟维护期。
总结:Axolotl 是当前开源社区中功能最全面、生态最丰富的 LLM 微调框架之一。如果你需要微调任何主流开源大模型,它几乎一定是首选工具链。唯一的门槛是:你需要有一块足够大的 GPU。