ai-toolkit
扩散模型微调全能工具包,支持 LoRA/完整微调/视频训练,本地 GPU 即可运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
扩散模型微调全能工具包,支持 LoRA/完整微调/视频训练,本地 GPU 即可运行
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你是一位摄影师,手里有一台顶级的数码单反,但出厂设置永远拍不出你想要的风味——你需要「微调」它。AI 图像生成模型也是这样:开源社区贡献了无数强大的基础模型,但要让它们学会你的风格、记住你的概念,就需要一套专业训练工具。

图1:AI Toolkit Web UI 界面,清晰展示训练任务状态和进度
AI Toolkit 由独立开发者 @ostris 创建和维护,项目于 2024 年初首次发布 GitHub 仓库。作者的目标非常明确:让最新的扩散模型在消费级 GPU 上也能完成训练,而不是只能依赖云端 A100 集群。这一理念使项目迅速在 AI 爱好者中传播,并在 CivitAI、HuggingFace 社区中被大量 LoRA 创作者采用。
截至目前,该工具支持超过 25 个主流图像模型、10+ 视频模型和 2 个音频模型的微调,涵盖 FLUX.1/2、SDXL、SD 1.5、HiDream、Lumina、OmniGen、Wan 2.1 等几乎所有业界重要模型。Star 数量超过 10,000,在同类项目中稳居头部。
AI Toolkit 的功能围绕扩散模型微调展开,提供 CLI 和 Web UI 两种交互方式:
1. 多种训练范式
2. 多模态模型支持
除了图像扩散模型,还支持视频生成模型(如 Wan 2.1)和音频模型(如 Ace-Step)的训练,覆盖了 AI 生成内容(AIGC)的主流模态。
3. Web UI 界面
内置基于 Node.js 的 Web 管理界面,可在 http://localhost:8675 访问,支持任务启动/停止/监控,支持 Token 认证保护(通过 AI_TOOLKIT_AUTH 环境变量设置密码),使远程服务器上的训练任务管理更加直观。
4. 断点续训
训练可随时用 Ctrl+C 中断,再次启动时自动从上一个 checkpoint 恢复,无需重新开始。
AI Toolkit 采用模块化插件架构,核心代码组织如下:
toolkit/ # 核心训练引擎
├── data_loader.py # 数据加载与预处理
├── sd_trainer.py # 稳定扩散训练器
└── ema.py # 指数移动平均(权重平滑)
jobs/ # 任务类型定义
├── TrainJob.py # 训练任务
├── ExtractJob.py # VAE/Embedding 提取
└── GenerateJob.py # 生成任务
extensions_built_in/ # 内置扩展
├── sd_trainer # 核心扩散训练扩展
├── diffusion_models # 扩散模型支持
└── captioner # 自动标注
核心技术栈:
einops、k-diffusion 等)优化训练过程。方式一:Docker(推荐,最快)
git clone https://github.com/ostris/ai-toolkit.git
cd ai-toolkit
docker-compose up -d
官方镜像 ostris/aitoolkit:latest 基于 Ubuntu 24.04 + CUDA 12.8,内置所有依赖和 Web UI。docker-compose 配置了 NVIDIA GPU 直通,开箱即用。
方式二:本地源码(更灵活)
git clone https://github.com/ostris/ai-toolkit.git
cd ai-toolkit
python3 -m venv venv && source venv/bin/activate
pip install torch==2.9.1 torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
python run.py config/your_config.yml
Web UI(可选):cd ui && npm install && npm run build_and_start
硬件要求:最低 8GB VRAM(LoRA 基础),推荐 24GB VRAM(完整训练)。支持 Windows、Linux、macOS(实验性 Silicon Mac 支持)。
AI Toolkit 的出现填补了一个关键空白:让创作者不再受制于云端训练服务的算力限制和成本。在 CivitAI 平台上,大量高质量 LoRA 模型都标注了使用 AI Toolkit 训练;HuggingFace 上的多个 Flux LoRA 也明确感谢了这个工具。
从技术上看,AI Toolkit 代表了开源社区在扩散模型训练领域的工程化最高水平:它将原本只有大厂才能操作的训练流程,浓缩为几行 YAML 配置,让普通开发者也能训练定制化的生成模型。随着 FLUX.2、Wan 2.2 等新模型的持续加入,该项目正在成为 AIGC 创作者的标准装备之一。