unsloth
2-5倍速 LLM 微调框架,70%显存降低,支持500+模型本地训练与推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2-5倍速 LLM 微调框架,70%显存降低,支持500+模型本地训练与推理
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Unsloth 官方 Logo
你有过这样的经历吗?花了几百美元在云端 GPU 上微调一个大模型,结果跑了 8 小时才发现参数配错了,预算直接打水漂。
Unsloth Studio 正是为解决这个痛点而生的。它是一个本地化的 AI 模型微调与推理平台,核心能力可以概括为:让普通开发者的个人电脑也能跑得动、训得起 GPT-oss、Qwen3.6、DeepSeek、Gemma 4 这些顶级大模型。
Unsloth 由 Unsloth AI 团队开发,GitHub Star 数已突破 65,000,是当前最受欢迎的 LLM 微调开源项目之一。项目创立于 2023 年 11 月,创始团队发现市面上的模型微调工具普遍存在两个问题:一是显存占用过高,7B 参数的模型在标准 PyTorch 下需要 14GB 以上显存;二是训练速度太慢,H100 的算力被大量浪费在无效的计算冗余上。
针对这两个问题,Unsloth 团队从底层算子入手,自研了 Triton 内核和数学优化 kernel,绕过了 PyTorch 的通用实现,直接对矩阵乘法、反向传播等核心计算进行手写优化。这相当于给赛车换了一台更高效的引擎:同样一圈赛道,耗油更少、速度更快。
2026 年 3 月,Unsloth Studio Web UI 正式发布,标志着项目从纯命令行工具升级为带图形界面的桌面应用。同年 11 月又带来了 FP8 强化学习支持,并与 OpenAI、NVIDIA 开展合作,进入了 Hugging Face 官方推荐工具链。
Unsloth 支持对 500+ 开源模型进行微调,涵盖 Llama、Qwen、DeepSeek、Gemma、Mistral、Phi 等主流架构。与标准 Hugging Face + PEFT 方案相比,Unsloth 可实现 2 倍训练速度提升、70% 显存降低,且精度几乎无损。
具体技术手段包括:
用户既可以通过 Unsloth Studio 桌面客户端的图形界面操作(拖拽数据、可视化节点流程),也可以使用 Unsloth Core 命令行工具(unsloth CLI)进行脚本化训练。两种方式共用同一套底层优化逻辑。
微调模型的质量直接取决于训练数据。Unsloth Studio 提供了一个可视化的 Data Recipe 功能,支持从 PDF、CSV、DOCX 等文件格式中自动提取、清洗、格式化训练语料。用户可以通过图形节点编辑器定义数据处理流程,降低了构建高质量数据集的技术门槛。对于没有 NLP 背景的产品经理或领域专家来说,这大大降低了高质量微调的入门难度。
训练完成后,用户可以直接在 Unsloth Studio 中运行推理。它支持:
推理速度也经过了专项优化:预编译的 llama.cpp 二进制文件让推理启动比之前快 10 倍。
Unsloth 支持将本地模型部署为 API 端点,兼容 OpenAI API 格式,可直接对接 Claude Code、LangChain、AutoGen 等开发框架,实现本地 LLM 的无缝集成。这对于需要数据隐私(不希望数据上传到云端)或需要低延迟响应的企业场景尤为重要。

图2:Unsloth Studio 主界面(加载页面)
从代码结构来看,Unsloth 项目分为两大层:
核心 Python 层(unsloth/ 目录):
kernels/:Triton 自定义 CUDA 内核,是性能优势的核心来源models/:适配各主流模型架构的加载和预处理逻辑optimizers/:内存优化的优化器实现(AdamW 等的变体)trainer.py:统一的训练器封装,暴露简洁的 APIsave.py:模型导出逻辑,支持多种量化格式dataprep/:数据预处理管道Studio 桌面层(studio/ 目录):
frontend/:基于 Vite + TypeScript 的 React 前端,提供 Web UIsrc-tauri/:Rust 写的 Tauri 桌面框架,跨平台打包(Windows/macOS/Linux)backend/:Python 后端服务,运行模型推理和训练逻辑install_llama_prebuilt.py:自动下载预编译 llama.cpp 二进制文件CLI 工具(unsloth_cli/)基于 Typer 构建,暴露类似 unsloth train、unsloth chat 的子命令,pip 安装后即可在终端使用。这种图形界面加命令行双入口的设计,让 Unsloth 既能吸引非技术用户,又保留了高级用户的自动化空间。
依赖方面,核心训练依赖包括 PyTorch、Hugging Face Transformers、PEFT、TRL(Transformers Reinforcement Learning)、Diffusers、SentencePiece 等。Triton 是可选依赖(Linux 下自动安装,Windows/macOS 跳过)。
Unsloth 不支持 Docker 部署,这是它与其他开源 LLM 推理平台(如 vLLM、Ollama)的最大区别。原因在于 Unsloth Studio 是一个桌面客户端应用,需要 GPU 直通和本地 Python 环境,而非标准的 Web 服务架构。
不过安装过程已经非常简化:
curl -fsSL https://unsloth.ai/install.sh | shirm https://unsloth.ai/install.ps1 | iex硬件要求上,训练至少需要 8GB 显存(7B QLoRA 可在 8GB 下跑),纯推理 4GB 显存即可。磁盘空间需要 20GB 以上(模型文件较大)。
不支持 GPU 的 CPU Only 用户目前仅能使用 Chat 推理和 Data Recipe 功能,训练功能不可用。
Unsloth 的出现,重新定义了个人 AI 开发者能做的事情边界。在此之前,GPT-4 微调只在拥有 A100/H100 的企业或实验室里才能进行;现在,一个有 RTX 4090 的独立开发者花几十美元的电费,就能在一天内完成一次完整的高质量微调实验。
从生态位上看,Unsloth 与以下工具形成互补:
GitHub 上 65,000+ Star、5,762 个 Fork、1,285 个 open issues 说明社区活跃度极高。但需要注意,大量 issues 也意味着项目仍在快速迭代中,部分功能(如多 GPU 训练)的稳定性有待验证。
总体而言,Unsloth 是当前开源生态中训练效率最高、对硬件最友好的 LLM 微调框架之一。它用工程优化而非算法创新,在不损失精度的前提下打破了微调必须烧卡的固有认知,让 AI 实验的门槛真正降低了一个量级。

图3:Unsloth 新版品牌标识
License:Apache-2.0 | 主语言:Python | 活跃度:65,000+ Stars 持续更新