Jackrong-llm-finetuning-guide
Unsloth加速的LLM微调知识库,含SFT/GRPO/GSPO训练配方与Qwen MTP GGU
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Unsloth加速的LLM微调知识库,含SFT/GRPO/GSPO训练配方与Qwen MTP GGU
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:作者 Jackrong 的 GitHub 头像
大多数 AI 爱好者在玩过大模型 API 之后,都会产生一个念头:"如果能用自己的数据微调一个专属模型就好了"。然而真正动手时,面对的是一连串问题——选什么基座模型、用什么微调方法、数据怎么清洗、梯度怎么算、训练完怎么导出、导出了怎么量化部署……每一个环节都有大量坑。
Jackrong 从 2026 年 4 月开始构建的这个开源知识库,正是为了解决这个痛点:把 LLM 微调的完整流程——从数据集准备、SFT 监督微调、GRPO/GSPO 强化学习训练,到 GGUF 导出与量化——整理成可复现的配方(Recipe),配上保姆级文档,让任何人都能在 Colab 或 Kaggle 上跑通自己的微调流程。
作者 Jackrong(R6410418)是一位长期活跃在 Hugging Face 社区的独立开发者,目前在 HuggingFace 上发布了多个微调模型,包括 Qwopus 系列(3.5/3.6 版本,覆盖 9B 到 35B 参数规模)和 Qwopus GLM 18B。这些模型均基于本知识库中的配方训练而来。
项目自 2026 年 4 月上线以来,仅两个月即获得 1411 stars、243 forks,在同期同类项目中增长十分迅速。仓库 topics 涵盖了 fine-tuning、llm、pytorch、unsloth、qwen、llama3 等 12 个主流 AI 标签,说明其覆盖的技术栈非常全面。代码采用 Apache-2.0 开源许可,文档提供中、英、韩、日四语版本,全球开发者均可无障碍使用。
这是整个知识库的主体部分,按模型和方法分类,提供可直接运行的 Colab / Kaggle notebook 或 Python 脚本:
| 配方 | 模型 | 方法 | 环境 | 难度 |
|---|---|---|---|---|
| Qwopus3.5 27B SFT | Qwopus 27B | SFT (LoRA/QLoRA) | Google Colab | ⭐ 初学者 |
| Qwen3.5 Neo 9B SFT | Qwen 9B | SFT | Kaggle | ⭐ 初学者 |
| Qwopus3.5 35B SFT | Qwopus 35B | SFT (A3B 配置) | Kaggle | ⭐⭐ 中级 |
| Llama3.2-R1 3B GRPO | Llama 3B | GRPO 强化学习 | Kaggle | ⭐⭐⭐ 进阶 |
| Qwopus3.6 27B GSPO | Qwopus 27B | GSPO 强化学习 | Python 脚本 | ⭐⭐⭐ 进阶 |
每个配方目录都包含:
data_processing_code/ 目录提供了完整的数据处理流水线。代表性的 DeepSeek-v4-API-distill.ipynb 展示了如何利用 API 调用实现知识蒸馏,将大型教师模型(如 DeepSeek-v4)的输出转化为高质量训练数据。
这一部分对于希望打造专属训练集的用户尤为关键——数据集质量往往比模型架构对最终效果的影响更大。
仓库收录了 24 个经过精选的高保真数据集,覆盖推理(Reasoning)、数学、代码生成、多轮对话、领域专业数据和指令跟随等多个类别。所有数据集均可通过 download_datasets.py 脚本批量下载到本地训练环境,避免逐个手动获取的繁琐。
这是知识库中最具技术深度的子模块,专门解决"微调后的模型如何变成可直接推理的 GGUF 文件"的问题。
传统痛点:对 Qwen 系列模型进行微调后(如用 SFT 或 GRPO 训练),模型的 MTP(Multi-Token Prediction)头部会丢失,导致模型丧失前沿 token 预测能力,生成质量下降。现有开源工具大多直接丢弃 MTP 头部。
Jackrong 的解决方案:qwen-mtp-gguf 实现了完整的 MTP 提取、注入、转换、验证和量化 pipeline:
-ngl 0,适配所有机器)该 pipeline 支持 stream(边量化边上传播放磁盘)、batch(全量量化后上传)和 local-only(仅本地保留)三种上传策略,可按网络条件和磁盘空间灵活选择。
codex-goals/ 目录提供了可编辑的 AI agent 任务模板,用于自动化 RL 训练、MTP GGUF 转换和仓库维护工作流。这是面向希望将知识库流程集成到 AI coding agent 中的高级用户。
Jackrong-llm-finetuning-guide/
├── train_code/ # 核心训练配方(Colab/Kaggle notebooks + Python scripts)
│ ├── Qwopus3-5-27b-Colab.ipynb
│ ├── Qwopus3.6-27B-GSPO/qwopus3_6_27b_gspo_training.py
│ └── ...
├── data_processing_code/ # 数据蒸馏与预处理(Jupyter notebooks)
├── qwen-mtp-gguf/ # MTP GGUF 转换工具(Python + shell scripts)
│ ├── SKILL.md # 技能定义文件
│ ├── scripts/ # 自动化脚本
│ ├── bootstrap_qwen_mtp_env.sh # 环境初始化
│ └── qwen_mtp_gguf_pipeline.py # 核心 pipeline
├── High-fidelity Dataset/ # 24 个精选数据集目录
├── guidePDF/ # 长篇 PDF 教程和技术报告
├── docs/ # 多语言文档(中英韩日)
└── codex-goals/ # Codex agent 任务模板
| 层级 | 技术选型 | 说明 |
|---|---|---|
| 训练框架 | Unsloth + PyTorch | Unsloth 提供 2-5x 加速和更低 VRAM 占用的 LoRA/QLoRA 训练 |
| 强化学习 | GRPO / GSPO | GRPO(Group Relative Policy Optimization)是 DeepSeek-R1 的核心技术;GSPO 是 Jackrong 提出的安全版 GRPO 变体 |
| 参数高效微调 | LoRA / QLoRA / PEFT | 降低微调门槛,9B 模型可在 6GB VRAM 内完成训练 |
| 量化工具 | llama.cpp | GGUF 格式导出与量化,支持 Q2_K 到 BF16 全系列 |
| 数据集格式 | HuggingFace Datasets | 标准化数据集格式,与 HF Hub 无缝集成 |
| 环境管理 | Python venv + shell bootstrap | qwen-mtp-gguf 提供自动化环境初始化脚本 |
优点:
局限:
2025-2026 年,LLM 微调正在经历从"少数专家专利"到"普通开发者可及"的转变。关键驱动因素有三:
Jackrong 的知识库正是这一趋势的产物——它不仅提供配方,还维护了一个持续更新的"最佳实践手册",让后来者不必重复踩坑。这个项目的 star 增长速度和模型的真实发布,都验证了社区对这类资源的强烈需求。
Jackrong LLM Fine-Tuning Guide 不是一个可部署的应用程序,而是一个面向 AI 开发者和爱好者的端到端微调知识库。它将 LLM 微调的全链路——数据准备、SFT 训练、强化学习(GRPO/GSPO)、GGUF 导出与量化——拆解成可独立运行的配方,配合保姆级文档和多语言支持。
对于想要学习或实践 LLM 微调的开发者,这是目前覆盖面最完整、更新最及时的开源资源之一;对于想要基于 Qwen 系列构建专属模型的团队,qwen-mtp-gguf 子项目提供了目前最完整的 MTP 保留 pipeline。