easy-dataset
本地化文档转 LLM 微调数据集工具,PDF/Markdown 一键生成问答对
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
本地化文档转 LLM 微调数据集工具,PDF/Markdown 一键生成问答对
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景: 你是一名医疗领域的 AI 开发者,想要微调一个专业医学问答模型。你手头有一堆 PDF 医学文献、临床指南和问答记录——但把它们变成可用于训练的高质量数据集,需要写爬虫、处理格式、编写 Prompt 工程、反复调参……光是数据预处理就要耗费数周时间。
Easy Dataset 就是来解决这个痛点的。 这款由开源开发者 ConardLi 打造的工具,将 LLM 数据集制作的整个流程——文档解析、文本分割、智能问答生成、答案构建、数据清洗、质量评估——全部浓缩进一个本地可运行的图形界面中。你不需要写一行代码,就能把散落的 PDF 和 Markdown 文件,变成可以直接喂给 LLaMA Factory 或 HuggingFace 的微调数据集。
Easy Dataset 的核心理念是**「所见即所得」**。整个数据集制作流程被拆解为四个步骤,每一步都在 Web 界面中可视化呈现,用户可以随时预览、修改、跳过任何环节。
第一步:文档上传与解析。 支持 PDF、Markdown、DOCX、TXT、EPUB 等主流格式。工具会自动识别文档结构,包括标题层级、段落分隔、代码块和表格。解析完成后,用户可以在界面上直观看到分块结果,并手动调整切分位置和粒度。
第二步:智能问答生成。 这是 Easy Dataset 最核心的能力。工具内置了多种问答生成策略:基于 Markdown 结构的语义切分、固定长度切分、递归分隔符切分、以及针对代码的专用切分算法。用户选择一个或多个文本块,工具会调用配置的 LLM API(支持 OpenAI、MiniMax、Ollama、智谱、硅基流动、OpenRouter 等)批量生成相关问题。生成时支持自定义 Prompt 模板,比如指定生成「单选/多选/简答」不同类型的题目,或者要求生成带有思维链(COT)的答案。
第三步:答案构建与增强。 生成问题后,工具会再次调用 LLM API 为每个问题生成完整答案,支持 Chain of Thought 推理链。此外还提供数据清洗(去噪声、标准化格式)、数据增强(GA Pair 生成)和标签树自动构建功能。标签树能根据文档结构智能分类数据,便于后续导出时做类别均衡。
第四步:数据集导出与部署。 导出格式支持 Alpaca、ShareGPT、多语言思维格式,文件类型可选 JSON 或 JSONL。工具还提供一键 LLaMA Factory 配置生成和直接上传 HuggingFace Hub的功能——这意味着你生成的微调数据可以零成本地进入训练流水线。

图1:Easy Dataset 核心功能模块
2025 年 7 月发布的 v1.7.0 带来了重磅新功能——模型评估系统,将工具从单纯的数据生成扩展到了模型性能验证的完整闭环。
评估系统支持五种题型:判断题、单项选择、多项选择、简答题和开放性问题。用户可以基于自己的垂直领域文档生成评估题库,然后选择 Judge Model(如 GPT-4o、Claude 等)自动评估目标模型的答案质量,并自定义评分规则。这解决了模型评估中「谁来打分」的核心难题。
更独特的是内置的**Human Blind Test(模型竞技场)**功能,采用双盲对比机制,让两个模型在相同问题上作答,由人类评审(或 AI 评审)判断优劣。这一机制可以用于:微调前后模型性能对比、同一任务不同模型的横向评测、以及 RAG 系统召回率评估。这个功能直接对标了 Chatbot Arena 的方法论,但完全运行在本地文档域上。
从代码结构看,Easy Dataset 采用了务实高效的技术栈:前端基于 Next.js 14(App Router),配合 Material-UI 提供现代化 UI;后端复用 Next.js API Routes,以 Prisma ORM + SQLite 作为数据持久层,兼顾开发效率和本地部署的轻量化需求。
模型集成层采用了 @ai-sdk/openai 和 @ai-sdk/openai-compatible,能够兼容所有遵循 OpenAI 接口规范的 LLM 服务商。同时集成了 HuggingFace Hub SDK 用于数据集直接上传,以及 Ollama 支持本地模型调用,兼顾了云端 API 和本地部署两种场景。
整个项目约 14.3k Stars,属于高质量人气项目。作者 ConardLi 持续维护,文档支持中英文双语,另有土耳其语贡献版本。许可证为 AGPL-3.0,开源程度较高。
Easy Dataset 提供了最友好的部署体验。官方维护 Docker 镜像(ghcr.io/conardli/easy-dataset),并配有标准化 docker-compose.yml,一条命令即可启动完整服务:
git clone https://github.com/ConardLi/easy-dataset.git
cd easy-dataset
docker-compose up -d
# 访问 http://localhost:1717
Dockerfile 采用多阶段构建(node:20-alpine 基础镜像),分 builder 和 runner 两个阶段,最终镜像只包含生产依赖,体积精简。另有 Electron 桌面客户端,支持 Windows、macOS、Linux 三平台原生安装包,适合不想运行 Docker 的用户。
硬件需求极低:无需 GPU,2GB 内存、2GB 磁盘即可运行。初次部署预计耗时不超过 2 分钟。

图2:Easy Dataset 系统架构
值得客观提及的是:工具依赖 LLM API 生成问答数据,生成质量直接受限于底层模型能力。使用 GPT-4o 和使用 GPT-3.5-turbo 生成的数据集质量差异可能很大。另外,数据集质量评估虽然引入了 Judge Model 机制,但 AI 评审本身也存在偏差,重要场景仍建议配合人工审核。
此外,AGPL-3.0 许可证要求衍生作品开源,若在商业产品中使用需注意合规。
Easy Dataset 是 LLM 数据工程领域的一把「瑞士军刀」——它把从原始文档到训练数据集之间最繁琐的环节全部自动化,并辅以评估系统形成完整闭环。对于没有 ML 工程团队但有高质量领域数据的个人开发者和中小企业来说,这款工具显著降低了微调数据的制作门槛。工具本身的工程完成度很高(Web UI、桌面端、Docker 多渠道部署),且有持续活跃的社区维护。