Kiln
AI全流程开发工作台:评估、优化、Prompt、RAG、微调、合成数据、Agent一站搞定
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI全流程开发工作台:评估、优化、Prompt、RAG、微调、合成数据、Agent一站搞定
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你的团队刚刚更新了大模型的提示词(Prompt),产品经理说"感觉回答变啰嗦了",QA 反馈"某些边界情况答非所问",而你完全不知道是哪一次改动导致的回归——传统的 AI 开发就像在黑箱里迭代,缺乏系统化的评估和追踪。
Kiln AI 正是为解决这个问题而生的。它不是又一个模型 API 封装库,而是一套覆盖 AI 开发全生命周期的本地优先工作台:从评测(Evals)到提示词优化,从 RAG 构建到微调,从合成数据生成到多 Agent 编排,全部围绕同一个数据集展开,让每一次改动都有客观的量化依据。
目前市面上的 AI 开发工具大多只能解决单一环节的问题:LangChain 擅长编排,但缺少评测;OpenAI Evals 专注评测,但无法优化;各类 RAG 框架能建检索,但评估效果靠人工。团队在实际生产中往往需要同时维护 5-6 种工具,数据格式不统一,改动一处要手动同步到所有环节,效率极低。
Kiln 的创始团队(来自 Chesterfield Laboratories)洞察到这一痛点,提出了"All in one workbench"的理念:定义一个任务(Task)和一份数据集,让它流经所有环节——评测、优化、微调、RAG、Agent——每个步骤的结果相互叠加、互相验证,而非各自为战。
项目的 GitHub 页面显示,该仓库目前获得约 4856 颗星,Python 代码主导(libs/core 为 MIT 许可证的核心库),拥有活跃的 Discord 社区和完整的文档体系。
Kiln 采用了清晰的三层架构:
第一层:Python 核心库(libs/core,MIT 许可证)
这是整个项目最重要的部分,提供了所有底层能力,通过 pip install kiln-ai 即可独立使用。核心依赖包括:
第二层:FastAPI 服务层(libs/server,MIT 许可证)
提供 REST API 接口,将核心库的能力暴露为网络服务,供桌面应用和第三方集成调用。支持 OpenAPI 自动生成、 WebSocket 通信和身份验证。
第三层:桌面应用(app/desktop,源码可用)
基于 PyInstaller 打包的跨平台桌面应用(macOS/Windows/Linux),内置 Web UI(Svelte + Vite + Tailwind CSS),提供图形化操作界面。团队成员无需写代码,也能通过界面参与评测、标注和优化工作。
Kiln 的评测系统是其最核心的差异化功能。与传统的"人工打分"不同,Kiln 支持三种自动化评测路径:
评测结果以结构化数据存储,支持时间维度对比,可以直观看到每次 Prompt 调整或模型升级带来的质量变化。
这是 Kiln 最具野心的功能。当传统工程师还在手工尝试各种 Prompt 变体时,Kiln 的 Auto-Optimize 可以:
本质上,这是一个超参数搜索(Hyperparameter Search)引擎,但搜索空间扩展到了自然语言层面。
Kiln 内置了零代码微调能力,通过与 Together AI、Fireworks AI、Vertex AI 的 API 集成,可以直接在这些平台上发起微调任务。流程是:选定数据集 → 选择基础模型 → 配置训练参数 → 自动提交任务 → 获取微调后的模型 ID 并注册到 Kiln 的模型库中。
微调后产生的模型可以在同一评测框架下与原始模型对比,量化微调带来的提升。
Kiln 支持构建多级 Agent 层级:主 Agent 可以调用子 Agent,每个子 Agent 运行在独立的上下文中。子 Agent 可以是专门负责代码审查、数据分析或信息检索的专家。这种设计比单一 Agent 更具可维护性,也更容易隔离不同能力域的输出。
Kiln 强调"本地优先"的设计哲学:所有数据(任务定义、数据集、评测结果)都存储在本地(.kiln 项目目录中),不强制上传到云端。团队协作通过 Git 进行同步——这意味着 Kiln 可以复用已有的 Git 工作流(分支、PR、代码审查),对于已经用 Git 管理代码的团队来说,几乎没有额外学习成本。
如果需要调用模型,可以选择:
从代码仓库来看,Kiln 的工程水准相当扎实:
slow、paid、ollama 等测试标记,CI 持续运行客观来说,Kiln 也有其局限性:
Kiln 代表了 AI 开发工具的一个重要趋势:从"能用就行"到"系统化生产"的转变。随着大模型能力的普遍提升,AI 产品的竞争焦点正在从"模型能力"转向"评测优化能力"——谁能更快地发现回归、更高效地迭代 Prompt、更高质量地准备训练数据,谁就能在产品层面建立优势。
从 GitHub 数据来看,Kiln 在 2024-2025 年间增长迅速,topics 标签覆盖了 AI、evals、fine-tuning、RLHF、synthetic-data 等多个热门方向,表明其定位精准踩中了 AI 开发者社区的核心需求。文档站和博客(kiln.tech/blog)持续输出内容,社区活跃度较高,是近期值得关注的开源 AI 工具项目。