aikit
一行命令本地部署开源 LLM 推理服务,同时获得 OpenAI API 兼容接口
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一行命令本地部署开源 LLM 推理服务,同时获得 OpenAI API 兼容接口
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
过去两年,开源大语言模型(LLM)井喷式发展——LLaMA、Mistral、Gemma、Qwen、Phi……模型权重随手可下,但真正跑起来却让人头疼:环境依赖复杂、GPU 驱动难配、推理性能调优门槛高、团队协作时模型分发没有统一标准。AIKit 正是为了解决这「最后一公里」而生的平台。
AIKit 由 Kaito Project 团队开发,是一个专注于开源 LLM 微调(Fine-Tuning)和部署(Inference)的全栈工具链。它最大的特点是:开箱即用,一行命令在本地启动 GPT-4 级别的对话界面,同时获得 OpenAI API 兼容接口,可以直接替换现有应用中的 GPT-4 调用,无需修改任何业务代码。
从源码结构看,AIKit 的设计遵循了云原生经典思路——BuildKit 前端 + 可插拔后端:
cmd/frontend/main.go 是整个系统的入口,通过 grpcclient.RunFromEnvironment 将 BuildKit 作为构建框架,调用 build.Build 作为主逻辑。BuildKit 是 Docker/Moby 生态中最成熟的容器镜像构建引擎,具备并行构建、增量缓存、远程构建等特性,AIKit 巧妙地把它从「构建镜像」扩展到「构建模型推理环境」。
pkg/aikit2llb/inference/ 是推理后端的核心模块,支持多种推理引擎:
pkg/packager/ 负责模型打包,核心能力是 OCI Artifacts 打包(支持 CNCF ModelPack 规范),这意味着模型可以像 Docker 镜像一样发布到任意 OCI 兼容 Registry(GHCR、阿里云、Harbor 等),实现模型的版本化管理与分发。
pkg/finetune/ 是微调模块,通过 Unsloth 实现高效微调。Unsloth 是目前公认最节省显存的 LoRA/QLoRA 微调框架,相比传统方案可提速 2-5 倍、显存占用减少 50%+。
1. Inference(推理部署)
只需一条命令即可在本地启动完整的推理服务:
docker run -d --rm -p 8080:8080 ghcr.io/kaito-project/aikit/llama3.1:8b
访问 http://localhost:8080/chat 即可打开 Web UI,同时 http://localhost:8080/v1/chat/completions 暴露 OpenAI 兼容 API。预置镜像包括 Llama 3.1 8B/70B、Gemma、Mistral、Mixtral、Phi、Qwen 等主流开源模型,还支持多模态模型(Llava)和图像生成(Flux)。
2. Fine-Tuning(微调)
通过 aikitfile.yaml 声明式配置文件定义微调任务,AIKit 会自动拉取模型、配置 Unsloth 环境、执行微调、导出模型。一套配置覆盖数据准备、训练参数、输出格式全流程。
3. OCI Packaging(分发)
将微调后的模型打包为 OCI Artifacts,可推送到任意 Registry,团队成员拉取时只需 docker pull,实现了模型的「镜像化」管理,彻底告别 U 盘传来传去的原始时代。
AIKit 提供多架构镜像构建(AMD64 + ARM64),以及专门的 Apple Silicon 镜像(Dockerfile.base-applesilicon)。
Helm Chart(charts/aikit/)提供了生产级 Kubernetes 部署配置:HPA 自动扩缩容、PodSecurityPolicy、ServiceMonitor、PriorityClass 等生产要素一应俱全。默认配置 8GB 内存即可运行 CPU 推理,GPU 推理时通过 nvidia.com/gpu 标签自动调度。
Dockerfile 采用多阶段构建:Go 编译器构建阶段 + scratch 运行时,最终产出极简静态二进制镜像,减小攻击面。镜像内置 CA 证书,无网络环境也可用。
Runner 配置(runners/ 目录)提供了 4 种预置推理配置:
llama-cpp-cpu.yaml:纯 CPU 运行,适合没有 GPU 的机器llama-cpp-cuda.yaml:NVIDIA GPU 加速llama-cpp-rocm.yaml:AMD ROCm GPU 加速vllm-cuda.yaml:高吞吐 vLLM 推理diffusers-cuda.yaml:图像生成推理项目遵循安全最佳实践:SBOM(软件物料清单)、Provenance 证明(镜像来源可追溯)、镜像签名,所有镜像标签与源码 commit 绑定,确保生产环境可审计。
| 维度 | 详情 |
|---|---|
| 编程语言 | Go 1.26(核心引擎)、Python(微调/Unsloth)、TypeScript/React(Web UI) |
| 核心技术栈 | BuildKit、Moby、LocalAI、vLLM、Unsloth、gRPC |
| 支持的模型格式 | GGUF、GGML、HuggingFace Safetensors、Diffusers |
| 部署方式 | Docker 单机 / Kubernetes Helm / Podman / BuildKit remote |
| 多模态 | 支持 Llava 等视觉模型、Flux 等图像生成模型 |
| GPU 支持 | NVIDIA CUDA、AMD ROCm、Apple Silicon |
| API 兼容性 | OpenAI API(v1/chat/completions)完全兼容 |
| 许可证 | MIT |
AIKit 的出现代表了开源 LLM 部署工具的一个成熟方向——以 OCI 标准统一模型分发 + 以声明式配置简化部署复杂度。它不只是一个脚本工具,而是一套完整的 MLOps 工作流:从模型获取、推理优化、微调训练到生产部署,覆盖了 AI 应用落地的全生命周期。在开源 LLM 工具生态中,它填补了「微调-部署-分发」闭环的空白。
数据来源:GitHub(kaito-project/aikit)、BuildKit 官方文档、LocalAI 官方文档、Unsloth 官方文档