kubeai
Kubernetes 上的 AI 推理运维平台,Helm 一键部署,支持 vLLM/Ollama/F
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Kubernetes 上的 AI 推理运维平台,Helm 一键部署,支持 vLLM/Ollama/F
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在生产环境中跑 AI 模型,从来不是一件简单的事。当你想在 Kubernetes 集群里部署一个大语言模型,需要面对 Pod 管理、资源配额、模型下载挂载、GPU 调度、弹性伸缩等一系列复杂的运维挑战。KubeAI 正是为了解决这些痛点而生的——它是一个专为 Kubernetes 设计的 AI 推理运维Operator,目标是把"在 K8s 里跑 AI 模型"这件事做到像安装一个 Helm Chart 一样简单。

图1:KubeAI 系统架构,包含 Model Proxy(模型代理)和 Model Operator(模型运维控制器)两大核心组件
传统 Kubernetes 的 Service 负载均衡(kube-proxy)对于 vLLM 等有状态的推理引擎并不友好。vLLM 的性能高度依赖 KV Cache 的状态,随机的负载分配会导致 KV Cache 命中率极低,TTFT(Time To First Token)严重退化。KubeAI 团队专门发表了 一篇论文 深入分析这一问题,并在 KubeAI 中实现了前缀感知负载均衡策略,显著提升了大规模推理的系统吞吐量。
此外,传统方案往往依赖 Istio(服务网格)、Knative(Serverless 伸缩)等外部系统,导致部署复杂、组件间版本不兼容,Day-2 运维负担沉重。KubeAI 的核心理念是"零依赖"——不需要 Istio、不需要 Knative,裸 K8s 即可运行。
KubeAI 由两大核心子系统组成:
1. Model Proxy(模型代理)——提供 OpenAI 兼容的 HTTP API。客户端无需任何改造,即可用 OpenAI 的 SDK 直接调用。代理层实现了:前缀感知负载均衡(优化 KV Cache 利用率)、请求排队(配合零扩容场景)、后端故障自动重试。同时支持 /v1/chat/completions、/v1/completions、/v1/embeddings、/v1/rerank、/v1/audio/transcriptions 等多个端点,真正做到了 OpenAI API 的平滑替代。
2. Model Operator(模型运维控制器)——基于 Kubernetes CRD 自动化管理推理引擎 Pod。Model Operator 自动处理模型下载(支持 EFS 等分布式存储)、存储卷挂载、动态 LoRA Adapter 编排,以及 Pod 的生命周期管理。开发者只需声明式地定义一个 Model CR,Operator 就会自动完成剩余工作。
engine 字段自由切换。
图2:KubeAI 与 LangTrace 可观测性工具集成,提供完整的推理链路追踪
KubeAI 主体采用 Go 语言 开发,充分利用了 Go 在云原生领域的生态优势。项目代码结构清晰:
| 模块 | 职责 |
|---|---|
api/k8s/v1 | Kubernetes CRD 定义(Model、ModelVersion 等) |
api/openai/v1 | OpenAI 兼容 API 的 Protobuf/gRPC 定义 |
internal/modelproxy | 模型代理层:负载均衡、请求路由、OpenAI API 适配 |
internal/modelcontroller | 模型控制器:Pod 管理、生命周期协调 |
internal/modelautoscaler | 弹性伸缩逻辑:HPA 指标收集、扩缩容决策 |
internal/loadbalancer | 前缀感知负载均衡算法实现 |
internal/openaiserver | OpenAI API 服务器实现 |
internal/vllmclient | vLLM 引擎的 Go 客户端封装 |
internal/modelclient | Ollama 等其他推理引擎的通用客户端抽象 |
internal/metrics | Prometheus 指标导出(推理延迟、吞吐、GPU 利用率等) |
internal/messenger | Kafka / PubSub 消息队列集成 |
components/model-loader | 模型下载与加载的 sidecar 容器 |
Helm Chart 部署架构中默认捆绑了 Open WebUI(类 ChatGPT 的 Web 界面),可通过 helm install kubeai kubeai/kubeai 一键拉起完整推理平台。
kind create cluster # 或 minikube start
helm repo add kubeai https://www.kubeai.org && helm repo update
helm install kubeai kubeai/kubeai --wait --timeout 10m
# 再装几个预置模型
helm install kubeai-models kubeai/models -f kubeai-models.yaml
kubectl port-forward svc/open-webui 8000:80
# 浏览器打开 localhost:8000,选择 Deepseek-R1 1.5B 开始对话
整个过程不需要写 YAML、不需要理解 vLLM 参数、不需要配置 Istio。这正是 KubeAI 的核心价值所在——让 AI 推理的运维复杂度降到最低。
KubeAI 代表了一个重要趋势:AI 推理正在从"手动部署脚本"走向"Kubernetes 声明式运维"。随着 vLLM、TGI 等推理引擎的成熟,将 AI 模型纳入云原生体系管理成为必然需求。KubeAI 通过 CRD + Operator 模式,把 AI 推理的运维最佳实践固化下来,减少了每家公司重复造轮子的工作。
从 GitHub Star 增长曲线看,项目正处于高速增长期,已获得 Google Cloud 官方背书为边缘推理参考架构,标志着其在企业级场景的认可度正在快速提升。
图3:KubeAI Star 增长曲线(Star History 提供)