apo
AI驱动的智能可观测性平台,LLM自动分析告警、根因定位,支持OpenTelemetry + eBP
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI驱动的智能可观测性平台,LLM自动分析告警、根因定位,支持OpenTelemetry + eBP
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨三点,值班工程师李明被一连串告警震醒:CPU 飙升、延迟激增、错误率破表。他打开 Grafana 逐个排查仪表盘,翻遍日志系统,最后花了两小时才定位到根源——某服务的数据库连接池泄漏。然而告警产生的那一刻,APO 已经通过 LLM 分析了告警上下文,锁定了真正的问题源,并在告警详情页直接给出了根因分析报告。
这不是未来想象,而是 APO(AutoPilot Observability) 正在实现的能力。
APO 由 CloudDetail 团队 开发,定位为新一代 AI 原生可观测性平台。可观测性(Observability)概念由 Control Theory 引入 IT 领域,核心是"通过外部输出推断内部状态"——日志(Logs)、追踪(Traces)、指标(Metrics)构成其三大支柱。
传统的可观测性工具(如 Prometheus + Grafana + Jaeger)擅长数据采集和可视化,但在告警分析领域存在明显短板:告警孤立、上下文缺失、需要人工经验串联因果关系。APO 的核心创新在于,将 LLM 引入分析链路,让 AI 具备"读懂"系统行为的能力。
项目采用 Apache-2.0 开源协议,GitHub 获星 380+,主要贡献者包括云观秋毫等核心技术成员。

图1:APO 内置的专家级故障排查工作流,可视化编排界面
APO 的 Agentic Workflows(智能体工作流)是其最具差异化的功能。用户通过低代码画布编排故障排查流程,将专家经验固化为可复用的自动化脚本。每个工作流由多个 Handler(处理器)组成,通过 GQL 查询或 API 调用获取数据,执行分析逻辑,最后输出结论。
内置的 Alert Events 模块预置了两个高价值工作流:

图2:APO 的 LLM-native 数据平面,打通可观测数据与 AI 分析的完整链路
传统可观测性平台的数据采集、存储、查询链路并非为 LLM 设计——数据碎片化、查询延迟高、格式不统一。APO 专门设计了 LLM-native 数据平面,在数据层原生支持向量化和语义化检索,使 LLM 能高效访问历史时序数据,无需二次 ETL。
APO 融合两条技术路线:
| 技术 | 作用 | 优势 |
|---|---|---|
| OpenTelemetry | 标准化的日志/追踪/指标采集 | 生态丰富,零侵入接入现有系统 |
| eBPF(Polaris) | 内核级因果推断采样 | 无需修改代码,捕获真实调用因果链 |
eBPF 模块通过 Beyla(Grafana 开源项目)实现 Go 应用的非侵入式追踪;通过 ilogtail(阿里云开源项目)采集故障现场日志;通过 Odigos 实现 Kubernetes 环境下的自动注入。

图3:APO 的工具选择界面,支持多种可观测数据源的接入
APO 后端采用 Go 1.23 开发,遵循 Controller/Service/Repository 分层模式,代码组织在 backend/ 目录下:
api/ — HTTP Handler 层,负责请求解析和响应序列化,使用 Gin Web 框架(github.com/gin-gonic/gin v1.9.1)services/ — 业务逻辑层,定义核心服务接口repository/ — 数据访问层,支持 ClickHouse(分析存储)、MySQL(配置)、PostgreSQL(配置)、Prometheus(时序数据)四种数据源pkg/core/ — 核心上下文管理和静态资源pkg/receiver/ — 告警接收器,支持钉钉(自定义加签)等通知渠道cmd/handlergen/ — 代码生成工具,自动生成 Handler 骨架代码middleware/ — JWT 认证、日志、限流等中间件核心依赖包括:ClickHouse 驱动(clickhouse-go/v2)、Prometheus 客户端(prometheus/client_golang)、JWT 认证(jwt-go/v4)、配置管理(spf13/viper)。
前端采用 React 18 + TypeScript,技术栈丰富:
前后端各自独立部署,通过 RESTful API 通信。

图4:APO 品牌标识
对于首次体验,推荐使用 K8s 部署路径:项目提供了 backend/deploy/apo-backend-deploy.yml 和 frontend/apo-front-deploy.yml,配合 Grafana 的 K8s 部署配置,可以较完整地部署全栈。单机体验可分别构建前后端镜像,配置 ClickHouse 和 MySQL 即可运行基础功能。
APO 代表了可观测性领域的一个重要趋势:从被动监控到主动分析的范式转变。随着微服务架构和云原生技术的普及,系统复杂度呈指数级增长,人工排查故障的成本越来越高。APO 通过 LLM 将专家经验自动化,为这一挑战提供了可行方案。
GitHub 380+ stars、54 forks 的社区关注度,以及 topics 中涵盖的 APM、eBPF、OpenTelemetry、Observability 等热词,表明该项目正处于可观测性 + AI 交叉的热门赛道,未来增长潜力值得持续关注。