Aiops-Learning-Resources
AIOps智能运维全栈资源库,覆盖时序异常检测、告警收敛、根因分析等13个方向
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AIOps智能运维全栈资源库,覆盖时序异常检测、告警收敛、根因分析等13个方向
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:某省级电信数据中心的监控大屏上,凌晨3点突然亮起2000条告警。值班运维工程师从睡梦中惊醒,面对密密麻麻的红色数字——硬盘故障、CPU飙高、内存泄漏、网络丢包、应用响应超时……每一条都可能关联,每一条都可能是根因。在传统的运维模式下,这意味着漫长的手工排查:翻日志、查配置、追踪调用链,运气好2小时定位,运气不好就通宵了。
这就是AIOps(Artificial Intelligence for IT Operations,智能运维)诞生的行业背景。随着互联网和云计算的规模扩张,现代数据中心的监控指标从几百个暴增到数十万个,任何单点故障都可能触发「告警风暴」。传统的阈值告警、规则引擎早已不堪重负,业界迫切需要用机器学习来自动发现异常、自动关联告警、自动定位根因。
LiaoWenzhe/Aiops-Learning-Resources 的作者毕业于后有幸加入全球领先的通信设备制造商,并与国内头部运营商深度合作。作为核心设计者,他为运营商大型数据中心设计过多套AIOps系统,涵盖时序分类、异常检测、关联分析、告警收敛、根因定位等核心模块。这个仓库正是作者将多年一线实战中收集、整理、验证过的论文、工具、博客、代码仓库按主题分类汇编而成的学习资源导航。

图1:作者建立的AIOps技术交流群,覆盖硅谷、新加坡、腾讯、阿里、浙江大学等地同行
这个仓库按照AIOps技术栈的逻辑顺序,分13个章节系统整理了各个方向的核心资源:
时序分类解决的是「这段曲线属于哪种模式」的问题——在运维场景中,这直接服务于模式识别和异常预判。仓库收录了十余篇顶会论文和工业实践,包括 k-Shape(基于形状距离的高效聚类)、ShapeNet(将Shapelet与神经网络结合)、DTP(动态时序池化)等经典算法。特别推荐的是针对疾病表型分析和入侵检测告警收敛的两篇论文——这两种场景的时序数据特征和运维场景高度相似,可直接迁移。
这是AIOps最核心的能力。仓库系统梳理了从经典算法(Isolation Forest、LOF、One-Class SVM)到深度学习时代(VAE、LSTM、时间Transformer)的演进路径。值得重点关注的是微软的 Time-Series Anomaly Detection Service 论文——这是业界少有的大规模生产系统实践,讲述了如何用 VAE 在 Azure 上每天处理数百万 KPI 的异常检测,服务级别达99.9%可用性。
告警收敛解决的是「一个根因故障触发100条告警,我只看1条」的问题。仓库收录了 Probabilistic Alert Correlation 和 CoFlux 等经典方法,前者用贝叶斯概率推断告警因果链,后者通过波动相关性跨维度关联KPIs。此外还推荐了 BigdataAi 仓库(作者的另一个关联项目)和知乎专栏的系统化讲解。
根因分析是AIOps的价值终点。仓库提供了从基于规则的方法到基于因果推断的深度学习方法的全景图。最新方向是将因果图(Causal Graph)与知识图谱结合,构建「故障传播图」,当故障发生时沿着因果边反向追溯,最短路径找到根因。
1. 极强的工业导向性
市面上大多数AIOps资料来自学术论文,理论扎实但落地困难。这个仓库的独特之处在于:作者以「能不能在生产环境用」为筛选标准,每个方向都优先推荐有工业实践验证的方法,避免纯理论论文的「屠龙之术」困境。
2. 全链路覆盖,不是单点罗列
从数据采集(时序处理)→ 模式识别(分类)→ 异常发现(检测)→ 告警聚合(收敛)→ 根因定位(分析)→ 趋势预测(预测),13个章节覆盖了AIOps的全生命周期,每个环节之间有逻辑衔接。
3. 中文友好,双语并行
仓库提供了完整的英文版(README.md)和简体中文版(README_zh-CN.md),方便不同语言背景的读者。中文版不是简单翻译,而是补充了更多本土化的实践案例。
4. 持续更新,与时俱进
从2021年12月创建至今,仓库持续更新(最后更新:2026年6月),随着新论文和新技术出现不断补充。Star/Fork比(214★/36 Fork)说明社区认可度高,资源质量经得起时间验证。
由于是纯 Markdown 资源仓库,没有任何需要安装运行的部分。直接在 GitHub 页面打开 README.md 即可开始浏览,按需跳转到各个主题章节。每一篇论文、每一个工具都有原始链接,可以直接访问arxiv、GitHub或知乎博客获取详细内容。
如果你是AIOps初学者,建议按仓库章节顺序阅读,配合知乎专栏的系统文章打好基础。如果你是已经有实践经验的工程师,可以直接跳到自己感兴趣的章节,用仓库作为论文/工具的索引字典。
需要客观指出,这个仓库也存在一些局限:1. 缺乏可直接运行的代码示例——仓库以论文/博客链接为主,没有配套的 Jupyter Notebook 或 Python 代码演示。2. 缺少云原生AIOps相关资源——随着 Kubernetes 和 Service Mesh 普及,云原生环境下的AIOps变得越来越重要,但仓库在这部分覆盖较少。3. 非开源代码库——这是一个资源导航仓库,核心贡献是领域知识和经验整理,而非可运行的代码。
AIOps在国内的落地仍处于早期阶段,大多数企业还在「有数据、缺智能」的状态。这个仓库的真正价值,在于它将学术前沿与工业实践之间的鸿沟用一线经验做了桥接——不是纸上谈兵的论文列表,而是经过生产验证的资源地图。对于AI爱好者,这是一个了解智能运维前沿的窗口;对于AI开发者,这是一个寻找方向、验证思路的知识索引。
数据来源:GitHub仓库 LiaoWenzhe/Aiops-Learning-Resources(214★,AGPL-3.0协议)
*项目链接:https://github.com/LiaoWenzhe/Aiops-Learning-Resources