codefuse-devops-eval
业界首个工业级 DevOps/AIOps 领域大模型评测基准,含7486道DevOps题+2840个
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
业界首个工业级 DevOps/AIOps 领域大模型评测基准,含7486道DevOps题+2840个
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨三点,某大型互联网公司的 CI/CD 流水线突然断裂,值班工程师从睡梦中被PagerDuty的警报叫醒。传统方案是翻日志、查监控、逐层定位问题——平均耗时 45 分钟以上。而如今,越来越多的团队开始尝试用大语言模型(LLM)来自动化这一过程:让 AI 理解 DevOps 场景、判断告警根因、自动生成修复脚本。
但问题来了:这些"懂运维的 AI",到底有多懂?
DevOps-Eval 正是为回答这个问题而生——它是中国蚂蚁集团 CodeFuse 团队开源的业界首个工业级 DevOps/AIOps 领域大模型评测基准,填补了彼时该垂直领域缺乏系统性评测工具的空白。

图1:DevOps-Eval 项目标识
大模型评测一直是学术界和工业界共同关注的热点话题。然而,通用评测基准(如 MMLU、HellaSwag)无法有效衡量模型在垂直领域任务上的真实能力。对于 DevOps 这个高度专业化、对准确性要求极高的领域,现有的通用评测集更显得力不从心。
DevOps-Eval 的核心定位是提供一个系统化、可量化的评测框架,帮助开发者回答以下问题:
项目于 2023 年 10 月首次发布,随后持续迭代更新。截至最新版本,数据集规模已达到:7486 道多项选择题(DevOps 通用流程)+ 2840 个 AIOps 样本 + 1509 个 ToolLearning 样本,覆盖 59 个领域、239 种工具类型。
将 DevOps 全生命周期归纳为 8 大模块,每道题均为标准的多项选择题格式:
| 模块 | 描述 | 典型考察点 |
|---|---|---|
| Plan(计划) | 需求分析、任务拆解 | 用户故事拆分、迭代规划 |
| Code(编码) | 代码生成、代码补全 | 函数实现、算法选择 |
| Build(构建) | 持续集成、构建脚本 | Makefile、Dockerfile 编写 |
| Test(测试) | 单元测试、集成测试 | 测试用例设计、覆盖率 |
| Release(发布) | 版本管理、变更发布 | 语义化版本、Changelog |
| Deploy(部署) | 环境配置、灰度发布 | Helm Chart、滚动策略 |
| Operate(运维) | 故障处理、容量规划 | 告警分析、扩缩容决策 |
| Monitor(监控) | 指标分析、可观测性 | Grafana 看板、PromQL |
从评测结果来看,当前主流开源模型在该维度上仍有较大提升空间。以零样本(Zero-Shot)评测为例,即使是表现最好的 DevOpsPal-14B-Chat(78.23%),在 Plan 维度也仅能达到 60.61%,说明模型对复杂规划任务的推理能力仍然不足。
AIOps 是 DevOps 的智能化升级方向,DevOps-Eval 专门设计了以下五类 AIOps 评测任务:
这类任务的特点是:对准确率要求极高,错误答案可能直接导致生产故障误判。从评测结果看,主流模型在"时序异常检测"维度上表现普遍较差(多数低于 30%),说明模型对时序模式的学习仍不充分。
ToolLearning 是当下 Agent 系统的核心技术。DevOps-Eval 在 ToolLearning 评测上完全兼容 OpenAI Function Calling 格式,支持直接评估模型工具调用能力:
评测指标包括 FCCR(函数调用正确率)、FCFR(函数拒识率)、FCPPR(参数正确率)等,衡量的是模型在工具使用全链路上的准确性。
DevOps-Eval 的代码组织高度模块化,核心目录结构如下:
src/
├── models/ # 模型加载器(支持 Qwen、Baichuan、InternLM、OpenAI API)
├── datasets/ # 数据集加载(CSV/JSONL 格式,支持 HuggingFace)
├── evals/ # 评测器(多选题、函数调用、工具补全等)
├── context_builder/ # 上下文构建器(Base、QwenChat、Baichuan2Chat 等)
├── data/ # 数据预处理
├── metric/ # 评测指标计算
├── evaluate/ # 评测主流程
└── hparams/ # 命令行参数解析
架构设计亮点:
多模型统一接口:通过 ToolModel 基类 + ModelAndTokenizerLoader 工厂模式,兼容 HuggingFace Transformers 和 OpenAI API 两种推理方式,新增模型仅需实现对应 Loader 类。
多数据类型支持:评测数据集支持本地 CSV/JSONL 文件读取和 HuggingFace Datasets 远程加载,评测时通过 dataset_fp.json 配置映射。
灵活的上下文构建:针对不同模型架构(Qwen 的 ChatML、Baichuan 的对话模板等),提供差异化的 ContextBuilder 实现,确保模型输入格式正确。
Gradio Web UI:内置 Gradio 可视化界面,支持在线上传模型、选择评测数据集、查看评测结果排行榜,无需命令行操作。
核心技术栈:
模型支持列表:
| 模型 | Loader | ContextBuilder | 备注 |
|---|---|---|---|
| Qwen-7B/14B (Base/Chat) | QwenModelAndTokenizerLoader | QwenChatContextBuilder / ContextBuilder | 阿里通义千问 |
| Baichuan2-7B/13B (Base/Chat) | BaichuanModelAndTokenizerLoader | Baichuan2ChatContextBuilder | 百川智能 |
| InternLM-7B (Base/Chat) | ModelAndTokenizerLoader | InternlmChatContextBuilder | 上海 AI Lab |
| OpenAI API 模型 | OpenaiModel | - | 支持 GPT-4 等商业模型 |
git clone https://github.com/codefuse-ai/codefuse-devops-eval.git
cd codefuse-devops-eval
pip install -r requirements.txt
硬件需求(以评测 7B 模型为例):
评测数据集需从 HuggingFace 下载:
# HuggingFace 地址:https://huggingface.co/datasets/codefuse-admin/devopseval-exam
python src/run_eval.py \
--model_path path_to_model \
--model_name model_name_in_conf \
--model_conf_path conf/model_conf.json \
--eval_dataset_list all \
--eval_dataset_fp_conf_path conf/dataset_fp.json \
--eval_dataset_type test \
--data_path path_to_downloaded_devops_eval_data \
--k_shot 0
项目内置 Gradio 服务,启动后可在浏览器中可视化操作:
# (需自行在 src/ 下补充 Gradio 启动入口)
从零样本评测结果来看,当前开源模型在 DevOps 8 大维度中,Plan(计划) 维度平均得分最低(约 54-66%),而 Build(构建) 维度表现最好(约 77-86%)。这揭示了一个关键洞察:大模型在需要复杂推理和多步骤规划的场景中能力明显不足,但在结构化、模板化的任务(如写 Dockerfile、编写测试用例)上已经相当可靠。
AIOps 五类任务中,时序异常检测 是最难攻克的维度,主流模型得分普遍低于 30%。这与时序任务需要强因果推理能力密切相关,单纯的语言模型难以胜任高精度的数值预测。
在 Function Calling 评测中,Qwen-14B-Chat 在 LUBAN 数据集上达到了 61% 的正确率(FCCR),说明部分主流模型已初步具备工具调用能力。但参数层面的精确度仍有提升空间。
DevOps-Eval 的评测体系也存在一些局限:
选择题格式的固有限制:评测数据全部采用多项选择题格式,无法真实反映模型在开放性 DevOps 任务(如"帮我设计一个零停机发布方案")上的能力上限。
工具集覆盖有限:ToolLearning 数据集中工具类别虽有 239 种,但相比真实生产环境中的工具生态仍是沧海一粟。
评测环境与生产环境的差异:评测时模型加载的是精简过的数据集,而真实 DevOps 场景涉及大量上下文、团队协作和不确定性。
数据时效性:DevOps 领域的最佳实践和工具链更新较快,评测数据集需要持续迭代以保持相关性。
DevOps-Eval 的发布标志着大模型评测从"通用能力"向"垂直领域能力"迈出了关键一步。它不仅为 DevOps 领域提供了一个可量化的评测标准,更催生了一系列后续研究:
截至目前,该项目在 GitHub 上获得 656 颗星,数据集在 HuggingFace 上被多个研究团队引用。蚂蚁集团 CodeFuse 团队持续维护,并在 2023 年底新增了 ToolLearning 评测模块,评测维度进一步完善。
# 1. 克隆仓库
git clone https://github.com/codefuse-ai/codefuse-devops-eval.git
cd codefuse-devops-eval
# 2. 安装依赖
pip install -r requirements.txt
# 3. 下载评测数据集(HuggingFace)
# https://huggingface.co/datasets/codefuse-admin/devopseval-exam
# 4. 运行评测
bash scripts/run_eval_example.sh
如需使用 Gradio Web 界面,确保安装 gradio 后,在 Python 代码中导入并初始化界面即可。