deepeval
开源 LLM 评测框架,47种指标+23个基准+11种框架集成,系统化评估AI模型质量
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源 LLM 评测框架,47种指标+23个基准+11种框架集成,系统化评估AI模型质量
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:DeepEval 项目标识
想象一下,你是一位工厂质检员,而 LLM(大型语言模型)就是流水线上的产品。传统做法是人工抽检——抽几张试卷打分,效率低、主观性强。DeepEval 的出现,就像给工厂装上了一套自动化的质检仪器:它定义了 47 种「检测指标」,从答案是否准确、是否有幻觉、内容是否相关等多个维度,对 AI 模型的表现进行系统化、可量化的评估。
2023 年 ChatGPT 爆火之后,AI 应用开发者面临一个核心痛点:模型越来越多,从 GPT-4 到 Claude、从 Llama 到国产大模型,如何客观评价哪个模型更适合自己?靠人工对话打分既不科学也难以规模化。
DeepEval 由新加坡 AI 公司 Confident AI 主导开发,核心作者 Jeffrey Ip(@penguine-ip)贡献了超过 4300 次提交。公司同期推出商业产品 DeepCheck,但 DeepEval 始终保持开源。框架于 2023 年中开源,经历近 3 年迭代,目前 v4.0 版本主打「Coding Agent 评测能力」。截至 2026 年 5 月,项目累计获得 15,700+ Stars,成为 LLM 评测领域最受欢迎的开源工具之一。
GitHub Trends Shift 数据显示 DeepEval 在 AI 工具类项目中排名靠前,超过了大多数同类评测框架。
DeepEval 的核心价值在于其指标体系。项目内置 47 种评测指标,覆盖以下维度:
G-Eval 是 DeepEval 最具特色的评估方法,通过 LLM 自身来评估 LLM 的输出质量。用户只需定义评分维度和标准,框架自动生成 Chain-of-Thought 推理链,驱动 LLM 打分。相比传统规则匹配,G-Eval 能处理开放性、主观性强的评测任务,在学术和工业场景均广泛引用。
DeepEval 的代码库采用模块化插件架构,核心目录结构如下:
| 目录 | 功能 |
|---|---|
deepeval/metrics/ | 47 种评测指标实现(196 个文件) |
deepeval/benchmarks/ | 23 个标准学术基准测试 |
deepeval/evaluate/ | 核心评测引擎(evaluate、assert_test) |
deepeval/test_case/ | 测试用例定义(LLMTestCase、ConversationalTestCase) |
deepeval/tracing/ | 分布式追踪(类 OpenTelemetry 设计) |
deepeval/integrations/ | 11 种外部框架集成 |
deepeval/plugins/ | pytest 插件集成 |
deepeval/cli/ | Typer CLI 工具 |
项目基于 Poetry 管理依赖,核心依赖包括:
框架支持多 LLM 后端:OpenAI(GPT-4/4o)、Anthropic(Claude)、Google Gemini、Azure OpenAI、本地模型(Ollama)。
开箱即用的基准测试覆盖:MMLU(通识知识)、GSM8K(数学)、HellaSwag(常识推理)、HumanEval(代码能力)、TruthfulQA(真实性)、BBQ(偏见)、Winogrande(消歧)、DROP(阅读理解)等主流评测集。
DeepEval 提供了与主流 AI 框架的深度集成,降低接入成本:
| 集成框架 | 说明 |
|---|---|
| LangChain | 支持 LangChain Expression Language (LCEL) 链的自动追踪 |
| LlamaIndex | RAG 管道的端到端评测 |
| HuggingFace | Transformers 模型评测 |
| CrewAI | 多 Agent 协作任务评测 |
| PydanticAI | 结构化输出验证 |
| Google ADK | Google Agent Development Kit 集成 |
| OpenInference | OpenTelemetry 追踪标准兼容 |
这种广泛的集成能力,使 DeepEval 能够覆盖绝大多数 AI 应用开发场景,从简单的 RAG 问答到复杂的多 Agent 协作系统。
from deepeval import evaluate
from deepeval.metrics import HallucinationMetric, AnswerRelevancyMetric
from deepeval.test_case import LLMTestCase
test_case = LLMTestCase(
input="What is RAG?",
actual_output="RAG is a technique...",
retrieval_context=["Document about RAG..."]
)
evaluate(
test_cases=[test_case],
metrics=[
HallucinationMetric(threshold=0.3),
AnswerRelevancyMetric(threshold=0.5)
]
)
框架注册为 pytest 插件,支持直接用 assert_test 语法:
import deepeval
from deepeval.metrics import FactualConsistencyMetric
from deepeval.test_case import LLMTestCaseParams
@deepeval.assertiveness()
def test_rag_pipeline():
test_case = LLMTestCase(input='...', actual_output='...')
deepeval.assert_test(test_case, metrics=[FactualConsistencyMetric()])
pytest 集成让 LLM 评测可以无缝接入 CI/CD 流水线,实现每次代码提交后自动运行 AI 质量回归测试。
通过 deepeval 命令行工具快速运行评测:
pip install deepeval
deepeval test run --model gpt-4o
DeepEval 解决了 AI 开发领域的三个核心问题:
DeepEval 从 2023 年中开源到 2026 年 5 月,Stars 从 0 增长到 15,700+,保持了稳定增长态势。其增长曲线与 LLM 应用开发热潮高度同步:RAG 技术爆发期(2023 Q4)和 AI Agent 爆发期(2024 Q2)均带来明显的 Stars 增长。
v4.0 版本的 Coding Agent 评测能力是最新方向,聚焦 AI 编程助手质量评估,契合 2026 年 AI 代码助手市场的火热。

图2:DeepEval GitHub 仓库概览
DeepEval 是当前最完整的开源 LLM 评测框架之一,以 47 种指标 + 23 个基准测试 + 11 种框架集成 构建了覆盖基础质量、安全合规、任务完成、多轮对话等多维度的评测体系。框架通过 Python API、pytest 插件和 CLI 三种方式使用,可深度嵌入 CI/CD 流水线。尽管 G-Eval 的自我评测存在争议,但其工业实用性已在数千个 AI 项目中得到验证,是 AI 应用开发者不可或缺的「质检工具箱」。