Awesome-LLM-Eval
收录200+ LLM评测基准与工具,为AI开发者提供全面的评测资源导航
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
收录200+ LLM评测基准与工具,为AI开发者提供全面的评测资源导航
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,每年高考结束后,全国人民都在讨论分数线、各省状元的成绩、哪所大学最难考。但你有没有想过——如果把大模型(LLM)当作参加高考的学生,那谁来出题?谁来阅卷?谁来排名?
这正是 Awesome-LLM-Eval 试图回答的问题。
在 2025 年的 AI 领域,大模型的能力已经从"能对话"进化到了"能写代码、能做数学证明、能分析医学报告"。然而,模型越来越多,评测标准却越来越碎片化——每家厂商都说自己最强,但裁判标准各不相同。这就像一场没有统一裁判的运动会,选手们各说各话,观众无从判断谁真正更强。
Awesome-LLM-Eval 正是在这样的背景下诞生并快速成长。它由研究者 Jun Wang(王俊)、Ninglun Gu(顾宁伦)等来自国内多所高校的学者发起,收录了从通用评测基准到垂直领域测试、从代码能力到多模态理解的全链路评测资源。截至目前,该项目已在 GitHub 获得超过 640 颗星,76 次 Fork,并配套发布了论文 Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap(arXiv:2508.18646),系统性地提出了"以人为中心"的 LLM 评测路线图。
传统的模型评测方式,类似于学校里的闭卷考试——给模型出一道数学题,看它答对几道。这种方式简单直接,但存在两个根本性局限。
第一,题目本身可能有问题。 如果考题太简单,所有模型都能接近满分,那评测就失去了区分度;如果考题泄露了训练数据(数据污染),模型可能在"背答案"而非真正理解。这就是为什么在 MMLU 等基准上,许多模型得分接近人类专家水平,但实际使用体验却相差甚远。
第二,评测维度过于单一。 一道数学题无法衡量模型在法律咨询、创意写作、多语言翻译方面的表现。一个在代码生成上拿了 90 分的模型,可能在回答"如何安慰一个失恋的朋友"时完全答非所问。人类智能是多维的,AI 评测理应如此。
Awesome-LLM-Eval 的核心理念正是针对这两个问题:它将评测任务按照人类能力类比的方式进行分类,形成一张有结构的导航图。
该项目提出的核心框架,将 LLM 评测与人类发展路径相对应:
这种类比框架的价值在于:它让评测不再只是冷冰冰的分数,而是具有了可解释性——当一个模型在 Agent 评测中得分较低时,开发者可以类比"这个阶段的人类需要培养哪些能力",有针对性地进行优化。

图1:LLM 评测框架示意图——展示了从通用基础能力到专业化任务的全谱系评测路径
Awesome-LLM-Eval 的内容组织得非常系统,主要分为以下几大模块:
收录了主流的 LLM 评测框架和工具:
对于 AI 爱好者来说,lm-evaluation-harness 是最容易上手的工具——它只需要几行命令,就能对一个 HuggingFace 模型进行 MMLU、HellaSwag 等主流基准的评测,并在终端输出清晰的分数报告。对于开发者而言,OpenCompass 提供了更丰富的中国本地化评测场景(如中文理解、中华文化知识等),是国产模型评测的重要参考。
这是项目的核心,涵盖了几乎所有主流评测方向。通用评测基准包括 MMLU(大规模多任务语言理解)、BigBench(Google 的综合评测套件)、SuperGLUE(自然语言理解的标准测试床)等。这些基准的共同特点是覆盖面广,但深度有限,通常用于快速评估模型的"综合水平"。
代码能力评测是近年来最火热的垂直领域之一。项目收录了 HumanEval(OpenAI 开创的代码评测标准)、MBPP(Google 的编程基础测试)、APPS(来自编程竞赛的难题)、CodeXGLUE(微软的全代码任务套件)以及 EvoCodeBench(北大开发的动态演进型代码基准)。其中 EvoCodeBench 的设计尤为值得关注——它随时间自动更新题目,避免了传统静态基准的数据污染问题。
长上下文评测是 2025 年大模型军备竞赛的关键战场。项目收录了 InfiniteBench、RULER、Needle in a Haystack 等专门测试模型在百万级 token 上下文中精准定位信息的能力。
Agent 能力评测则将评测从"做题"升级为"做事"——模型需要操控浏览器、操作系统或数据库完成真实任务。WebArena、AgentBench、FlowBench 等基准代表了这一方向的前沿。
多模态与跨模态评测收录了涉及图像理解、视频分析、音频识别的基准,如 MMMU、MathVista、Video-MME 等。RAG 评测则专门测试检索增强生成系统的性能,覆盖了检索精度、上下文利用率、答案忠实度等多个维度。

图2:LLM 评测路线图 2025——按人类认知发展路径组织的评测分类体系
Awesome-LLM-Eval 收录了多个在线体验入口,让用户无需本地部署即可感受不同模型的评测表现。HuggingFace Open LLM Leaderboard 基于 MMLU、ARC 等 6 个基准的模型排名;LMSYS Chatbot Arena 通过人类众包投票的 ELO 排名;OpenCompass 2.0 则是中国模型的权威评测排名。
这些排行榜的评测方法各有侧重:有的侧重客观题得分,有的依赖人类主观打分,有的强调实时更新。了解各排行榜的评测方法论,是正确解读排名数据的前提。Awesome-LLM-Eval 巧妙地将这些排行榜整合在一起,让用户可以横向对比,避免被单一排名"带节奏"。
Awesome-LLM-Eval 本身并非一个可执行的代码项目,而是一个精心维护的 Markdown 知识库。但它在文档质量上的标准,丝毫不亚于成熟的代码项目。
持续更新机制:项目配套有 arXiv 论文,但论文受限于发表周期无法实时更新。因此,GitHub 仓库作为"活文档",会持续跟进最新的评测基准和模型动态。每当有新的基准发布,仓库会第一时间收录并标注。
分类体系的逻辑一致性:评测基准按照人类认知发展路径进行分类,而不是简单地按字母顺序排列。这种分类方式让用户可以"按图索骥"——如果你的目标是评测模型的多语言翻译能力,只需要找到"跨语言理解"对应的子类别,即可获得所有相关基准的完整清单。
无门槛使用:作为纯文档型项目,用户在浏览器中打开 GitHub 页面即可浏览所有内容。无需安装 Python 环境、无需 GPU——只要能上网,就能用。
Awesome-LLM-Eval 配套论文 "Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap" 由王俊、顾宁伦等人撰写,发表于 arXiv(2508.18646)。论文将 LLM 的发展类比为人类的成长过程:知识习得期 → 技能专精期 → 能力泛化期 → 价值对齐期。这种框架为 LLM 评测提供了一个更具哲学深度的视角。
尽管 Awesome-LLM-Eval 是目前最全面的 LLM 评测资源导航,但也存在一些局限性:
Awesome-LLM-Eval 的出现,折射出 LLM 评测领域正在经历的一场深刻变革:从"各自为战"走向"系统整合"。
对于 AI 爱好者,它是了解 LLM 能力边界的最佳起点——无需阅读数百篇论文,只需浏览这份导航图,就能对 LLM 评测的全貌有基本认知。
对于开发者,它是选择评测基准的参考手册——在立项阶段选择正确的评测基准,能让模型的优化方向更加明确。
对于研究者,它是发现评测前沿的侦察工具——通过追踪最新收录的基准和工具,可以快速了解领域动态。
随着 2025 年多模态大模型、长上下文模型、AI Agent 的快速发展,Awesome-LLM-Eval 能否持续跟上这一节奏,将是它未来最大的考验。但无论如何,它已经为这个快速变化的领域提供了一份有价值的"快照"。
关联资源:

图3:LLM 评测调研框架总览