LLM-eval-survey
吉林大学等20+顶尖机构联合出品的大模型评测领域最高引用综述,系统梳理LLM评测的完整知识地图
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
吉林大学等20+顶尖机构联合出品的大模型评测领域最高引用综述,系统梳理LLM评测的完整知识地图
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:LLM-Eval-Survey 项目 Logo
2023年7月,吉林大学机器学习研究组(MLGroupJLU)联合微软研究院、卡内基梅隆大学、西湖大学、北京大学、中科院自动化所、香港科技大学等十余家顶尖机构,在 arXiv 上发布了一篇论文——《A Survey on Evaluation of Large Language Models》。
这篇论文回答了一个当时困扰整个 AI 社区的核心问题:当我们说一个大模型"很强"时,究竟在说什么?哪个维度强、哪个维度弱?怎么科学地比较两个模型?
论文发布后迅速成为该领域最高引用的综述之一,而其配套的 GitHub 仓库——也就是本项目 LLM-eval-survey——则将这篇论文进化成了一个持续更新的论文知识库,持续收录 LLM 评测领域的前沿工作。
在理解这个项目之前,需要先明白 LLM 评测本身面临的三个根本困境:
困境一:评测维度碎片化。 不同团队用不同基准测试不同模型,结论散落在数百篇论文里,没有一张全局地图。HELM 测通用能力,MMLU 测知识,BigBench 测推理,HumanEval 测代码……研究者想全面了解某个模型,得读完一屋子论文。
困境二:评测方法快速迭代。 2022年底 ChatGPT 发布后,评测方法论几乎每几个月就更新一次。传统基准(BLEU、ROUGE)被指无法反映真实能力,以 GPT-4 为代表的强大模型让很多旧基准在短时间内迅速失效( saturation 问题)。
困境三:跨文化、跨语言评测缺失。 早期主流评测基准几乎全部基于英文,无法公平评估中文或其他语言大模型的能力。CMMLU、CMATH 等中文基准直到 2023 年才陆续出现。
LLM-eval-survey 的核心价值,就是试图回答这三个困境——通过系统化的论文分类,让研究者能够快速定位自己关心的评测维度,找到对应的代表性工作和最新进展。
本项目围绕一个清晰的层次化框架展开,所有收录的论文按评测维度分为四大类:
这是项目的主体部分,按应用领域将评测工作分为 7 大类:
1. 自然语言处理(NLP) 涵盖情感分析、文本分类、自然语言推理、事实性检测(Factuality)等传统 NLP 任务。这类评测是 LLM 最成熟、最早被系统研究的领域。代表性工作包括斯坦福的 HELM(Holistic Evaluation of Language Models),它从 42 个维度评估语言模型,被本项目大量引用。
2. 鲁棒性、伦理与可信度 这是近年来增长最快的评测方向之一。PromptBench(微软)评估 LLM 对对抗性 prompt 的鲁棒性;DecodingTrust(芝加哥大学/微软)从可信度角度全面评估 GPT 模型;FActScore(MIT)专门检测 LLM 生成文本中的幻觉(hallucination)问题;BBQ(ACL 2022)则针对问答系统中的社会偏见进行评测。
3. 社会科学 包括法律判断摘要、政治意识形态分析、计算社会科学等方向。值得注意的工作如"GPT-4 能否当税务律师"——哈佛法学博士 John Nay 的研究表明,LLM 在零样本设置下已能处理部分法律推理任务。
4. 自然科学与工程 细分为数学推理、科学知识理解、代码生成三个子方向。数学评测领域出现了大量专门基准:CMATH(中文小学数学)、MetaMath(自举数学问题)、GSM8K/GMSK 等。其中 GPT-4 的数学能力分析(MIT 团队)发现 GPT-4 在高难度数学题上仍有明显短板。
5. 医学应用 这是 LLM 评测中非常敏感的领域。USMLE(美国医师执照考试)是标志性基准——多个团队验证了 GPT-4 在医学考试中的表现,甚至超过了部分医学生。但与此同时,论文也收录了批判性研究:LLM 在医疗信息咨询中存在幻觉风险,不能替代专业医疗建议。
6. Agent 应用 评测 LLM 作为智能体(Agent)的能力——能否调用工具、执行多步骤任务、感知多模态环境。引用了微软的 Kosmos-1("语言不是全部")和 DeepMind 的 AMIE(医学诊断 Agent)等工作。
7. 其他领域 包括教育、推荐系统、游戏 AI 等。
项目的第二部分回答了"在哪里测"的问题——即评测工具和平台的选择。
项目还收录了关于"如何设计评测"的元研究:
从代码角度审视,这个项目的架构极其简洁——它本质上不是一个软件系统,而是一个结构化的 Markdown 知识库。
仓库文件结构(仅 4 个文件):
README.md(30,000+ 字):完整的内容主体,承载所有论文分类目录imgs/logo-llmeval.png:项目 Logoimgs/framework.png / imgs/framework_new.png:评测框架图没有 Dockerfile、没有 docker-compose、没有 Python/JS 代码、没有 CI/CD。吉林大学团队选择用纯 Markdown 实现内容管理,背后有明确的考量:降低贡献门槛——任何人都可以提交 PR 添加新论文,不需要搭建开发环境。GitHub 的 PR 审核机制天然充当了内容质量控制层。
这种"论文即代码"的模式在学术界非常普遍,既保证了内容开放性,又利用了 GitHub 的版本控制和协作功能。
| 维度 | 评估 |
|---|---|
| 架构类型 | 静态 Markdown 知识库(非软件系统) |
| 代码量 | 0(无运行时代码) |
| 依赖框架 | 无 |
| 测试覆盖 | 无(不适用) |
| 文档质量 | 极高——20+ 位顶级机构研究者联合撰写 |
| 数据隐私 | 不适用(无用户数据) |
由于项目性质特殊,传统代码质量指标(测试覆盖率、圈复杂度等)不适用。其"代码质量"应理解为内容质量:论文分类逻辑清晰、引用规范、持续更新维护。
维护活跃度: 最近一次提交为 2026-04-17,距今不到两个月,说明项目仍在活跃维护。
如果你想了解"GPT-4 到底强不强"——不要只看媒体标题,直接到这个仓库,找到 "What to evaluate" 下对应的领域,追溯原始论文和数据。
例如,对"ChatGPT 的偏见问题"感兴趣 → 查看 "Robustness, ethics, biases" 章节 → 找到 BBQ、RealToxicityPrompts 等代表性工作 → 读论文原文。
如果你在构建一个新的 LLM 应用,需要选择评测基准:
局限性一:收录偏向英文论文。 虽然项目收录了 CMMLU、CMATH 等中文基准,但总体数量仍远少于英文评测工作。对于非英语语言 LLM 的研究者来说,使用价值有限。
局限性二:缺乏量化对比表格。 项目以论文列表为主,没有提供各模型在不同基准上的分数对比矩阵。如果想快速比较 Claude vs GPT-4 vs Gemini 的数学能力,仍需要到各模型官网或论文中查找。
局限性三:时效性挑战。 2023 年大模型评测领域进展极快,项目试图通过 GitHub 持续更新来弥补论文的时效性不足,但仍有大量新基准(如 MMLU-Pro、GPQA 等)在 2024-2025 年发布后尚未收录。
LLM-eval-survey 的价值,不仅在于它本身是一篇好论文,更在于它代表了 AI 社区正在形成的一种新范式:评测即科学。
过去,LLM 的评测长期被认为是"工程问题"而非"科学问题"——研究者专注于提升模型性能,而对"什么是好的评测"缺乏系统性反思。2022-2023 年间,HELM、PromptBench、DecodingTrust 等工作的出现,标志着社区开始认真对待评测的方法论。
从 GitHub 影响力来看,该仓库已获得 1,600 Stars、99 Forks,跨越了"论文附属仓库"的常见天花板。其作者团队涵盖吉林大学、微软研究院、卡内基梅隆、西湖大学、北大、HKUST 等机构,形成了一个真正有影响力的学术协作网络。
该项目与微软的 PromptBench 项目、香港中文大学的 LLM-Eval 项目形成互补,共同构成了中文 AI 社区在 LLM 评测领域的重要知识基础设施。
本分析基于 MLGroupJLU/LLM-eval-survey 仓库(2023-07-02 创建,2026-04-17 最新更新),arXiv 论文链接:2307.03109