MMLU-Pro
更难的MMLU升级版:选项扩至10个、推理题占比更高,让大模型评测结果更能反映真实能力差距
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
更难的MMLU升级版:选项扩至10个、推理题占比更高,让大模型评测结果更能反映真实能力差距
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你在参加一场考试,题目全是四选一的选择题,而考试前你被允许把教材翻开放手边——这大概是很多人对现有大模型Benchmark的印象。2020年Meta推出的MMLU(Massive Multitask Language Understanding)就是这样一个「开卷考试」:涵盖57个学科、数万道选择题,题目形式固定、知识覆盖面广,一度成为衡量大模型「通识水平」的金标准。
然而,随着GPT-4、Claude等大模型在MMLU上逼近90%准确率,一个尖锐的问题浮出水面:当模型准确率已经触及天花板,我们还能用MMLU区分模型好坏吗? 更重要的是,MMLU的题目相对基础,选项只有4个,随机猜测的正确率就有25%,这对于真正评估模型的深层推理能力而言,远远不够。
痛点场景:某团队用两款不同的大模型做产品选型,MMLU评测分数都是88%,看起来不相上下。但上线后用户反馈却天差地别——模型A在处理需要多步推理的复杂问题时频繁「卡壳」,模型B却能给出连贯的分析。这说明,MMLU的分数并不能真实反映模型在实际场景中的推理能力。
2024年,来自多伦多大学滑铁卢分校TIGER实验室的团队,在NeurIPS 2024发表了MMLU-Pro(MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark),正式回应了这个问题。

图1:MMLU-Pro论文摘要与核心改进示意(来源:GitHub仓库原图)
MMLU-Pro在数据构建和题目设计上有三项关键升级,每一项都直指原版MMLU的软肋。
第一,选项从4个扩展到10个。 这是最直观也最有效的改动——随机猜测的正确率从25%骤降至10%,模型必须真正「理解」题目才能答对。以数学领域为例,一道关于概率计算的题目,从原来4个选项变成了10个选项,其中既有干扰性极强的「差一点」选项,也有看似合理但实质错误的陷阱选项。这种设计让评测结果对模型真实能力更加敏感。
第二,题目难度显著提升。 MMLU-Pro的数据团队从学术考试和教科书中精选了超过12000道题目,刻意排除了那些「机械记忆」即可答对的知识点,转而选择需要深度推理、多步计算或跨领域综合理解的问题。这直接导致一个有趣的现象:在MMLU上表现越好的模型,迁移到MMLU-Pro后下降越明显。 实验数据显示,主流模型的准确率普遍下降了16%至33%。
第三,评测稳定性大幅提升。 原版MMLU有个隐藏的「脆弱性」:模型得分对Prompt(提示词)的措辞高度敏感。用「请回答」「选最佳答案」「最可能正确的是」等不同措辞,模型分数可能相差4-5个百分点。这意味着Benchmark本身就不够「客观」。MMLU-Pro团队测试了24种不同的Prompt组合(包括4种初始提示语 × 6种示例格式),结果发现MMLU-Pro对Prompt变化的敏感度降低到了仅2%,这使得评测结果更加可靠、可复现。
第四,Chain-of-Thought(CoT)推理显著有效。 在原版MMLU上,直接给出答案和逐步推理(Chain-of-Thought)的效果差异不大;但在MMLU-Pro上,CoT推理带来了明显的性能提升。这不是bug,而是features——它说明MMLU-Pro的题目确实包含了更多需要推理过程的复杂问题。
从代码仓库来看,TIGER实验室提供了一套完整的评测工具链,支持三种主要的评测模式:
模式一:API在线评测。 通过修改evaluate_from_api.py脚本中的API密钥,可以对OpenAI GPT系列、Google Gemini、Anthropic Claude、DeepSeek等多个主流模型进行评测。脚本使用了openai、anthropic、google.generativeai等官方SDK,并支持自定义API URL(如本地部署的vLLM服务),具备良好的扩展性。对于需要评测多个模型性能的团队,这种方式最为便捷——只需申请API密钥、修改配置,即可批量跑评测。
模式二:本地模型评测。 对于私有化部署的模型(如LLaMA、Mistral等),项目提供了evaluate_from_local.py脚本,支持直接调用本地推理服务(如vLLM)。这种方式适合两个场景:一是评测尚未对外开放的模型,二是企业内网的私有模型。requirements.txt中明确依赖了torch、transformers、vllm等深度学习框架,确保本地评测的环境完整性。
模式三:分布式批量评测。 evaluate_from_apiX.py是最灵活的评测脚本,支持多线程并发调用API。关键参数包括:--num_workers(并发worker数)、--max_tokens(单次输出token上限)、--retry和--retry_wrong(处理超时和答错情况的自动重试)。这种设计非常适合评测大量题目——当模型在某些题目上出现「幻觉」(hallucination,即生成乱码或无意义内容)时,脚本会自动重试,而不是直接放弃该题。
评测结果查看。 评测完成后,evalshowpro.py脚本提供了交互式结果查看功能,可以浏览每道题的模型输出、正确答案和推理过程。这个工具对于分析模型弱点特别有价值——通过观察哪些题目答错了,可以针对性地做模型微调或Prompt优化。
MMLU-Pro仓库中附带的Leaderboard展示了截至2024年底各大模型的评测结果,呈现出清晰的竞争格局:
| 模型 | 准确率 |
|---|---|
| Claude-3.5-Sonnet | 76.12% |
| GPT-4o | 72.55% |
| Gemini-1.5-Pro | 69.03% |
| Claude-3-Opus | 68.45% |
| GPT-4-Turbo | 63.71% |
数据清晰地表明:在MMLU-Pro这个更难的Benchmark上,模型之间的能力差距被拉开了——第一名和第五名之间相差超过12个百分点,而同样的模型在原版MMLU上的差距可能只有2-3个百分点。更重要的是,Claude-3.5-Sonnet在MMLU-Pro上的领先优势(领先GPT-4o约3.6个百分点),与其在原版MMLU上的排名并不完全一致,这说明MMLU-Pro确实挖掘出了不同模型在推理深度上的真实差异。
作为一个学术Benchmark,MMLU-Pro并非完美无缺,以下几点值得使用者注意:
数据集仅限英文。 MMLU-Pro的题目全部来自英语学术资源,评测结果对非英语语言模型的代表性有限。中国团队开发的Qwen、DeepSeek等模型,在中文场景的能力无法通过MMLU-Pro充分体现。
题目数量与覆盖面的权衡。 从57个学科缩减到14个学科,题目数量从约24000道精简到约12000道,牺牲的是覆盖面,换来的是深度和难度。不同场景的评测需求不同,对于需要全面能力评估的场景,可能需要结合多个Benchmark综合判断。
Benchmark的「应试」风险。 与所有公开Benchmark一样,MMLU-Pro也面临被「过拟合」的风险——模型开发者可能针对MMLU-Pro的题目做定向优化,从而获得高分但实际能力并未提升。这种现象在LLM社区已有先例(如MMLU上的「刷题」争议)。
MMLU-Pro的发布在LLM评测领域产生了深远影响。
首先,它推动了整个行业对评测基准的反思——「高分=强模型」这个等式不再成立,促使人们寻找更难、更稳、更能反映真实能力的评测方式。在此之后,GPQA、ARC-AGI等更难的Benchmark相继涌现,共同构成了大模型能力评估的新图谱。
其次,MMLU-Pro证明了推理能力是区分顶级模型的关键维度。在知识覆盖范围接近饱和后,推理深度成为了新的竞争焦点。这一点在2024年下半年各大厂商的技术路线中得到了印证:Chain-of-Thought、Test-time Compute、Reasoning Models等概念相继成为行业焦点,而MMLU-Pro正是这股浪潮的重要推动者之一。
对于AI开发者和研究者而言,MMLU-Pro仓库本身就是一个有价值的工具——它不仅提供了评测数据,还提供了完整的评测代码、24种Prompt模板、以及对多种主流模型的评测脚本。无论是评估新模型、对比竞品,还是分析自家模型的弱点,MMLU-Pro都是目前最可靠的参考基准之一。
项目信息