opencompass
开源大模型评测「全能标尺」,支持100+基准覆盖全维度,被Meta官方推荐
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源大模型评测「全能标尺」,支持100+基准覆盖全维度,被Meta官方推荐
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:当你训练了一个自称「全能学霸」的大语言模型,你想让它参加一场严格的期末考试,却发现身边的「裁判」各有各的标准——有的只看数学成绩,有的只考中文作文,还有的只问编程题。你的模型到底有多强?很难说清。
OpenCompass 就是来解决这个问题的。它就像是 AI 世界的「全能裁判团」,提供了一套统一的、公平的大模型评测体系,让任何人都能对大语言模型(LLM)的真实能力进行客观、全面的打分。目前在 GitHub 上已收获超过 7000 颗星,是全球最活跃的大模型评测开源项目之一,被 Meta AI 官方推荐为 Llama 模型的评测工具。
图1:OpenCompass Star 历史增长曲线
2023 年,随着 ChatGPT 的爆火,无数大模型如雨后春笋般涌现。各个实验室、研究机构、企业纷纷发布自己的 LLM,声称在各项指标上「超越 GPT-4」。但问题是:这些评测结果真的可信吗?
不同的评测基准(Benchmark)往往存在明显缺陷:有的数据集在模型训练时已被「看过」,导致分数虚高;有的评测题目过于简单,无法区分模型能力上限;还有的只覆盖单一维度(如纯考数学),无法反映模型的综合实力。评测标准的混乱,严重阻碍了 AI 社区对模型真实性能的理解和比较。
在此背景下,**上海人工智能实验室(Shanghai AI Lab)**推出了 OpenCompass。作为 Compass(指南针)系列开源项目的重要组成部分,OpenCompass 承载着为 AI 社区提供「公平、统一、可复现」评测能力的使命。它的目标是成为 LLM 评测领域的「度量衡」——无论是谁家的模型,都用同一把尺子量,结果才服众。
OpenCompass 的架构设计非常清晰,像一条高度模块化的工业流水线,数据从输入到输出经过多个标准化环节。

图2:OpenCompass 评测榜单 Badge
核心模块包括:
Datasets(数据集):OpenCompass 集成了超过 100 个评测基准,涵盖语言理解、推理能力、数学水平、代码生成、知识问答、多语言能力、长文本理解等几乎所有维度。其中既有 C-Eval、MMLU、GSM8K 等经典基准,也有中国本土的 CompassBench、SuperGPQA(285 个研究生学科)等高难度评测集。
Models(模型支持):支持国内外主流 LLM,包括 GPT-4/3.5、Claude 系列、LLaMA、Qwen、InternLM、DeepSeek、GLM、Baichuan 等。支持两种接入方式:直接调用 HuggingFace 模型,或通过 vLLM、LMDeploy 等推理引擎加速推理。
In-context Learning(Inicl):OpenCompass 提出了 Inicl 评测范式,将模型推理的 prompt 构建、few-shot 示例选择、推理执行和结果解析全部标准化,支持批量评测多模型、多数据集的组合。
Runner/Task:分布式执行层,支持本地、Slurm、Paddles 等调度后端,并行化评测任务。
Evaluator(评估器):支持多种评估方式,包括精确匹配(exact match)、模糊匹配(fuzzy match)、LLM-as-Judge(用大模型来评判其他模型的回答质量),以及数学专用评估器 MATHVerify。
OpenCompass 的评测能力远不止「跑分」这么简单。
长上下文评测(RULER):随着 GPT-4 Turbo 将上下文窗口扩展到 128K,各家模型纷纷跟进「长文本」能力。OpenCompass 集成了 RULER 基准,专门测试模型在超长上下文(检索、多跳追踪、聚合、问答)场景下的真实表现,防止通过「捷径」在某些特定测试上拿高分。
LLM 裁判(LLM-as-Judge):对于开放式问答(如「如何评价某部电影」),传统的精确匹配无法评判回答质量。OpenCompass 支持用另一个 LLM(如 GPT-4)作为「裁判」,对模型回答进行打分,避免了评测的主观偏差。
CompassBench 学术榜单:上海 AI Lab 团队定期发布的 CompassBench 学术榜单,是目前公认的权威 LLM 学术能力评测基准,覆盖 STEM 各学科,被多篇顶会论文引用。
命令行方式(推荐):项目提供了 run.py 入口脚本和丰富的 YAML 配置文件生态。用户只需编写或修改一个配置文件(指定模型、数据集、评测参数),运行 python run.py configs/your_config.py,即可开始评测。适合批量评测和自动化集成。
Web 界面:项目集成了 Gradio,提供轻量化的 Web UI,可交互地选择模型和数据集,适合快速上手体验。Gradio 界面截图可见官网(opencompass.org.cn)。
OpenCompass 的影响力已超越学术界。Meta AI 官方在 Llama 模型的官方文档中推荐 OpenCompass 作为评测工具,这是国产开源 AI 工具首次获得如此高规格的国际认可。
此外,OpenCompass 还支撑了多个国内权威 LLM 榜单,包括:
截至 2026 年,OpenCompass 已支持评测超过 100 种数据集、50+ 主流 LLM,覆盖从 7B 到 200B+ 参数的全量级模型,是目前功能最全面、社区最活跃的 LLM 评测开源项目。
如果你正在训练 LLM、选型评估、或者做 AI 方向的学术研究,OpenCompass 绝对是值得收入工具箱的「效率装备」。