SuperCLUE
中文大模型综合性评测基准,涵盖12项核心能力,支持Agent、安全等多维度横向对比
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
中文大模型综合性评测基准,涵盖12项核心能力,支持Agent、安全等多维度横向对比
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个场景:你是一位教育工作者,想知道市面上十多种国产大模型谁更适合批改数学作业;或者你是一家创业公司的CTO,需要在预算有限的情况下选择最优的中文对话引擎。在没有统一标尺的情况下,你只能凭感觉、凭PR稿来判断——这就像没有温度计就判断谁在发烧一样荒谬。 SuperCLUE(Super Chinese Language Understanding Evaluation)正是为解决这个问题而生:它是中国首个系统性、综合性评估中文大模型能力的标准化Benchmark。
SuperCLUE 由中文语言理解评测基准 CLUE 团队(CLUEbenchmark)发起和维护。CLUE 是国内最早的中文NLP评测榜单,而 SuperCLUE 则是其在LLM时代的升级扩展。2023年7月,SuperCLUE 正式发布技术报告(arXiv:2307.15020),迅速成为国内评测中文大模型绕不开的标准工具。
核心发起人 brightmart(230次commit主导)在中文NLP社区有深厚积累。SuperCLUE 的诞生直接回应了三个行业痛点:其一,GPT-4等国际模型在中信表现优异,但国内缺乏与其对标的国产模型横向评测;其二,各厂商自评成绩水分严重,缺乏第三方独立评测背书;其三,传统评测只看"做题能力",忽略了LLM最核心的对话、推理、Agent能力。

图1:SuperCLUE 能力评估结构图——将大模型能力分解为多个维度进行系统性评测
SuperCLUE 的评测框架将大模型能力划分为四个核心象限,细化为12项基础能力:
语言理解与生成(基础能力)
专业技能与知识
Agent智能体(2023年10月新增)
知识与百科

图2:SuperCLUE 多维度评测方案架构图,涵盖从数据构建到模型评测的完整流程
评测方法采用客观题+主观评估双轨制:客观题通过自动化评测脚本打分,主观开放题由人类评估员打分后取均值,确保评测的客观性和公平性。
SuperCLUE 榜单的历史本身就是一部中国大模型发展史。以2023年11月榜单为例:GPT-4 Turbo以89.79分居首,百度文心一言4.0以74.02分获得国产第一,月之暗面Moonshot(KimiChat)紧随其后。这一榜单揭示了一个关键规律:在中国擅长的中文理解场景下,头头国产模型与GPT-4的差距已缩小至15分以内。到2025年,SuperCLUE 年度报告更新,多个国产模型已在特定维度逼近甚至超越GPT-4 Turbo。

图3:SuperCLUE 排行榜,清晰展示各模型在不同能力维度上的表现对比
SuperCLUE 的技术架构分为三层:
主要贡献者 brightmart 在仓库中维护了完整的 model_cards/ 目录,为每个参评模型提供结构化的模型卡片,记录评测日期、API版本、使用方式等元信息,确保可复现性。
SuperCLUE 的价值不可替代:
局限性也需要正视:
| 用户类型 | 建议 |
|---|---|
| AI开发者 | clone仓库获取评测数据和评分脚本,用于对比自研模型与竞品 |
| 企业决策者 | 查阅官方榜单,根据业务场景选择最适合的模型API |
| AI爱好者 | 追踪月度榜单,了解中文大模型发展趋势 |
| 学术研究者 | 参考评测框架和数据集构建方法,发起自己的评测研究 |
SuperCLUE 的演进轨迹代表了一个更大的趋势——中国AI正在从"跟随者"向"标准制定者"转变。随着SuperCLUE-Agent(Agent智能体评测)、SuperCLUE-Safety(安全评测)等子项目陆续发布,CLUE团队正在构建一个覆盖训练→评测→优化→落地的完整闭环工具链。
未来,随着多模态大模型(视觉+语言+音频)的兴起,SuperCLUE 的评测维度预计将扩展至图像理解、语音交互等能力,这既是挑战也是机遇。对于任何想深入了解中国大模型发展现状的人来说,SuperCLUE 仓库都是一份不可绕过的核心资料。
数据来源:CLUEbenchmark/SuperCLUE GitHub仓库,评测结果截至2023年12月。最新年度榜单请访问 www.superclueai.com。