chinese-llm-benchmark
中文大模型能力评测标杆:380个模型×7大维度×300项细分能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
中文大模型能力评测标杆:380个模型×7大维度×300项细分能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2026年5月,一个由非线智能团队(NoneLinear)维护的中文大模型评测项目在 GitHub 悄然突破6000 star。这个名为 ReLE(Really Reliable Live Evaluation) 的项目,追踪着全球380个大模型在中国场景下的真实表现——从高考数学到医师资格考试,从律师考试到Agent工具调用,每一项数据都来自实际API调用,而非模型方自述。
想象一个场景: 你是某科技公司的技术负责人,要为公司产品选一个大模型。用户遍布全国,涉及医疗问诊、金融客服、法律咨询等多个场景。你听说GPT-5很强、Claude很稳、Qwen3.5性价比高——但哪个在中国语境下真正好用?ReLE 就是回答这个问题的工具。
图1:综合能力排行榜示例(综合Top 10)
目前主流的大模型评测体系(如MMLU、HELM)主要面向英文场景,即便有中文题目,也往往存在翻译偏差或文化不适配的问题。例如,一道关于中国《民事诉讼法》的高考法律题,如果直译成英文,GPT-5可能给出标准答案,但在中文语境下,题目的法律术语表达、案例引用的惯例完全不同,得分并不能反映模型在中国市场的真实能力。
ReLE 的出现,正是为了填补这个空白。项目团队收集了大量中文原创评测数据,涵盖:
更值得关注的是,ReLE 不仅收录商用闭源模型(GPT-5系列、Claude系列、Gemini系列、文心、GLM等),也覆盖了大量开源模型(Qwen3、LLaMA4、DeepSeek系列、Mistral等),是国内少有的将闭源与开源放在同一标准下横向对比的评测体系。
图2:IFEval 中文指令遵从评测
ReLE 的架构设计值得研究。整体分为两层:
数据层:评测题库以 Markdown 表格和 Excel 形式存储在 eval/ 和 leaderboard/ 目录下,按学科分类。每个评测项都有标准答案(JSON格式)和评分脚本。评测数据定期更新,最新版本号已达 v5.10.8(2026年5月30日),保持了极高的更新频率。
执行层:评测通过调用各模型的官方API(OpenAI API兼容格式)批量执行,自动打分并汇总结果。结果以 Markdown 表格形式输出到排行榜,并附带原始分数和排名变化记录。
代码仓库同时提供模型选型参考文档(docs/modelSelection/),以及历年高考真题PDF(opendata/2025高考各省真题/),方便研究人员复用。
榜单分类极其细致,仅教育维度就细分为小学、初中、中考、高中、高考、高等教育、考研、教师资格等子榜;法律维度有律师资格考试和公务员考试;推理维度包含演绎推理、常识推理、符号推理(BBH)、算术能力、表格问答、高中奥数、数独等。这样的分类粒度,使得 ReLE 能精准定位模型的能力长短板,而非给出一个笼统的综合分数。
根据2026年5月最新数据,综合能力排行榜前列为:
| 排名 | 模型 | 厂商 | 综合准确率 |
|---|---|---|---|
| 1 | qwen3.5-plus | 阿里 | 66% |
| 2 | gpt-5.4 | OpenAI | 63% |
| 3 | gemini-3.1-pro-preview | 63% | |
| 4 | claude-opus-4.6 | Anthropic | 61% |
| 5 | Doubao-Seed-2.0-mini | 字节跳动 | 61% |
几个有趣的观察:
对开发者而言,ReLE 提供了客观的选型依据。国内很多团队在做 AI 应用时,往往依赖海外榜单或直觉选择模型,但实际用户体验与榜单排名往往存在差距。ReLE 的中文专项评测,能帮助团队找到真正适合中国市场的模型。
对模型方而言,ReLE 的缺陷库是宝贵的反馈数据。超200万条错误记录,揭示了当前模型的系统性弱点——比如大多数模型在中文法律术语理解上普遍较弱,在金融场景的精确数字计算上表现参差。这些数据对模型迭代有直接参考价值。
对学术界而言,ReLE 提供了高质量的中文评测基准,推动了中文NLP评估标准化。
ReLE 也并非完美。几个值得关注的点:
ReLE 是完全开源的,任何人都可以参与:
图3:评测交流群二维码
ReLE 中文大模型评测项目(chinese-llm-benchmark)是目前中文AI领域最全面、最活跃的第三方评测体系之一。它用持续的更新频率(v5.10.8,每月多次迭代)、细致的评测粒度(7大维度、~300个能力项)、超200万条缺陷库,为开发者和研究者提供了不可替代的选型参考工具。
尽管评测方法论仍有改进空间,但在当前中文大模型生态中,ReLE 的存在填补了关键的"信息不对称"问题——让选型决策有据可依,而非盲从品牌。