awesome-foundation-model-leaderboards
AI模型评测排行榜超级导航站,聚合100+权威评测榜单,支持快速对比模型综合能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI模型评测排行榜超级导航站,聚合100+权威评测榜单,支持快速对比模型综合能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Awesome AI Leaderboard 项目封面图
你训了一个新模型,在 MMLU 上刷到了 92 分,自豪地发了一条朋友圈。下一秒,同事幽幽地问了一句:"在 Arena-Humanety 上排第几?"你愣了一下——因为你知道自己的模型在 MMLU 上厉害,但 Arena 上的表现,完全没查过。
这不是你一个人的困境。在大模型时代,"评测"本身就是一门玄学:每个榜单侧重点不同,有的考推理、有的考对话、有的考多语言、有的考代码生成,模型之间的"谁更强"根本没法用单一分数回答。开发者、研究者、政策制定者面对 dozens of leaderboards,常常不知道该信哪一个。
Awesome AI Leaderboard 正是为解决这个问题而生——它不是一个排行榜,而是一个排行榜的排行榜,把散落在互联网各个角落的 AI 模型评测榜单汇聚在一起,让你一次找到所有你想比较的评测结果。
Awesome AI Leaderboard 由 SAIL Research Lab(Stanford AI Lab 的一个研究分支)维护,2024年5月正式上线 GitHub。虽然仓库本身只有 30000 字左右的 README,但整理的外部资源链接超过 138 个,涵盖了 AI 模型评测领域从通用综合评测到细分任务评测的完整生态。
SAIL Research Lab 本身是一个专注 AI 基础研究的学术组织,拥有 97 个公开仓库,在 AI 基准测试(benchmark)领域有深厚的积累。这个 awesome-list 是他们将学术研究中的评测方法论向外传播的重要载体,面向的受众既有研究者,也有工程师和 AI 产品经理。
这是项目的主干章节,分为两大类:
Comprehensive(综合类) 收录了 26 个综合性 AI 评测平台,这些平台不只测试某一个维度,而是从多角度评估模型能力:
Text(文本类) 是更细分的长尾收录,收录了 88 个针对文本任务的专项排行榜,几乎涵盖了 NLP 的每一个子领域:
此外还有专门针对代码(BigCodeBench)、数学(MATH)、推理(GSM8K)、多语言(XGLUE)等方向的数十个排行榜,链接均指向原始评测页面或 GitHub 仓库。
需要直说的是:这个项目不是代码仓库。整个仓库只有一份 README.md 文件,使用 Markdown 格式编写,通过 GitHub Pages(sailresearch.github.io/awesome-ai-leaderboard)托管为静态网站。
这反而是它的设计哲学——最轻量的基础设施,最广泛的可访问性:
这也是 awesome-list 的经典模式:用最朴素的方式做最有价值的事情。
对于 AI 研究者:快速了解某一细分领域有哪些公认的评测标准,判断自己提出的模型在学术坐标系中的位置。
对于 AI 工程师:在选择基础模型或 API 时,参考不同榜单的表现来决定哪个模型最适合自己的业务场景(如对延迟敏感选低能效比的,对准确性敏感的选 Arena 排名高的)。
对于 AI 产品经理:理解各模型的能力边界,为产品选型提供客观依据,避免被单一营销数字误导。
对于 AI 评测爱好者:这是目前最完整的 AI 排行榜导航图,可以在这里找到几乎所有主流和非主流的模型评测项目。
项目于 2024 年 5 月创建,2025 年中加速增长,截至 2026 年 6 月已有 366 Stars、52 Forks,最近一次更新(push)为 2026 年 6 月 26 日,说明维护状态活跃。考虑到 AI 评测榜单的数量和质量都在快速增长,这个导航类资源的价值会持续提升。
榜单质量参差不齐:收录了 100+ 个排行榜,但并非所有榜单都有严谨的方法论支撑。部分新兴榜单可能存在测试集泄露、过拟合基准等问题,用户需要自行甄别。
排行榜"刷分"现象:项目本身无法解决 AI 评测领域的根本问题——评测数据污染(benchmark leakage)和模型在基准上过拟合。收录这些排行榜不等于认可它们的公正性。
无法替代实际评测:这是资源索引,不是评测工具。用户最终还是需要自己运行评测或访问原始排行榜获取真实数据。
Awesome AI Leaderboard 的存在本身,反映了 AI 领域评测生态的一个深刻矛盾:AI 能力评价维度的碎片化。每个研究团队、每个商业公司都在建立自己的评测体系,整个领域缺乏统一标准。这个 awesome-list 用"汇总"的方式,暂时缓解了信息分散的问题,但真正的标准化评测框架仍然是 AI 领域的一个未解难题。
可以预见,随着 AI 能力持续提升,评测榜单也会持续演化。这个项目的维护价值,将与 AI 模型的进化速度高度绑定。