41-llms-evaluated-on-19-benchmarks
jayminbhan/41-llms-evaluated-on-19-benchmarks加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你是一位 AI 团队的技术负责人,手头有一块全新的 RTX 5090 显卡,准备为团队选型一个大模型。项目需要兼顾推理能力、数学能力、常识理解和知识问答,预算有限无法部署 GPT-4 级别的闭源模型。这种"选择困难症"几乎是每个 AI 开发者的日常。
jayminbhan/41-llms-evaluated-on-19-benchmarks 项目正是为解决这个痛点而生——它用 lm-evaluation-harness 工具对 41 款主流开源大模型进行了统一的基准测试,涵盖 19 项评测任务,最终结果以可视化榜单形式呈现,让选型决策有据可依。
大模型评测一直是行业难题。不同团队使用不同的测试环境、不同的提示词工程、不同的评估指标,导致横评结果往往缺乏可比性。更棘手的是,许多模型发布时只公布官方评测分数,但这些分数往往经过精心调优,无法反映真实部署场景下的性能。
这个项目由独立开发者 Jaymin Bhan 创建,他选择在个人电脑上(而非云计算平台)对主流开源模型进行统一评测。更重要的是,所有评测脚本、完整日志、JSON 结果文件全部开源,任何人都可以复现或扩展评测。
项目评测的模型涵盖多个热门系列:
评测在 2025 年 7-8 月完成,使用了当时最新的模型版本,时效性较强。
项目采用 lm-evaluation-harness 作为评测框架,这是 EleutherAI 维护的开源评测工具,在 LLM 评测领域应用广泛。评测任务分为三大类别:
根据项目提供的 Overall Rank 排名表(综合所有任务平均分),核心发现包括:
第一名:google_gemma-3-12b-it
Gemma-3-12B 展现了出色的综合能力,在保持相对较小参数量的同时(12B),在各项任务中都取得了领先分数。这与其经过指令微调(-it 后缀)的版本特性有关,指令微调显著提升了模型的对话和推理能力。
Qwen3-14B 同样表现优异,作为国产模型的代表,Qwen 系列在数学推理方面尤为突出。Qwen2.5-Math 系列专门针对数学任务优化,在相关子榜单中排名靠前。
DeepSeek-R1-Distill 系列 值得关注——虽然参数量较小(1.5B/7B/8B),但通过知识蒸馏技术,Distill 版本的性价比极高,适合资源受限场景。
项目采用严格的一致性评测流程:
评测结果以多种格式输出:
项目主要依赖:
# 安装 lm-evaluation-harness
pip install lm-eval
# 克隆项目
git clone https://github.com/jayminbhan/41-llms-evaluated-on-19-benchmarks.git
cd 41-llms-evaluated-on-19-benchmarks
# 运行单个模型的基准测试
./run_benchmarks.sh
脚本会自动下载模型(如本地已有可修改路径),执行 19 项评测任务,并保存结果。
如需评测自己的模型或调整任务集,可以修改 run_benchmarks.sh 中的参数:
models 数组:添加 HuggingFace 格式的模型路径task 变量:选择要运行的评测任务子集output_dir:指定结果保存路径# 读取 JSON 结果
ls results_json/
# 查看排名表
cat results_tables/overall_rank.csv
1. 仅限开源模型 评测覆盖的 41 款模型全部为开源模型,无法与 GPT-4、Claude、Gemini 等闭源模型对比。如果你需要完整的模型生态对比,这个项目无法满足。
2. 个人硬件环境局限 评测在个人电脑(配置 RTX 5090)上完成,与生产环境的硬件配置可能有差异。不同 GPU 型号、内存大小、驱动版本都可能导致结果浮动。
3. 评测任务偏向英文 虽然 MMLU 等任务包含多语言子集,但主流评测任务以英文为主,对非英语语言的覆盖有限。如果你的应用场景是中文或其他语言,结果的参考价值需要打折扣。
4. 模型版本时效性 评测在 2025 年 7-8 月完成,但 AI 领域模型迭代极快。到你看到这篇文章时,可能已有新版本模型发布。建议结合项目时间戳和最新动态综合判断。
5. 缺少延迟和吞吐量指标 项目主要关注"准确性"指标(Accuracy、EM、F1),但缺少延迟(Latency)和吞吐量(Throughput)数据。对于生产部署来说,推理速度和成本同样关键。
在大模型生态中,"哪家模型最强"是最常见的问题,但也是最难回答的问题。官方榜单往往选择对自家有利的评测任务和指标,第三方榜单又难以保证评测一致性。
这个项目的价值在于提供了一个透明、可复现的评测参考。虽然 101 颗星在 GitHub 上算不上爆款,但它填补了以下空白:
对于 AI 开发者来说,这个项目是一份实用的"工具箱",即使不直接使用已有结论,其中的评测脚本和方法论也值得借鉴。
相关资源: