xbench-evals
长青无污染的AI评测框架,通过ScienceQA和DeepSearch双赛道评估模型真实能力边界
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
长青无污染的AI评测框架,通过ScienceQA和DeepSearch双赛道评估模型真实能力边界
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:xbench 官方 Logo
想象一下:你在高考前刷了 100 套模拟卷,最终在考场上遇到一道原题,你考了满分——但这能证明你真的学会了吗?这就是当前 AI 评测面临的"污染问题"(Data Contamination)。主流评测基准如 MMLU、GSM8K 等,由于在互联网广泛流传,大模型很可能已经"见过"训练数据中的类似题目,导致分数虚高。
xbench-evals 正是为解决这一问题而生。它是一个长青、无污染、真实场景、垂直领域的 AI 模型评测框架,通过两道核心轨道衡量 AI 系统的真实能力边界:
该框架由 xbench-ai 团队开发,数据集开源托管于 HuggingFace,评测代码完全开源,为 AI 社区提供了一个可复现、透明且持续更新的评测标准。
ScienceQA 是 AGI 追踪系列之一,专注于评估大模型在物理、化学、生物等自然科学领域的基础知识掌握程度。题目经过严格设计,涵盖单选题和多选题,每道题附带标准答案。
评测过程采用双重评分策略:
这种设计避免了"答案格式略有不同但实质正确被误判"的问题,让评分更贴近真实能力评估。
从最新排行榜来看,o3-high(OpenAI)以 60.8 分位居 ScienceQA 榜首,Gemini 2.5 Pro 紧随其后(57.2 分),字节跳动的 Doubao-1.5-thinking-pro 排名第三(53.6 分),DeepSeek-R1 以 50.4 分位列第四。这一结果说明,在纯科学知识问答场景中,推理型模型(o3、DeepSeek-R1)显著优于通用对话模型。
DeepSearch 同样隶属于 AGI 追踪系列,核心评估模型在搜索与信息检索场景中的工具调用能力。题目模拟真实搜索任务,要求模型理解问题 → 制定搜索策略 → 提取整合信息 → 给出最终答案。
这一评测维度填补了主流基准对"工具使用"能力评估的空白——现有 MMLU 等基准只测试知识记忆,无法反映模型在真实工作中调用 API、搜索外部信息的能力差异。
为降低单次评测的随机性,xbench-evals 实现了两个高级评分机制:
此外,评测结果中还包含成本(avg_cost RMB)和时间(avg_time s)两项实用指标,方便开发者在精度与成本之间做权衡。
xbench-evals 的代码库极为精简(仅 4 个核心 Python 文件),却覆盖了完整的评测生命周期:
xbench_evals.py → 主程序入口,CLI 参数解析、CSV 结果写入
eval_grader.py → 评分引擎,LLM-as-Judge 实现
language_models.py → 多模型适配层,兼容国内外 12+ API 提供商
data/ → 加密数据集(XOR + Base64 混淆保护)
dataset 文件(ScienceQA.csv 等)中的 prompt 和 answer 字段均经过 XOR 加密 + Base64 编码处理。密钥来自 canary 字段,运行时通过 xor_decrypt() 函数实时解密。
这一设计的核心价值在于:即使数据集在 GitHub 公开,每个题目的 prompt/answer 内容仍处于混淆状态,防止模型在训练阶段直接读取题目内容,从架构层面遏制数据污染。
language_models.py 维护了一个包含 12+ 提供商的 API 端点字典,包括:
| 提供商 | 代表模型 | API 特点 |
|---|---|---|
| OpenAI | o3, o4-mini, GPT-4.1 | 标准 OpenAI 兼容 |
| Anthropic | Claude Opus 4, Sonnet 4 | Claude API |
| Gemini 2.5 Pro/Flash | Gemini 兼容性端点 | |
| DeepSeek | deepseek-chat, deepseek-reasoner | 标准 API |
| 阿里云 | Qwen3, Qwen-Max | DashScope 兼容模式 |
| 字节跳动 | Doubao 系列 | 火山引擎 |
| 腾讯 | Hunyuan Turbo/T1 | 腾讯云 |
| 百度 | Ernie 4.5 Turbo | 千帆平台 |
| MiniMax | MiniMax-Text-01 | MiniMax API |
| 月之暗面 | Kimi 系列 | Moonshot API |
| 智谱 AI | GLM-4, GLM-Z1 | 智谱 BigModel |
| xAI | Grok 3 | xAI API |
每家提供商还有对应的 API 价格表(美元/百万 Token),评测结果可精确计算每次运行的实际成本,帮助研究者在不同模型间进行性价比分析。
xbench-evals 虽有明确的创新定位,但仍有值得关注的局限性:
评测覆盖范围有限:目前仅开源了 ScienceQA 和 DeepSearch 两个数据集,对比 MMLU(57 个主题)、GSM8K(8000+ 题)等成熟基准,题目数量和主题广度尚有差距。对于需要全面能力摸底的开发者,这可能不够充分。
依赖商业 API:评测需要调用各大厂商的商业 API,单次 ScienceQA 评测(169 道题 × 5 次 BoN)成本从数元到数百元不等,缺乏本地模型评测能力,对预算有限的研究者不友好。
中文评测数据不足:ScienceQA 数据集以英文为主,对中文语义理解、多语言场景的评估覆盖较少,限制了其在中文 AI 模型评测中的应用价值。
无容器化支持:项目缺少 Dockerfile 或 docker-compose,跨环境迁移需要手动处理依赖(tqdm、openai、numpy 等),对不熟悉 Python 环境配置的团队有一定门槛。
xbench-evals 的最大贡献,在于将 AI 评测从"刷题竞赛"推向"真实能力验证"。在各大模型纷纷在 MMLU、GSM8K 上突破 90% 准确率的今天,xbench 的 contamination-free 评测思路提醒整个行业:高分不等于强能力。
从榜单来看,o3-high 霸榜 ScienceQA、Claude Opus 4 在 BoN 场景下快速收敛等发现,对模型选型和技术路线决策有实际参考价值。随着数据集和评测维度的持续扩充,xbench 有潜力成为 AI 评测领域的"真实能力基准线"。
克隆仓库并安装依赖:
git clone https://github.com/xbench-ai/xbench-evals.git
cd xbench-evals
pip install tqdm openai numpy
运行 ScienceQA 评测(默认模型:deepseek-v3,5 次 BoN):
python xbench_evals.py --model deepseek-v3 --dataset data/ScienceQA.csv --n-repeats 5
结果自动保存为 {model}_results.csv,包含每题得分、LLM-Judge 解释、avg_score、majority_vote_score、avg_cost、avg_time 等完整指标。