ResearchClawBench
让AI智能体独立做科研:40个真实科学任务 + 两阶段评测,衡量AI能否复现甚至超越人类论文结论
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让AI智能体独立做科研:40个真实科学任务 + 两阶段评测,衡量AI能否复现甚至超越人类论文结论
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你把一份天文观测数据和一篇天体物理学期刊论文交给 AI 智能体,然后问它——「能不能用这批数据,重复出论文里的结论,甚至做得更好?」这不是天方夜谭,而是 ResearchClawBench 正在做的事。
ResearchClawBench 是由 InternScience 团队推出的 AI 智能体(AI Agent)基准测试项目,专门衡量 AI 能否独立开展科学研究——从读取原始数据,到运行实验代码,再到生成带图表的研究报告,最终被一个严格的多模态 LLM 裁判打分评估。整个过程完全自主,无人干预,就像一个真实的科研工作者坐在电脑前一样。
ResearchClawBench 的诞生源于一个深刻的行业洞察:现有 AI 基准测试几乎都在考核「知识储备」和「代码能力」,却没有一个测试能真正衡量 AI 端到端完成科研任务的水平。传统的 MMLU、GSM8K 测的是模型「知道什么」,SWE-bench 测的是模型「会写代码」,但科研工作的核心是:从模糊的问题出发,检索文献、理解数据、设计实验、验证假设、产出成果——这条链路此前无人触及。
团队由来自多所研究机构的科学家组成,他们深知科研工作的复杂性。2026年6月,ResearchClawBench 论文正式在 arXiv 发表(arXiv:2606.07591),并同步在 Hugging Face 发布数据集镜像,迅速吸引了 OpenAI、Anthropic 等头部公司的关注——多个大模型已在官方排行榜上提交了评测结果。
ResearchClawBench 采用独特的两阶段设计。
第一阶段:自主研究(Auto Research)。AI 智能体进入一个沙盒工作区,收到原始数据集、参考文献和任务说明(INSTRUCTIONS.md),随后独立完成数据探索、代码编写、图表生成和研究报告撰写。没有任何提示词(Prompt)的逐步引导,智能体必须自主判断研究方向、选择合适的方法、调试代码、最终输出 report/report.md。
第二阶段:评分裁判(Evaluation)。当智能体完成任务,其研究报告与原始发表论文(Target Paper)一起被送入多模态 LLM 裁判。裁判依据一份精心设计的评分清单(Rubric Checklist)逐项打分,每项包含关键词、权重和评分标准,满分100分,50分代表「与论文持平」,70分以上代表「超越论文」。裁判自动判断使用「目标优化模式」(定量指标对比,如 ROC-AUC、回归误差)或「诊断分析模式」(定性推理深度对比),严格程度堪比真正的学术同行评审。
值得注意的是,排行榜上已有多个模型在部分任务中突破 70 分,意味着 AI 确实可以在特定科学问题上超越人类论文的结论——这在 AI 评测史上尚属首次。
ResearchClawBench 包含 40 个精挑细选的研究任务,涵盖 10 个科学领域,每个领域 4 个任务:
每个任务都由领域专家人工构建:从高影响力期刊论文中提取核心研究问题,设计评分清单,搜集实验数据,再由人类研究员独立复现验证,确保任务可完成、评分标准有据可依。
ResearchClawBench 的另一大特色是对智能体类型完全开放。评测框架内置支持以下智能体:Claude Code(Anthropic)、Codex CLI(OpenAI)、OpenClaw(anomalyco)、Nanobot(HKUDS)、EvoScientist(自进化科学家)、ResearchClaw(内置论文检索和文献综述技能)、LingTai,以及轻量级基线框架 ResearchHarness。
添加新智能体只需修改 evaluation/agents.json 一个 JSON 文件,无需改动核心代码。智能体通过统一的 <PROMPT> 占位符接收相同的研究任务指令,框架本身不介入智能体的决策过程——真正做到公平对比。
后端基于 Flask 构建,通过 Server-Sent Events(SSE)实现实时流传输——用户在 Web UI 上可以实时看到智能体在写代码、跑程序、生成图表的全过程。核心评估逻辑封装在 evaluation/score.py 中,调用多模态 LLM(GPT-5.1 等)作为裁判,对研究报告进行逐项评分。
evaluation/run_task.py 负责工作区初始化和智能体子进程管理,evaluation/config.py 管理路径和常量配置,evaluation/cli_eval.py 则提供命令行批量评测能力,支持并发运行、重复试验和自动计分,可输出 Markdown 格式的评测报告。
依赖生态以 Python 为主:flask>=3.0(Web 服务)、openai>=1.0(LLM 裁判接口)、researchharness>=0.0.48(轻量级评测基线)、openpyxl(处理数据文件)、PyYAML(CLI 配置)、structai(评分引擎)。
ResearchClawBench 并非完美。首先,评测结果高度依赖裁判 LLM 本身的能力和提示词质量——裁判自身的偏见可能影响分数公正性。其次,50分「与论文持平」的判定标准存在主观性:不同论文的质量参差不齐,「持平」本身并不等价于「高质量」。第三,所有任务来自已发表的论文,AI 智能体可能通过记忆训练数据「作弊」而非真正推理,团队尚未在评测中明确处理这一问题。
此外,该框架目前没有 Docker 支持,用户需要手动安装 Python 依赖和至少一个 AI Agent CLI,配置 LLM 评分密钥,对非技术用户门槛不低。
ResearchClawBench 的出现标志着 AI 评测从「知识问答」向「科研创造」的范式转移。排行榜数据显示,GPT-5.4、Claude-Opus-4.8、Gemini-3.5-Flash 等头部模型在部分任务上已稳定超越论文基线,而 50-70 分区间仍是大多数模型的瓶颈——这为 AI+Science 研究提供了清晰的能力坐标和进步方向。
更值得关注的是,ResearchClawBench 是首个将「超越人类论文」设为明确评测目标的开源基准。从「复现」到「超越」,这条路线的开放,意味着 AI 在科研领域的真正突破可能比大多数人的预期来得更快。