discoveryworld
首个 AI 科学发现虚拟实验室,120 个挑战任务评估 Agent 端到端科研能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个 AI 科学发现虚拟实验室,120 个挑战任务评估 Agent 端到端科研能力
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象这样一个场景: 一位 AI Agent 身处一间虚拟实验室,面对一块来历不明的古代陶器。它需要综合运用放射性碳14测年法、化学成分分析、文献检索等多种手段,在有限的步数内推断出陶器的制作年代和来源——这不是科幻,而是 DiscoveryWorld 正在测试的核心能力。
真实世界的科学实验成本高昂、周期漫长,且很多发现具有不可逆性。对于 AI 研究者来说,如何系统性地评估 Agent 的「从零开始做科研」能力,长期缺乏标准化的测评工具。
DiscoveryWorld 由艾伦人工智能研究所(Allen Institute for AI,Ai2)于 2024 年发布,被接受为 NeurIPS Datasets and Benchmarks 2024 Spotlight 论文。它是首个专为评估 AI Agent 完成端到端科学发现能力而设计的虚拟环境,前身是 2022 年发布的 ScienceWorld(测试基础科学实验能力)。

DiscoveryWorld 是一个基于 Python + Pygame 构建的 2D 网格世界虚拟环境,模拟了一个可以进行多学科科学研究的数字实验室。Agent 以文本观测(text observation)作为输入,通过 API 与环境交互,执行各类科学动作,最终产出可量化的发现成果。
核心交互机制:
系统架构:
Agent (HypothesizerAgent / RandomAgent / RECOMA)
│ Observation (文本)
▼
┌─────────────────────────────────────┐
│ DiscoveryWorldAPI.py │
│ · handleAction() │
│ · getObservation() │
│ · getScore() │
└─────────────────────────────────────┘
│
▼
┌─────────────────────────────────────┐
│ DiscoveryWorld 虚拟环境核心 │
│ · Layer.py(世界层) │
│ · ObjectMaker.py(科学对象) │
│ · ScienceHelpers.py(科学计算) │
│ · ScenarioMaker.py(场景生成) │
└─────────────────────────────────────┘
DiscoveryWorld 包含 8 大科学主题 × 3 个难度级别 = 120 个挑战任务:

图1:当前最强 Agent 在各难度级别下的表现(可见 Challenge 难度对所有模型都是巨大挑战)
DiscoveryWorld 提供了三类自动化评分指标,衡量 Agent 科学发现的不同维度:

图2:DiscoveryWorld 自动评分卡样例
项目自带三类基准 Agent,帮助研究者快速上手评测:
| Agent | 类型 | 说明 |
|---|---|---|
| RandomAgent | 随机基线 | 随机选择动作,作为最基础的性能参照 |
| HypothesizerAgent | GPT-4 驱动 | 基于 GPT-4 的假设生成 Agent,理解任务后逐步探索 |
| RECOMA | React/Plan&Execute | 来自 Ai2 内部的 React + 计划执行框架基线 |
其中 RECOMA(Reasoning-Communicating Agents)支持两种推理模式:
核心文件规模(反映代码复杂度):
| 文件 | 规模 | 职责 |
|---|---|---|
| DiscoveryWorldAPI.py | ~17KB | Agent 与环境交互的统一接口 |
| ScenarioMaker.py | ~21KB | 场景/任务参数化生成器 |
| Agent.py | ~30KB | Agent 基类与核心逻辑 |
| HypothesizerAgent.py | ~30KB | GPT-4 假设生成实现 |
| ScienceHelpers.py | ~8KB | 各学科科学计算辅助函数 |
# 克隆仓库
git clone https://github.com/allenai/discoveryworld.git
cd discoveryworld
# 安装依赖
pip install -e .
# 设置 API Key
export OPENAI_API_KEY=sk-...
# 运行默认 Agent
python scripts/analysis.py --difficulty Normal --task_theme "Space Sick"
项目还提供了 userstudy 脚本,支持招募人类受试者在相同环境中进行对照实验,直接对比人类科学家与 AI Agent 的表现差异。
根据 Ai2 官方博客(2024-2025)的数据:
这意味着 DiscoveryWorld 成功捕捉到了当前 AI 在「自主科学发现」领域的核心瓶颈——不是知识储备不足,而是假设生成→实验设计→多步推理→结论验证的完整科学方法论的缺失。
DiscoveryWorld 并非孤立存在。Ai2 同期还推出了 CodeScientist——一个能自主生成实验代码并执行端到端科学发现的 AI 系统,在虚拟环境中产出了 19 项有意义的发现,其中 6 项经专家验证符合科学新颖性标准。这条路线上还有 The AI Scientist、Agent Laboratory 等竞品,共同构成了「AI for Science」生态的探索前沿。

图3:艾伦人工智能研究所
总结: DiscoveryWorld 是 AI 科学发现能力评估领域的里程碑式工具,它用结构化的虚拟环境填补了「AI 能否像科学家一样思考」这一核心问题的测评空白。尽管当前最强模型在 Challenge 难度下完成率仅约 20%,但这个差距本身就给整个研究社区指明了方向——当 AI Agent 能在 DiscoveryWorld 上稳定达到 70% 的人类基线时,我们或许就真正迈入了 AI 驱动科学发现的时代。