NewtonBench
首个系统评估LLM在交互式物理环境中发现科学定律能力的基准测试,涵盖12个领域324个任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个系统评估LLM在交互式物理环境中发现科学定律能力的基准测试,涵盖12个领域324个任务
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你被扔进了一个陌生的宇宙——那里的物理定律可能和地球完全不同,但逻辑依然自洽。你不知道牛顿定律是否成立,不知道引力是否与距离平方成反比。你唯一能做的,是设计实验、收集数据、归纳规律。
这正是 NewtonBench 要问的核心问题:最强的大语言模型(LLM),能否在这样的环境中重新"发现"科学定律?
这不是一道考试题,而是一场真正的科学探索挑战——没有任何教科书可以查阅,没有任何网络可以搜索,AI 必须像真正的科学家一样思考。

图1:NewtonBench 框架总览——从交互式实验到定律发现的完整评测流程
科学定律的发现,是人类智识最伟大的成就之一。从牛顿发现万有引力,到开普勒归纳行星运动三定律,科学家们通过观察、假设、实验、验证的循环,逐步揭开自然的奥秘。
近年来,GPT-4、Claude、Gemini 等大语言模型展现出惊人的"知识回忆"能力——它们能背诵物理公式、解微分方程、通过医师资格考试。但回忆 ≠ 发现。一个能背出牛顿定律的 AI,是否真的理解物理?它能否在定律未知的情况下,通过实验数据归纳出来?
这不仅是学术问题。如果 AI 要真正成为"AI Scientist",它必须具备从数据中发现规律、提出新假设的能力。NewtonBench 正是为了系统地评估这种能力而诞生的。
把 NewtonBench 想象成一个精密的"盲盒实验装置"。科学家(LLM)可以向这个装置发送实验请求,比如"给我做一个引力实验:质量 m1=2 kg,质量 m2=3 kg,距离 r=5 m,测一下力是多少"。装置返回一个数据点。AI 可以反复实验,每次设计不同的参数,最终从数据中猜出背后的数学公式。
但这里有一个关键设计:盲盒中的物理定律可能和现实不同。比如真正的引力公式是 F = G·m1·m2/r²,但盲盒里的宇宙可能用 F = G·m1·m2/r³,或者 F = G·m1·m2/(r² + c)(加了修正项)。这叫"形而上学位移"(Metaphysical Shift),是防止 AI 靠"记忆"作弊的关键。
NewtonBench 构建了 324 个科学定律发现任务,覆盖 12 个真实的物理学领域:
| 模块 | 物理领域 | 涉及定律 |
|---|---|---|
| m0 | 万有引力(Gravitation) | 牛顿万有引力定律 |
| m1 | 库仑力(Coulomb Force) | 电荷间相互作用 |
| m2 | 磁场力(Magnetic Force) | 磁偶极子相互作用 |
| m3 | 热传导(Fourier's Law) | 热传导方程 |
| m4 | 斯涅尔定律(Snell's Law) | 光折射 |
| m5 | 放射性衰变(Radioactive Decay) | 指数衰变 |
| m6 | 欠阻尼谐振动(Underdamped Harmonic) | 阻尼振动 |
| m7 | 马吕斯定律(Malus's Law) | 偏振光强度 |
| m8 | 声速(Sound Speed) | 声波传播 |
| m9 | 胡克定律(Hooke's Law) | 弹性力学 |
| m10 | 玻尔兹曼分布(Boltzmann Distribution) | 统计力学 |
| m11 | 热传递(Heat Transfer) | 辐射与对流 |
每个任务有两个难度维度:

图2:NewtonBench 任务设计——12 个物理领域 × 3 种难度 × 3 种系统复杂度
NewtonBench 提供两种 Agent 模式:
LLM 只能通过对话与系统交互:
<run_experiment> 标签请求实验LLM 可以写 Python 代码来:
有意思的是,研究发现代码辅助对不同能力的模型效果截然相反:
这被论文称为"悖论性的工具效应"(Paradoxical Tool Effect)——更强的模型拥有更好的"直觉",代码辅助反而干扰了它的思考流程。
评估采用符号等价性判断:将 LLM 提交的 Python 函数与真实公式的 SymPy 表达式进行符号比较,而非简单的数值匹配。这能防止通过改变变量名或数学恒等变换来"作弊"。
论文对 10+ 个主流 LLM 进行了评测,关键结论:
前沿模型(GPT-5、Gemini-2.5-pro)展现出明显但不稳定的定律发现能力,准确率在简单任务上可达 60-70%,但随着系统复杂度提升急剧下降。
极端的噪声敏感性:即使在数据中加入 0.0001 级别的极小噪声,准确率也会下降 13-15%——说明现有模型对数值精度极度脆弱。
复杂系统是核心瓶颈:当系统涉及多个变量、干扰因素叠加时,所有模型的发现准确率都低于 20%。
已被 NVIDIA NeMo Gym 收录:2026 年 2 月,NewtonBench 正式集成到 NVIDIA NeMo Gym 作为强化学习环境,这意味着它不仅是一个评测基准,更是一个训练场景。
NewtonBench 是一款纯命令行工具,无 Web 界面。安装流程:
git clone https://github.com/HKUST-KnowComp/NewtonBench.git
cd NewtonBench
pip install -r requirements.txt
cp .env.example .env
# 编辑 .env,填入 OPENAI_API_KEY 或 OPENROUTER_API_KEY
python quick_start.py
进阶使用(运行完整评测):
# 单模型评测
python run_experiments.py --model_name gpt-4o --parallel 8
# 全模型批量评测
python run_master.py --parallel 8
# 结果分析
python result_analysis/summarize_results.py
硬件需求:纯 CPU 即可运行(无 GPU 依赖),建议 8GB+ RAM,数据盘占用约 1GB。
NewtonBench 揭示了当前 LLMs 的重大局限,但也存在一些值得关注的争议点:
NewtonBench 不仅仅是一个评测基准,它指向了 AI 发展的一个关键方向——从"知识回忆"到"科学发现"。论文已被 ICLR 2026 接收,并获得 NVIDIA NeMo Gym 的官方支持,说明学术界和工业界都在关注这个方向。
随着模型能力的提升,我们可以期待未来的 AI 不仅能解题,还能提出新假设、设计新实验、推动科学边界的拓展。NewtonBench 为这个目标提供了一个可量化的起点。
数据来源:GitHub HKUST-KnowComp/NewtonBench,MIT License,ICLR 2026 论文(arXiv:2510.07172)