SGI-Bench
科学通用智能评测基准:让大模型像科学家一样完成「深思→构想→行动→感知」全流程探究
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
科学通用智能评测基准:让大模型像科学家一样完成「深思→构想→行动→感知」全流程探究
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:一位天体物理学家正在分析詹姆斯·韦伯望远镜的最新数据,她需要检索数百篇论文,提取关键参数,设计一套验证实验,最后用 Python 模拟观测结果。这不是任何一道标准化考试题,而是真实的科学工作。
2025 年 12 月,上海交大 InternScience 团队发布了 SGI-Bench(Scientific General Intelligence Benchmark),提出一个根本性问题:当前最强大的大语言模型(LLM),能否像真正的科学家一样,从提出假说到设计实验完成科学探究的全流程?
这个问题的重要性远超学术意义。随着 GPT-5、Claude Sonnet、Gemini 等模型不断刷新各项基准测试分数,简单的问答类评测(如 MMLU、HellaSwag)已无法区分模型能力——强者几乎满分,评测形同虚设。SGI-Bench 的出现,正是要为 AI 时代的科学能力评测建立一套真正有区分度的标准。
图1:SGI-Bench 全景概览 —— 覆盖科学探究全周期的四大任务家族
SGI(Scientific General Intelligence)不是又一个人工智能新概念包装,而是有明确定义的能力体系:AI 系统能否像人类科学家一样,自主导航科学探究的完整迭代循环——深思(Deliberation)、构想(Conception)、行动(Action)、感知(Perception)。
这个框架根植于 Practical Inquiry Model(实用探究模型),将科学视为一个将知识检索、创意形成、行动执行和结果解读串联起来的循环过程。SGI-Bench 则把这个抽象框架具体化为四个可量化的任务家族,每个家族对应科学家日常工作的一个侧面。
图2:SGI-Bench 评测框架 —— 四大任务家族与 Practical Inquiry Model 的对应关系
评测数据是任何基准测试的灵魂。SGI-Bench 的数据构建过程极为严苛,团队从《科学》(Science)杂志的"125 个重大科学问题"出发,跨越 天文学、化学、地球科学、能源、信息科学、生命科学、材料科学、数学、神经科学、物理学 十大领域,由 100 多名硕士和博士研究生参与原始语料收集与问题构建,全程有领域专家把关质量。
数据清理阶段采用"规则 + 模型 + 人工 QA"三重复核机制,确保每道题目都有唯一正确答案且在真实环境中可执行。为了维持评测区分度,还刻意过滤掉了被超过 50% 强模型解答出的样本——这保证了 SGI-Bench 不会像某些基准那样轻易被刷到接近满分。
最终成果:1000+ 专家标注样本,覆盖范围之广、标注质量之高,在科学 AI 评测领域尚属首次。
图3:十大领域分布与科学家对齐的数据构建流水线
模拟科学家在开始新课题时的文献调研阶段。模型需要针对复杂的多跳问题(如"过去 5 年内,关于 CRISPR 基因编辑在治疗镰刀型细胞贫血症方面的临床试验进展如何?"),执行多轮网络检索,交叉验证多个信息源,生成结构化的元分析报告。评测指标为 Exact Match(EM) 和 Step Level Accuracy(SLA),后者用于评估推理链的中间步骤是否正确。
这是 SGI-Bench 最具挑战性的任务。模型需要针对给定科学问题生成创新性研究方案,评测维度涵盖 有效性(Effectiveness)、新颖性(Novelty)、详细程度(Detailedness)和可行性(Feasibility),由 LLM 评判器(基于 GPT-4o)打分。这项任务没有标准答案,评测的是模型产生真正有价值科学假说的能力。
给定实验过程图、观测数据可视化或模拟截图,模型需要理解图像内容并进行科学推理,选择正确答案。评测指标为 Multi-Choice Accuracy(MCA) 和 Reasoning Validity(RV)。这个任务验证的是模型的多模态科学理解能力——现实中科学家每天都在和图表、显微镜照片、光谱图打交道。
SGI-Bench 的评分系统本身就是一个 Agent 工作流,分为四个阶段:问题选择 → 指标定制 → 预测与评测 → 报告生成。这不只是为了炫技,而是有深刻的工程考量:
评测工具池包括:Web 搜索、PDF 解析器、Python 解释器、文件读取器和指标函数,支持灵活扩展自定义科学家对齐指标(如严谨性、可行性、安全性、成本)。
图4:Agentic 评测框架的四个阶段与工具池
SGI-Bench 还包含一个创新亮点——TTRL(Test-Time Reinforcement Learning,测试时强化学习)。对于开放式的"构想"任务,传统评测无法提供地面真值(ground truth),TTRL 引入在线强化学习机制:
这意味着 SGI-Bench 不只是评测工具,更是一套可导向更好结果的评测方法论——评测与优化相结合,是科学 AI 研究的新范式。
图5:TTRL 训练过程中的 GRPO 奖励曲线,新颖性(Novelty)随训练稳步提升
SGI-Bench 的评测结果揭示了一些令人惊讶的结论:构想(Idea Generation)是目前最强的能力,GPT-5 系列在此项得分高达 55+;深思(Deep Research)普遍偏低(最高 18.48/100),说明 AI 在深度多跳科学推理方面仍有显著短板;没有模型在所有维度全面领先,Gemini-3-Pro 综合最强(33.83),但 GPT-5 系列在开放式创意任务上更具优势。
开源模型与顶级闭源模型差距超过 14 分(Qwen3-8B 仅 19.15 vs Gemini-3-Pro 的 33.83),这既是挑战也是机会。
对于想亲自评测模型的开发者,SGI-Bench 的部署流程需要准备 Python 3.13.7 主环境和 Python 3.10.18 子任务环境(用 Conda 管理),依赖约 72 个 pip 包。需要配置 OpenAI API Key 或兼容端点(支持 vLLM 等自托管模型),以及 HuggingFace Read-Only Token 访问评测数据集。值得注意的是,SGI-Bench 并未提供 Docker 容器化部署,对于希望快速复现评测结果的团队增加了配置复杂度。
SGI-Bench 并非完美,存在几个值得关注的局限性:评判器依赖——构想任务的评分完全依赖 GPT-4o,存在"模型偏好偏差";数据更新滞后——科学知识快速更新的领域可能存在时效性问题;湿实验模拟——目前仅靠序列相似度评分,无法验证协议的实际可操作性;跨语言挑战——评测数据以英文为主,中文科学场景的覆盖度尚未评估。
SGI-Bench 的出现,标志着科学 AI 评测进入了一个新阶段——从"会不会做这道题"升级到"能不能像科学家一样工作"。它揭示了一个关键事实:当前最强的大模型在开放式科学推理方面仍然很弱,而这恰恰是 AI 辅助科研最具价值的应用场景。
未来,随着 VLMEvalKit 和 SciEvalKit 对 SGI-Bench 的集成,以及 TTRL 方法的推广,科学 AI 的评测与优化将形成闭环——不只是知道差距在哪里,还能系统性地弥合差距。