ChemCoTBench
IDEA-XL/ChemCoTBench加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

ChemCoTBench 官方介绍图 — 展示 ChemCoTBench 作为首个大规模化学推理基准测试的核心定位
想象一下:你是一家药企的化学研究员,手头有一个候选药物分子,需要预测它能否顺利溶解在血液中、是否对特定靶点有活性、合成它需要什么反应条件……这些问题,资深化学家也需要翻阅文献、反复实验才能回答。那么,大语言模型(LLM)能做到吗?
这正是 ChemCoTBench 要回答的问题。
LLM 在数学、代码、常识问答等领域已经刷新了无数基准测试的 SOTA 成绩。但在化学领域,事情没那么简单。
化学不是单纯的知识记忆——它需要逐步推理:从分子结构出发,理解官能团的电子效应、预测反应活性位点、计算理化性质、规划合成路线……每一步都依赖对化学规律的深刻理解,而不是简单的模式匹配。
现有的化学 LLM 评测基准(如 MML-Chem、ChemBench)主要考察的是知识问答能力——给定一个问题,LLM 能否给出正确答案。但化学的真实挑战从来不是问答,而是面对一个陌生分子时,能否像真正的化学家一样,拆解问题、逐步推理、给出合理预测。
ChemCoTBench 正是在这个空白处落子:由 IDEA-XL 团队(鹏城实验室关联研究团队)发布,是首个专注于分步化学推理(step-wise reasoning)的大规模 LLM 基准测试,于 2025 年 5 月在 arXiv 发表。
ChemCoTBench 的构建流程严谨而庞大,这是它区别于一般化学 QA 数据集的核心优势。
数据规模:项目团队从 PubChem 等公开化学数据库中获取了 200 万原始分子样本,经过质量筛选、SMILES 标准化、覆盖度评估,最终生成了近 2 万条高质量思维链(Chain-of-Thought)评测样本。
四大核心任务类型:
这一任务矩阵几乎涵盖了化学家在日常工作中最核心的推理场景——难怪项目团队将 ChemCoTBench 定位为"Beyond Chemical QA"(超越化学问答)。
ChemCoTBench 的评测框架兼顾了通用性和专业性。
对于大多数任务(SMILES 理解、官能团计数、逆合成预测等),项目采用标准的 NLP 评测指标(精确匹配、F1 分数、BLEU 等),确保评测结果可与其他基准对比。
对于需要生成分子结构的任务(如分子编辑、分子优化),项目引入了化学领域专用指标:Tanimoto 相似度(衡量生成分子与目标分子的结构相似性)、QED 分数、JNK3/GSK3b/DRD2 活性预测评分等。这些指标由 RDKit 化学信息学库和预训练 oracle 模型(如 RDKit 分子优化 oracle)提供计算支撑。
项目提供了 5 个交互式 Jupyter Notebook Demo,覆盖分子编辑评测、分子优化评测、分子理解评测和反应预测评测的完整流程,用户可以直接下载运行,评估自己微调或提示的 LLM 表现。
ChemCoTBench 的代码库结构清晰,以 baseline_and_eval/ 为核心评估目录:
eval/ 子目录包含 4 个评测模块:eval_metric.py(通用指标)、eval_moledit.py(分子编辑)、eval_molopt.py(分子优化)、eval_molund.py(分子理解)evaluator.py 是统一的评测入口脚本oracle/ 目录包含预训练 oracle 模型权重(DRD2、JNK3、GSK3b 的活性预测模型 + FP-Scores 分子指纹库)logs/ 目录存储了各任务的评测日志和样本数据项目依赖 RDKit(开源化学信息学库,处理 SMILES 解析、分子编辑、性质计算)、Transformers + PyTorch(加载和推理 LLM),以及 pandas、numpy 等基础工具库。无 Docker 配置,不支持容器化部署。
ChemCoTBench 的目标用户是有化学背景或对化学 AI 感兴趣的研究者。上手门槛不算低:
好消息是,项目提供了可直接运行的 Jupyter Notebook Demo,官方 ArXiv 论文也有详细的方法论说明,对研究者非常友好。
ChemCoTBench 也有值得关注的局限性:
LICENSE 文件,商用前需确认oracle/drd2_current.pkl 等),这些 oracle 本身的精度会影响最终评测结果的可信度ChemCoTBench 的出现,折射出一个明确的行业趋势:LLM 的化学推理能力正在从"知识问答"向"任务规划与执行"演进。
过去一年,AlphaFold3、MoA(Mixture of Agents)、化学 Agent 等方向持续火热,大模型在化学领域的应用正在从辅助阅读文献扩展到自主进行分子设计、反应规划、药物优化。ChemCoTBench 为这一进程提供了可量化的刻度尺。
从增长角度看,化学 + AI 是一个相对小众但增长确定的赛道——药物发现、新材料研发、催化剂设计等领域对 AI 的需求正在释放。ChemCoTBench 作为该领域少数高质量基准测试之一,有望成为化学 LLM 评测的事实标准之一。
项目信息