AI-Scientist-v2
首个AI自主完成论文全流程并被学术Workshop接收的开源系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个AI自主完成论文全流程并被学术Workshop接收的开源系统
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025 年,一个令整个学术界震动的事件发生了:ICLR Workshop 接收了一篇完全由 AI 从零自主撰写的科研论文。这篇论文从提出研究假设、设计实验方案、运行代码验证、分析实验结果,到最终撰写成完整的 LaTeX 论文并通过同行评审——整个过程没有一个人类执笔一个字。这篇论文的背后,是一个名为 AI Scientist-v2 的开源系统,由日本 AI 研究机构 Sakana AI 开发并开源。
在此之前,"AI 写论文"更多是一个概念性演示或玩具项目。但 v2 的出现彻底改变了这个局面:它证明了在机器学习领域,AI 已经可以从空白开始,独立完成一个从想法到论文的完整科研闭环。这不是对人类研究的模仿,而是真正的、从零到一的科研自动化。
AI Scientist-v2 并非横空出世。Sakana AI 此前已发布了 v1 版本,该版本在论文生成任务上已经展现了不错的效果——它可以自主完成机器学习实验并写出论文。然而,v1 有一个根本性的局限:它依赖人类预先写好的论文模板骨架。用户必须先提供一个 LaTeX 模板,AI 只是在模板的框架内填充内容。换句话说,v1 更像是"填空题高手",而不是真正的研究者。
v2 的核心突破在于彻底摆脱了这一依赖。与 v1 不同,v2 从一个空白状态出发:用户只需要提供一个高层研究主题描述(可以是"我想研究大语言模型的长上下文注意力机制"这样的宽泛描述),AI Scientist-v2 会自主完成剩下的全部工作——包括自己想研究什么假设、怎么设计实验、实验代码怎么写、结果怎么分析、论文怎么组织。
这种从"填空"到"创作"的跨越,是通过一个叫做渐进式 Agent 树搜索(Progressive Agentic Tree Search) 的机制实现的。系统像一个有经验的研究员一样,先广泛探索多个可能的研究方向,再逐步深入最有潜力的方向,最终收敛到一篇结构完整、论据充分的论文。
如果你还是觉得难以想象,可以这样理解:AI Scientist-v2 像是一个 24 小时不知疲倦的微型 AI 实验室实习生。这个"实习生"具备以下能力:
当你告诉它研究方向后,它会先用大型语言模型做文献调研,结合 Semantic Scholar 数据库,头脑风暴出 10-20 个值得探索的研究想法,并评估每个想法的新颖性。然后,它会为每个有潜力的想法设计实验——写 PyTorch 代码、在真实数据集上运行训练和评估、捕捉报错并自动调试。实验完成后,它会生成 matplotlib 可视化图表,并撰写完整的 LaTeX 论文。最后,它还会模拟同行评审,从评审人视角指出论文的不足之处。
整个过程中,这个"实习生"不需要你监督。你可以在第二天早上醒来,看到一叠完整的实验日志、一份 PDF 论文,以及一份模拟评审报告。根据官方数据,完整运行一次的成本约为 20-25 美元(使用 Claude 3.5 Sonnet 进行实验 + GPT-4o 写作),而完成这些工作对一个人类研究员来说可能需要数周。
AI Scientist-v2 的技术核心是最佳优先树搜索(Best-First Tree Search, BFTS)——这是一个在 AI 规划领域广泛使用的搜索算法,Sakana AI 将其引入科研自动化场景,并进行了深度定制。
传统的穷举式搜索会在每个节点展开所有可能的方向,很快就会遇到指数级爆炸。BFTS 则不同:它有一个"实验管理器 Agent",负责评估每个研究方向的价值分数,并始终优先扩展最有潜力的节点。同时,系统以并行方式探索多个分支(默认配置为 4 个并行 worker),大幅加速搜索过程。
整个流程分为多个递进式阶段:
Stage 1(想法生成与实验设计):Agent 基于用户提供的宏观研究主题,使用 LLM 生成具体的研究假设,并设计对应的实验方案。这一阶段会生成多个"根节点",代表不同的研究方向。
Stage 2(代码实现与执行):每个实验节点调用 LLM 编写 PyTorch 代码,尝试实现假设中的实验。代码会在沙箱环境中实际运行,如果出现错误,系统会捕获 traceback 并反馈给 LLM 进行自动调试(最多 3 次重试)。
Stage 3(结果评估与选择):对运行结果进行统计分析,评估实验是否有效支持研究假设。表现不佳的节点会被剪枝放弃,优质节点进入下一阶段。
Stage 4(可视化与论文撰写):为选定的实验生成图表,并调用专门的写作 Agent 将所有内容组织成结构化的 LaTeX 论文,包括摘要、引言、相关工作、方法、实验、结论等完整章节。
Stage 5(模拟同行评审):使用 VLM(视觉语言模型)对论文进行评审,模拟学术会议的审稿流程,给出分数和改进建议。
值得注意的是,v2 借鉴了 AIDE(Automated Incremental Discovery Engine)的树搜索实现框架,并在此基础上加入了 Sakana AI 团队自研的多模型协同机制。不同任务阶段使用不同模型:实验阶段主力是 Claude 3.5 Sonnet(编程能力最强),写作阶段使用 o1-preview,评审阶段使用 GPT-4o。这种"让专业模型做专业事"的策略显著提升了各阶段的质量。
AI Scientist-v2 是一个纯命令行工具,没有图形界面。对于习惯图形化操作的用户来说,初始上手需要一定适应时间。但项目提供了极为详尽的文档——README 超过 13000 字符,涵盖安装、配置、运行命令、FAQ,以及多篇参考论文。
部署方面,系统对硬件有较高要求:需要 NVIDIA GPU(CUDA 12.4+)和充足显存,官方建议至少 16GB VRAM。整个安装流程涉及 conda 环境配置、PyTorch CUDA 版本安装、LaTeX 工具链(chktex、poppler)配置,以及多个 API Key 的设置。对于没有深度学习环境配置经验的用户,首次部署可能需要数小时。
不过一旦环境就绪,使用逻辑就相对清晰了:用户只需准备一份 Markdown 格式的研究主题描述文件,然后依次执行两个脚本——perform_ideation_temp_free.py 生成研究想法,launch_scientist_bfts.py 启动完整流水线。实验过程的所有日志和树搜索可视化(HTML 格式)都会保存在 experiments/ 目录下,可实时追踪搜索进度。
必须指出,AI Scientist-v2 并非万能。官方文档中有大量篇幅描述系统的局限性:
首先,v2 并不总是比 v1 更好。v1 在有高质量模板的任务上成功率高,结构规范;v2 的探索性更强,但也意味着更多失败分支。对于目标明确的研究任务(如"在这个模型架构上做消融实验"),v1 可能更合适;对于开放性探索,v2 更有优势。
其次,LLM 生成并执行代码存在固有安全风险。AI Scientist-v2 会实际运行 LLM 生成的 Python 代码。官方警告:这些代码可能安装危险包、访问外部网络或启动意外进程。项目强烈建议在 Docker 容器等沙箱环境中运行,而不要直接在宿主机上执行。这是负责任 AI 开发的体现,但也反映了系统的内在风险。
第三,论文的原创性和深度仍有争议。AI 生成的研究,本质上是对已有工作的重新组合与改进,而非真正的概念突破。AI Scientist-v2 生成的论文能否通过顶级会议严格的人类同行评审,目前证据仍然有限。
AI Scientist-v2 的出现,是 AI for Science 浪潮中具有里程碑意义的事件。它与 DeepMind 的 AlphaFold(蛋白质结构预测)、GNoME(材料发现)、ChemCrow(化学合成规划)等项目,共同描绘了一幅宏大愿景:AI 不只是辅助工具,而是能独立完成科研全流程的"研究者代理"。
尽管距离真正的"通用 AI 科学家"仍有相当距离,但 v2 已经证明了在特定领域(机器学习)内,从想法到论文的完整科研链路可以被有效自动化。对于资源有限的学术团队,AI Scientist-v2 提供了一个极具价值的快速研究探索平台——可以低成本验证想法的可行性,在短时间内迭代大量实验设计,大幅加速早期研究阶段。
更深远的意义在于:它迫使我们重新思考科研的核心价值。当 AI 能自主写论文、被学术 workshop 接收,"提出想法"与"验证想法"哪个更重要?当验证环节也被自动化后,人类研究者的角色将如何重新定义?这些问题没有标准答案,但 AI Scientist-v2 已经让我们不得不直面它们。