data-to-paper
从原始数据到可验证论文:多角色 AI Agent 协作完成端到端科研写作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
从原始数据到可验证论文:多角色 AI Agent 协作完成端到端科研写作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一位生物信息学研究人员,花了数月时间完成数据采集与清洗,终于得到了有意义的结果图表。然而,从图表到一篇结构完整的科研论文——文献综述、研究动机、实验设计、结果解读、结论升华——还需要再耗费数周甚至数月的写作时间。这期间还要反复调整格式、核对引用、追溯数据来源。更棘手的是,当同行评审提出修改意见时,往往需要回过头去修改分析代码,再重新跑一遍,这个来回过程既繁琐又容易出错。
data-to-paper 正是为解决这个「最后一公里」问题而生的。它是一个完全自主运行的 AI Agent 框架,能够从「裸数据」出发,自动完成从探索性分析、文献调研、假设生成,到代码编写、统计分析,再到 LaTeX 论文写作的全流程——最终输出一份**可反向追溯(backward-traceable)**的完整科研论文。

图1:data-to-paper 框架标识(来源:GitHub)
data-to-paper 来自以色列理工学院(Technion)的 Kishony Lab,这是一个以微生物进化和系统生物学研究闻名于世的实验室。该项目诞生于 2023 年,由 Roy Kishony 教授(进化生物学权威,Nature、Science 多篇顶刊作者)及其团队开发。核心理念于 2024 年以论文形式发表在 NEJM AI 杂志(DOI: 10.1056/AIoa2400555),论证了 LLM 驱动的端到端科研自动化可行性。
开源至今(2026年6月),已收获 806 Stars、93 Forks,说明该方向已引起学术界和 AI 社区的广泛关注。
data-to-paper 不是单一的大模型调用,而是一套精心设计的多角色 Agent 协作流水线。其核心架构包含三类 Agent:
1. 科研 Agent(Research Agents) 负责数据分析的规划与决策。这类 Agent 会首先审视原始数据,理解数据结构,然后规划分析路径——选择什么样的统计方法、构建什么样的可视化图表、如何解读显著性结果。它们更像是一位经验丰富的博士后研究员,而不是一个简单的代码生成器。
2. 编程 Agent(Coder Agents) 负责代码的编写与执行。当科研 Agent 决定需要做某个统计检验或生成某个图表时,编程 Agent 负责编写 Python 代码(依赖 pandas、numpy、scipy、scikit-learn 等),并在沙箱中执行。如果代码报错,Debugger Agent 会自动介入修复,形成一个写代码→执行→报错→调试→重试的闭环,直到代码成功运行出结果。
3. 写作 Agent(Writer Agents) 负责科研论文各章节的撰写。写作 Agent 不是简单地将分析结果拼接到模板里,而是会先进行文献调研(调用 Semantic Scholar API),理解该领域的研究现状,然后从数据中挖掘有价值的科学故事。每一段落、每一个数字都能追溯到其「出生地」——来自哪一行代码、哪个数据文件。

图2:人类研究者在 data-to-paper 流程中的角色定位(来源:GitHub)
data-to-paper 最引人注目的创新点在于数据链条(Data Chaining)机制。传统 AI 生成内容最大的问题在于「幻觉」——AI 可能凭空编造一个统计数字。但在 data-to-paper 中,每个数值都有唯一的来源链:
论文中的某个 p 值 → 对应统计分析代码 → 原始数据文件
读者点击论文中任意一个数字,即可反向追溯到生成它的代码行,再追溯到原始数据。这种透明性极大地提升了 AI 生成论文的可信度,也让同行评审过程有据可查。该团队专门发布了一个 data-chaining DEMO 视频 演示这一特性。
| 层次 | 技术选型 | 说明 |
|---|---|---|
| Agent 框架 | 自研 base_steps 系统 | 基于对话的状态机驱动,最大文件达 29KB |
| LLM 驱动 | OpenAI API (GPT-4) | 通过 openai==0.27.8 调用,tiktoken 做 token 计数优化 |
| GUI | PySide6 | 提供桌面交互界面,非 Web 端 |
| 科学计算 | numpy, pandas, scipy, scikit-learn, statsmodels, matplotlib | 全套科学 Python 生态 |
| 文档生成 | Jinja2 (LaTeX 模板) + pandoc | LaTeX 模板渲染生成 PDF 论文 |
| 文档解析 | PyMuPDF | 从 PDF 中提取文本做数据溯源 |
| 图数据库 | networkx | 用于管理数据血缘图谱 |
data-to-paper 的安装流程需要跨越多个依赖层次:
第一步:安装核心包
pip install data-to-paper
第二步:安装 LaTeX 环境
apt-get install texlive-latex-base texlive-latex-extra texlive-fonts-recommendedbrew install --cask mactex-no-gui第三步:配置 API Key
export OPENAI_API_KEY=sk-xxx # 必需
export SEMANTIC_SCHOLAR_API_KEY=xxx # 必需
export DEEPINFRA_API_KEY=xxx # 可选
第四步:验证
data-to-paper-chkres
完成后运行 data-to-paper,即可通过 PySide6 图形界面启动研究流程。项目不提供 Docker 支持,也没有 docker-compose.yml,整体部署需要手动配置环境,对于不熟悉 LaTeX 安装的研究者有一定门槛。
data-to-paper 代表了一种新兴的 AI 科研范式:Autonomous LLM-Driven Research。它不仅仅是提升效率的工具,更是在探索一个根本性问题:当 AI 能够自主完成从数据到论文的全流程时,科研工作者的角色将如何演变?
从技术演进看,该项目体现了三个重要趋势:
| 场景 | 建议 |
|---|---|
| 初次尝试 | 先用 pip install data-to-paper + 官方 DEMO 数据跑通全流程 |
| 深度使用 | Clone 源码,了解 src/data_to_paper/base_steps/ 中的 Agent 状态机逻辑 |
| 扩展开发 | 参考 src/data_to_paper/code_and_output_files/ 的数据追溯机制,自定义中间产物 |
| 生产使用 | 建议准备专用 OpenAI API Key 账号,做好用量监控 |