PaperOrchestra
让 AI Coding Agent 自动撰写学术论文的多智能体技能包,零 API Key 依赖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让 AI Coding Agent 自动撰写学术论文的多智能体技能包,零 API Key 依赖
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
对于 AI 研究者而言,最痛苦的时刻往往不是跑通模型、调通代码——而是实验做完之后,要在一到两周的deadline压力下,把散落在各个文件夹、Slack对话、Notion笔记里的实验数据整理成一篇结构完整、引用规范的学术论文。大多数研究者在这个阶段浪费的时间,足够再做两轮消融实验。
PaperOrchestra 正是为了解决这个痛点而生。这是一个基于 Google 论文 arXiv:2604.05018 的开源实现,它将论文写作拆解为「构思→绘图→文献综述→章节撰写→内容精炼」五步多智能体流水线,并将其打包为一套 AI Coding Agent 技能包(Claude Code、Cursor、Antigravity、Cline、Aider 等均可使用)。开发者无需配置任何 API Key、无需引入任何 LLM SDK——只要把技能包安装到本地 AI Coding Agent,它就能在你的实验日志和原始材料基础上,自动生成一篇符合会议投稿规范的 LaTeX 论文。
PaperOrchestra 的核心是一套严格遵循论文原文设计的多智能体协作架构。整个流水线分为七个技能模块:
第一步:Outline Agent(大纲规划)——输入你的研究想法和实验日志,输出一个结构化的 JSON 大纲,包含绘图计划、文献综述计划和各章节计划。这是整个流水线的大脑,只消耗 1 次 LLM 调用。
第二步:Plotting Agent(图表生成)——根据大纲中的绘图计划,自动调用图表生成工具(如 PaperBanana 或 matplotlib)绘制论文所需的所有图表,并撰写图注。每张图表还会经过 VLM 批判回路进行质量审查,确保学术规范。这一步通常消耗约 20-30 次 LLM 调用。
第三步:Literature Review Agent(文献综述)——通过 Web 搜索找到相关论文,再经由 Semantic Scholar API 进行模糊匹配验证(Levenshtein 相似度 > 70%),最终生成包含完整引用的 Introduction 和 Related Work 章节。引文整合率要求达到 90% 以上。同样约 20-30 次 LLM 调用。
第四步:Section Writing Agent(章节撰写)——这是流水线中效率最高的一步,仅需 1 次多模态 LLM 调用,即可完成 Methods、Experiment、Conclusion 等剩余章节的撰写,同时自动从实验日志构建表格并嵌入图表。
第五步:Content Refinement Agent(内容精炼)——模拟同行评审,对已生成的章节进行多轮修订,接受或回退每一处修改。遵循严格的停机规则,防止过度优化导致偏离原始研究内容。这一步约 5-7 次 LLM 调用。
第二步和第三步可以并行执行,这是 PaperOrchestra 论文中的关键效率优化。
PaperOrchestra 最大的设计哲学亮点是 「零 API Key、零 LLM SDK」。整个技能包只包含三类文件:
所有真正的 LLM 推理和 Web 搜索都 委托给宿主 AI Coding Agent 完成。这种设计彻底规避了「集成多个 API」带来的复杂性——用户只需要配置好自己 Coding Agent 的模型(比如 Claude Code 使用 Claude 模型),技能包本身不需要任何 API 配置。
另一个值得关注的设计是 agent-research-aggregator(研究聚合器)。这是流水线的预处理模块,专门解决「研究材料散落各处」的问题。它支持从 Claude Code 记忆、Cursor 聊天历史、Antigravity worker 日志、OpenClaw 会话等多种来源自动聚合实验数据,分四阶段(发现→提取→合成→格式化)生成 PaperOrchestra 标准输入文件。这意味着,即使用户从未刻意记录实验日志,PaperOrchestra 也能从 AI Coding Agent 的工作缓存中还原出完整的科研叙事。
PaperOrchestra 面向的是已经使用 AI Coding Agent 的开发者群体,因此安装方式采用了「符号链接到 Agent 技能目录」的思路,而非传统 pip 包模式:
git clone <repo> ~/paper-orchestra
pip install -r requirements.txt # 确定性辅助库(jsonschema, python-Levenshtein, matplotlib 等)
bash setup.sh # 自动将技能符号链接到 ~/.claude/skills/ 等位置
之后,只需告诉你的 Coding Agent「Run the paper-orchestra pipeline on ./workspace」,它便会自动执行完整流水线。
可选集成包括:Semantic Scholar API Key(提升文献检索速率上限)、PaperBanana(高质量论文图表生成,需 Gemini 或 OpenRouter Key)、Exa 搜索(高级文献发现)。这些均为可选优化,不影响核心功能。
硬件需求极低:无 GPU 要求,4GB 内存、2GB 磁盘即可运行。
PaperOrchestra 的能力上限高度依赖宿主 AI Coding Agent 的模型能力。如果宿主模型在数学推理、学术写作或代码执行方面较弱,生成的论文质量也会受到明显限制。
此外,论文生成遵循「Garbage In, Garbage Out」原则——实验日志越完整、结构越清晰,输出质量越高。对于没有保留实验记录习惯的研究者,agent-research-aggregator 虽然能部分补救,但还原效果仍不及精心维护的实验日志。
另一个潜在风险是「AI 撰写论文」的学术伦理边界。虽然 PaperOrchestra 生成的是初稿需要人工审阅和修订,但学术社区对 AI 生成内容的使用规范仍在持续讨论中,投稿前需明确了解目标会议/期刊的相关政策。
PaperOrchestra 代表了一个重要趋势:AI 正在从论文写作的「辅助工具」进化为「端到端流水线」。它不仅是单个 Agent 的能力展示,更展示了一种多智能体分工协作的工程化路径——Outline Agent 规划、Plotting Agent 视觉化、Literature Review Agent 补全背景、Section Writing Agent 批量生成、Content Refinement Agent 质量把控,每个环节各司其职。
从工程角度看,PaperOrchestra 的「技能包」设计也值得借鉴。它将复杂的 AI 行为规范封装为标准化的 SKILL.md 格式,使得这类能力可以在不同 AI Coding Agent 之间无缝迁移,推动了 AI Agent 生态的插件化发展。