AutoR
人机协作的AI研究自动化框架,9阶段结构化流水线驱动,AI执行人类把关
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
人机协作的AI研究自动化框架,9阶段结构化流水线驱动,AI执行人类把关
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:AutoR 两层架构——顶层研究控制循环 + 底层编码 Agent 执行层
在 2023-2024 年间,AI Agent 领域的主流叙事是「让 AI 自主完成一切」——给一个大模型一堆工具,让它自己规划、自己执行、自己反思。OpenAI 的 GPT-4、Anthropic 的 Claude Sonnet 3.7、Deepseek 的 R1,都在卷「自主性」的上限。
但 AutoR 的开发者提出了一个截然不同的命题:研究工作太重要,不能交给一个盲目的端到端循环。他们认为,当前的 AI 自主研究系统有一个根本缺陷——没有人类的「方向感」约束,AI 容易陷入局部最优、在错误的方向上走得很远,同时输出的是「看起来像论文的 markdown」,而不是可复现、可审计的真正研究制品。
AutoR 正是为解决这一矛盾而诞生的。它不追求让 AI 完全替代研究者,而是打造一个以人类为中心的自动化研究操作系统(Research OS)。在这个系统里,AI 负责执行层面的代码编写、文献分析、实验运行、文稿撰写,而人类始终握着方向盘——每个阶段都需要人类批准(human approval)才能进入下一阶段。
想象一个场景:你想研究「Transformer 在遥感图像上的压缩效果」,传统方式是搭环境、写脚本、跑实验、写论文,耗时数周。AutoR 把这个流程自动化了——你输入研究目标,AI 自动规划实验方案、配置基线模型、运行对比测试、生成图表、把结果整理成符合学术期刊格式的论文。而你只需要坐在屏幕前,对每个阶段 say yes 或 no。整个研究过程变成了一张可审计、可复现的磁盘快照(artifact-backed run)。
AutoR 的核心是一个严格结构化的研究流水线,包含 Intake(可选) 和 8 个正式研究阶段:
| 阶段 | 名称 | 说明 |
|---|---|---|
| Intake | 苏格拉底式问题收集 | AI 通过提问厘清研究目标、资源约束 |
| Stage 01 | 假设生成 | 生成可验证的 H1/H2/H3 假设 |
| Stage 02 | 文献综述 | 收集、阅读、对比相关工作 |
| Stage 03 | 实验设计 | 设计对比实验方案 |
| Stage 04 | 代码实现 | 编写/修改实验代码 |
| Stage 05 | 实验执行 | 运行实验、收集结果 |
| Stage 06 | 结果分析 | 统计检验、图表生成 |
| Stage 07 | 论文撰写 | 按目标期刊格式输出 LaTeX 论文 |
| Stage 08 | 最终整理 | 汇总制品、生成研究报告 |
每个阶段的输出都保存在 runs/<run_id>/ 目录下,形成一个完整的研究制品包(artifact bundle)——包含实验代码、原始数据、生成的图表、LaTeX 源码。这意味着:任何一个历史 run,你都可以随时回滚(rollback)、重做某个阶段(redo-stage)或从断点恢复(resume)。
在执行层面,AutoR 采用了双 Operator 架构:
这种解耦设计让 AutoR 不绑定特定模型厂商,用户可以自由切换。Operator 层之上是 Approval Agent——一个自动审查 Agent,在 --full-auto 模式下替代人工审批,对每个阶段的输出进行严格评审,确保质量不因自动化而打折。
1. CLI-first 交互
AutoR 是一款纯终端工具,通过命令行参数驱动。核心入口是 python main.py --goal "你的研究目标",之后整个交互在终端完成。
# 标准研究流程(需人工审批每个阶段)
python main.py --goal "研究 Transformer 在遥感图像压缩中的效果"
# 全自动模式(AI 审查员替代人工审批)
python main.py --goal "..." --full-auto
# 从断点恢复(网络中断后)
python main.py --resume-run <run_id>
# 回滚到某个阶段重做
python main.py --resume-run <run_id> --rollback-stage 05_analysis
终端 UI 提供了彩色进度条、阶段状态展示和交互式输入界面,研究者可以清晰看到当前在哪个阶段、还剩多少阶段。
2. 灵活的 Operator 沙箱
CodexOperator 支持多种沙箱级别(sandbox, restricted, browse, computer-use),允许在安全性和功能完整性之间做权衡。使用 danger-full-access 需格外谨慎,这会授予 AI 对本地文件系统几乎完整的读写权限。
3. 期刊格式输出
Stage 07 论文撰写阶段支持多种学术期刊格式模板(venue profiles),包括 NeurIPS 2025、Nature、Nature Communications、JMLR 等。通过 --venue 参数指定目标格式:
python main.py --venue neurips_2025 # 输出 NeurIPS 格式
python main.py --venue nature # 输出 Nature 格式
生成的输出是标准的 .tex 文件,而非不可复用的 HTML 或 PDF,你可以直接用 LaTeX 编译器生成最终论文。
4. Gemini 图表生成
通过 --research-diagram 参数,AutoR 会在论文撰写完成后调用 Google Gemini API 自动生成方法示意图,并插入 LaTeX 论文中。生成的图表(如神经网络的结构图、实验流程图)属于高价值的辅助制品。
适合的场景:
局限性:
AutoR 的出现代表了 AI 研究自动化领域的一个新流派——「约束自动化」(Constrained Automation)。
此前,研究自动化有两条路:一条是「完全自主」(代表性工作:AutoGPT、LangChain Agents),追求让 AI 自己决定做什么;另一条是「模板填充」(代表性工作:HumanEval 自动评测、EleutherAI 的 LM Harness),基于固定模板做填空题。AutoR 走出了第三条路:用强结构约束 AI 的行为边界,同时保留 AI 的执行能力。
具体来说,AutoR 的阶段门禁(stage gate)机制——每个阶段必须人类批准才能推进——本质上是一种「可控爆炸」的设计哲学。AI 获得执行权,但人类保留否决权。这在需要严谨性的科研场景中,比纯自主系统更有说服力。
从增长曲线来看,AutoR 在 2024 年底开始活跃开发,目前 859 stars,虽然规模不大,但它切入了一个真实的痛点:「如何让 AI 帮我做科研,而不是帮我写营销文案」。随着 Claude 4、GPT-5 等更强大编码模型的出现,AutoR 这类工具的实用价值会持续提升。
图2:AutoR 终端 UI 界面,展示研究流水线阶段进度
总结:AutoR 是一个面向 AI 研究者的命令行研究操作系统,通过 9 阶段结构化流水线把人机协作嵌入每一个研究步骤。它不是用来替代研究者,而是给研究者配了一个「永不出错、执行力超强的研究助理」。如果你厌倦了在 Jupyter Notebook 里手动跑实验、在 Overleaf 里反复调格式,AutoR 值得一试。