awesome-autoresearch
AI 自主研究生态全景百科,50+ 工具从闭环实验到全自动化科学家一站索引
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI 自主研究生态全景百科,50+ 工具从闭环实验到全自动化科学家一站索引
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:如果 AI 能像一位孜孜不倦的博士生,日夜不停地设计实验、跑代码、分析结果、写论文——但速度是人类的千百倍,会是怎样一幅图景?Awesome Autoresearch 正是这个愿景的"地图",它用一份精心筛选的列表,将 2024 年至今全球开发者在这条道路上留下的足迹一一标注出来。
图1:Awesome Autoresearch 项目 Star 增长曲线(Dark Mode)

图2:Star History 增长曲线(Light Mode)

2024 年,OpenAI 联合创始人、深度学习先驱 Andrej Karpathy 发布了一个仅有 350 行 Python 代码的实验性项目 karpathy/autoresearch。它的核心思想异常简洁:
建立闭环 -> 自动化试错 -> 持续迭代。Agent 读取实验结果,分析失败原因,修改代码或提示词,再次运行实验,效果提升则保留、效果变差则回滚。这个"keep-or-revert"的朴素机制,让一个完全不懂神经网络原理的 AI Agent,也能在数小时内自主将模型的 bits-per-byte 指标优化到领先水平。
Karpathy 将其描述为"给 AI 提供的一套自动化实验基础设施"——本质上,这是一个用 AI 驱动的自动化,来加速 AI 本身进化的元层框架。这个看似简单的想法迅速在开发者社区引发连锁反应,催生了数十个从不同角度延伸这一范式的开源项目。
Awesome Autoresearch 正是在这个时间节点诞生,由独立开发者 AlvinReal(X: @alvinunreal)创建并维护。它不是代码库,而是一部"编年史"——对 autoresearch 生态中的每一个开源项目进行分类、标注、筛选,最终形成一份高信噪比的结构化索引。
这份列表按主题分为七大板块,覆盖了从理论框架到工程落地的完整光谱:
通用型衍生项目(General-purpose descendants)
这是列表中数量最多的板块,包括 recursive-improve(递归自改进框架)、Thoth(仪表盘优先的 Claude Code 运行时)、autocontext(闭环控制平面)、goal-md(目标-评估分离模式)等。这些项目共同构成了 autoresearch 的"工具箱"——每个工具都从不同角度优化或扩展了原始闭环:有的增加了持久化记忆、有的引入了并行实验、有的将评估函数从代码中解耦出来。
特别值得关注的是 GEPA(Genetic-Pareto)——它将进化算法引入提示词优化,在 ICLR 2026 获得了 Oral 论文荣誉。与传统 RL 训练相比,GEPA 用自然语言反思(reflection)作为变异算子,在多个基准测试上超过了 GRPO 等强化学习方法。
研究型 Agent 系统(Research-agent systems)
如果说通用型项目是"扳手和螺丝刀",这个板块则是完整的"工厂流水线"。Sakana AI-Scientist 是其中的标杆性项目——它是第一个从想法生成到论文写作完全自动化的完整系统,涵盖了实验设计、代码实现、结果分析、论文撰写的全链路。
AI-Scientist-v2 则在前作基础上引入了树搜索机制,摆脱了对论文模板的依赖。ARK 项目则采用多 Agent 编排架构,由 6 个专业 Agent 协作完成从想法到论文的全流程。CORAL 系统在 ICLR 2024 发表,提出了多 Agent 异步进化的概念,在 10 个数学/算法/系统任务上取得了 SOTA 表现。
平台移植(Platform ports and hardware forks)
这个板块解决了"我有 Apple Silicon Mac / Windows RTX 显卡 / Jetson 开发板,能跑 autoresearch 吗?"的问题。autoresearch-macos 适配 Apple Silicon,autoresearch-mlx 用 MLX 框架重写以彻底摆脱 PyTorch 依赖,autoresearch-win-rtx 为 Windows 用户提供了明确的环境配置路径。
领域适配(Domain-specific adaptations)
这是最能体现 autoresearch 范式普适性的板块:autovoiceevals 用来优化语音 AI Agent 的提示词,autokernel 用来优化 GPU Kernel,autospec 用自然语言规则自动生成 Spring Boot 服务,autoresearch-sudoku 让 AI Agent 自己改进 Rust 数独求解器并最终超越人类最好成绩。
评估与基准(Evaluation & benchmarks)
MLAgentBench、MLE-Bench、MLR-Bench、AgentBench——这一板块收录了评估 AI Agent 研究能力的标准测试集,是衡量 autoresearch 系统有效性的客观标尺。
Awesome Autoresearch 作为一份文档型项目,其本身并无复杂的代码架构。但从列出的项目中,我们可以提炼出该领域的核心技术模式:
1. 闭环评估(Closed-loop Evaluation):所有成功项目都遵循同一范式——执行 -> 评估 -> 决策(保留或回滚) -> 再次执行。这是 autoresearch 的核心 DNA。
2. 提示词即代码(Prompt-as-Code):在 Claude Code、Codex CLI、Gemini CLI 等 Agent 工具中,autoresearch 被实现为"技能包"(skill),将优化目标、评估函数、执行策略编码为可复用的指令集。
3. 可测量化原则(Measurability Principle):列表中反复出现的格言"If you can measure it, you can optimize it"——autoresearch 的能力边界,由你能定义的评估指标决定。
这是一个知识型资源库,而非可部署的应用程序。因此使用门槛极低:
对于想真正运行 autoresearch 的用户,列表中收录的工具可以从"通用型衍生项目"中挑选——推荐从 Thoth(仪表盘友好)或 pi-autoresearch(功能完整)入手。
作为一份精选列表,Awesome Autoresearch 本身不涉及代码质量争议。但它所代表的 autoresearch 范式,确实存在值得讨论的问题:
Awesome Autoresearch 的价值,不仅在于它筛选出了好项目,更在于它绘制了一幅 Autoreseach 领域的"活地图"——开发者可以沿着地图找到自己感兴趣的方向,直接深入研究。
从增长曲线来看,这个领域的 Star 数量仍在快速攀升,2026 年初已突破 2000+。值得关注的新趋势包括: