autoresearch
给 Claude Code 装上永不停歇的改进引擎——设定目标,AI 自动跑实验迭代代码
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
给 Claude Code 装上永不停歇的改进引擎——设定目标,AI 自动跑实验迭代代码
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:你对 AI 编程助手下达一个目标——「把这个函数的运行速度再提升 10%」——然后安心去睡觉。第二天醒来,Claude Code 已经自主跑了上百次实验,自动测试每一种优化思路,保留了真正有效的改进,丢弃了无效尝试。这就是 Claude Autoresearch 正在做的事情。
2026 年 3 月,斯坦福大学教授、前 Tesla AI 总监、前 OpenAI 研究员 Andrej Karpathy 发布了一个仅有 630 行的 Python 脚本 karpathy/autoresearch。这个脚本的核心逻辑极度简洁:一个 AI 代理不断编辑文件、运行 5 分钟的训练任务、测量验证指标、保留有效的改动——如此循环往复。
Karpathy 让自己设计的 AI 跑了整整两天。结果令人震惊:700 次自主实验,发现了 20 个真正有效的优化,包括一个此前从未被注意到的 QKNorm 精度 bug,最终实现了 11% 的训练速度提升——这是在一个已经被专家高度优化过的代码库上取得的成果。
这个结果在 AI 社区引发了连锁反应。人们意识到:AI 编程迭代的关键瓶颈,不是想不出优化方案,而是人类无法以机器的速度去验证和筛选这些方案。一旦把验证过程自动化,AI 的迭代效率将远超人类想象。
Udit Goenka(独立 AI 产品开发者)在看到 Karpathy 的实验后,立刻意识到这个模式的价值远不止于机器学习训练。他把这个「约束 + 机械指标 + 自主迭代」的核心哲学,迁移到了 Claude Code 平台上——这是 Anthropic 官方推出的 AI 编程工具,运行在终端中,能理解整个代码库并通过自然语言指令执行各种编程任务。
2026 年 4 月,Udit 将这套方法论封装为 Claude Code 的 Skill(技能)插件,开源发布。短短数周内,项目获得了超过 4700 颗 GitHub Stars,成为 Claude Code 生态中最受欢迎的生产力插件之一。MIT 许可证,完全开源,支持 Claude Code、OpenCode 和 OpenAI Codex 三大主流 AI 编程工具。
Claude Autoresearch 的设计精髓在于模块化命令体系。每个命令对应自主迭代循环中的一个特定阶段,相互衔接形成完整的工程改进流程:
| 命令 | 功能 | 作用 |
|---|---|---|
/autoresearch: loop | 核心循环 | 指定目标指标后,AI 自动修改→验证→保留/丢弃,循环 N 次 |
/autoresearch: fix | Bug 修复 | 自动化调试循环,定位根因并修复 |
/autoresearch: debug | 根因追踪 | 生成可证伪假设,系统化排查问题 |
/autoresearch: plan | 规划分解 | 将复杂目标拆解为可验证的子任务 |
/autoresearch: probe | 需求探测 | 迭代式提取需求约束,直到饱和 |
/autoresearch: scenario | 边缘用例 | 多维度生成边界场景,测试鲁棒性 |
/autoresearch: predict | 专家预测 | 多专家视角预测代码行为差异 |
/autoresearch: security | 安全审计 | 基于 STRIDE/OWASP 模型系统性查找漏洞 |
/autoresearch: learn | 文档学习 | 从现有文档中提取知识并应用 |
/autoresearch: reason | 逻辑推演 | 多角度辩论,暴露思维盲区 |
/autoresearch: improve | 外部改进 | 搜索行业最佳实践,注入外部知识 |
/autoresearch: ship | 部署发布 | 验证通过后自动推送到生产环境 |
最核心的是 loop 命令——它接收四个参数:Goal(改进目标)、Scope(涉及的文件范围)、Metric(量化指标)和 Verify(验证命令)。一旦设定,Claude Code 就会开始自主实验循环:查看 git 历史找到有效思路,做一次聚焦的代码改动,提交,验证指标是否改善,根据结果决定保留或回滚。整个过程有完整的 TSV 日志记录,git 作为天然的回滚机制。
值得注意的是,v2.0 是一个重大的架构重构版本。此前的 v1 版本使用一个 813 行的单一 SKILL.md 文件,每次调用消耗约 100K tokens。v2 将其拆分为一个 41 行的路由文件加 12 个自包含的子命令文件(每个 94-120 行),每次调用仅消耗 5-8K tokens,Token 消耗降低了 95%,同时保持了功能完整性。
项目采用 TypeScript + Shell 脚本混合架构:
整个项目没有 Python 依赖,没有 Docker,没有重型框架,是一个真正的「轻量级工具包」——只需要目标 AI 编程工具本身。
Claude Autoresearch 的适用范围远超出代码性能优化。根据项目文档,它支持以下场景:
性能调优:函数的执行时间、内存占用、数据库查询速度——任何可以用命令输出的数字来衡量的指标。
Bug 修复:系统化的根因分析循环,不靠直觉猜测,而是通过假设→验证→分类(已确认/已证伪/不确定)来逼近真正的问题。
安全审计:集成 STRIDE 威胁模型和 OWASP 安全检查清单,自动扫描代码中的潜在安全漏洞。
内容与文案:营销文案转化率、产品描述吸引力——配合外部评估工具,可以对文本内容进行自主迭代优化。
DevOps 流程:CI/CD 流水线优化、部署脚本效率改进,只要是能写出验证命令的指标,都可以用 loop 来自动化改进。
相比许多复杂的 AI 框架,Claude Autoresearch 的安装极为简单。如果已安装 Claude Code,只需一行命令:
/plugin marketplace add uditgoenka/autoresearch
/plugin install autoresearch@autoresearch
重启会话后,13 条命令即可使用。OpenCode 和 Codex 用户则需要运行 install.sh 脚本手动配置。没有 GPU 要求,不需要 Docker,在任何能运行 Bash 的机器上都可以工作。
需要坦诚地说明 Claude Autoresearch 的局限。首先,它本质上是 CLI 工具而非 Web 应用,没有图形界面,所有交互通过命令行进行,对于非技术人员存在一定门槛。其次,loop 命令的可靠性高度依赖用户提供的 Verify 命令质量——如果验证命令本身有漏洞,迭代结果将毫无意义。再者,自主迭代在极端情况下可能产生大量无意义的 git 提交,如果没有及时清理,会污染版本历史。
另外值得注意的是,Claude Autoresearch 背后调用的是 Claude API(Anthropic 的商业服务),运行成本取决于迭代次数和上下文长度。对于需要运行成百上千次实验的场景,Token 消耗不可忽视。
Claude Autoresearch 代表了 AI 编程工具演进的一个重要方向:从「人类下达指令、AI 执行」的单次交互模式,向「人类设定目标、AI 自主迭代」的长周期自主模式转变。Karpathy 的实验已经证明,在某些场景下,AI 的迭代效率是人类的数十倍。
这个项目的快速增长(4700+ Stars、13 条命令、95% Token 优化)反映出 AI 开发者社区对这类「元工具」的巨大需求:当 AI 能够使用 AI 工具来改进 AI 工具本身时,研发效率将进入一个全新的量级。
对于希望在团队中推广 AI 编程的开发者来说,Claude Autoresearch 提供了一个极具说服力的切入角度——它不是取代人类的工作,而是成倍放大人类工程师在「判断力」和「创造力」上的价值,把枯燥的重复验证工作交给 AI 完成。
一句话总结:Claude Autoresearch 是给 Claude Code 装上了一个永不停歇的改进引擎——你设定目标,它执行循环,第二天收获成果。