autoresearch
让AI agent通宵自主调参,次日收获更优语言模型的自动驾驶训练框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让AI agent通宵自主调参,次日收获更优语言模型的自动驾驶训练框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:周五下班前,你给AI agent发了一条指令——"去研究一下怎么把nanochat的训练速度提上来,有进展叫我"。然后你回家睡觉了。周六早上你揉着惺忪的睡眼打开电脑,发现AI agent在过去的10个小时里跑了23次实验,生成了23份实验记录日志,其中某次实验的val_bpb(验证集每字节比特数,越低越好)比你手动调的还低了0.003。
这不是科幻,这是Andrej Karpathy在2026年3月开源的 autoresearch——一个让AI agent自主做LLM训练研究的极简框架。
过去三年,AI前沿研究发生了根本性转变:曾经靠人类研究员在会议室里用"肉做的计算机"(meat computers,即人脑)讨论、在白板上推公式的日子一去不复返。如今的研究背后是算力集群中自主运转的AI agent集群。这种趋势催生了一个新问题:谁来做AI研究的研究?
Karpathy给出的答案是:让AI自己来做。 autoresearch的核心理念是把AI研究员从重复性实验中解放出来,同时把"研究方向"和"实验节奏"这两件事解耦——人类负责定义研究目标(写program.md),AI负责在实验空间里搜索最优解(改train.py、跑训练、评估结果)。
把autoresearch想象成一个不用睡觉、不会偷懒、对5分钟训练时间毫无怨言的超级实习生。你给他一份instructions(program.md),告诉他"去试试把attention head的数量从6改成8,看看val_bpb能不能降低"。他就老老实实改代码、跑训练、看结果、记录日志,然后根据结果决定下一步尝试什么。
唯一的规则:val_bpb降低就是好结果,就这么简单。
autoresearch的代码库极小(只有4个核心文件),但覆盖了完整的自主研究流程:
prepare.py(固定不变)
train.py(agent唯一可修改的文件)
program.md(人类唯一修改的文件)
训练指标:val_bpb(validation bits per byte)
autoresearch明确要求一块NVIDIA GPU(已在H100上测试),并推荐使用Python 3.10+和uv包管理器。安装流程简洁:
curl -LsSf https://astral.sh/uv/install.sh | sh
uv sync
uv run prepare.py # 下载数据+训练分词器(约2分钟)
uv run train.py # 单次训练(约5分钟)
数据准备阶段会从HuggingFace下载约6543个parquet分片(climbmix-400b-shuffle),验证集固定为最后一个分片。整个过程中无需分布式训练、无需复杂配置,单GPU、单文件、单指标,设计极为克制。
如果想在MacBook等更小算力设备上运行,Karpathy在README中给出了详细的参数调优指南:降低DEPTH(从8降到4)、缩小vocab_size(从8192降到256的字节级分词)、缩短MAX_SEQ_LEN(从2048降到256),目前已有多个社区fork支持macOS(Metal)、Windows(RTX)、AMD ROCm等平台。
autoresearch目前存在几个明显局限:
硬件依赖严重。 虽然作者有意保持代码简洁,但单GPU限制意味着它无法直接用于大规模训练实验。目前已在H100上测试,对RTX 4090/3090等消费级GPU的兼容性缺乏系统测试。
研究空间有界。 agent只能修改train.py这一个文件,architecture search的边界受限于文件内定义的变量。虽然理论上可以通过修改program.md来扩展agent能力,但目前缺乏成熟的"元研究"最佳实践。
时间预算设计有争议。 固定5分钟时间预算虽然保证了单次实验内的公平性,但也意味着更大的模型在5分钟内能完成的更新步数更少,实验结果与硬件强相关,不同人之间无法直接比较。
缺乏正式测试。 代码库中没有任何测试套件,实验质量完全依赖val_bpb这一个指标,存在过拟合评估指标的风险。
autoresearch的意义不在于它能训练出多好的模型,而在于它验证了一个方向:把"研究方向"从"执行节奏"中解耦出来,人类负责定义问题,AI负责穷举求解。
这种模式代表着AI研究自动化的第一步:不再是"人+AI协作编程",而是"人类设定目标、AI自主执行整个研究闭环"。随着算力成本下降和模型能力提升,类似的autoresearch可能会演变为AI科学家的"沙盒"——在受控环境中,AI可以24小时不间断地探索模型架构、优化器设计、数据配方的组合空间,而人类只需要定期审核实验日志,决定是否调整研究方向。
开源社区已经做出了回应:不到一个月,macOS Metal版本、AMD ROCm版本、Windows RTX版本相继出现,说明社区对这种"可移植的AI研究框架"有强烈需求。这预示着autoresearch可能成为AI研究的"Hello World"——不是生产级别的训练框架,而是每个AI研究生都值得跑一遍的入门实验。