RD-Agent
微软研究院开源的 AI 自动化研发框架,让 AI 自主完成数据挖掘→模型训练→实验迭代全链路
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
微软研究院开源的 AI 自动化研发框架,让 AI 自主完成数据挖掘→模型训练→实验迭代全链路
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
凌晨两点,某实验室的研究员小王盯着屏幕——他刚刚手动跑了第 47 次数据清洗,第 3 版模型调参结果还没整理完,而论文 deadline 就在下周。这就是 AI 时代科研人的真实处境:嘴上说着要 AI 赋能,手里却干着最原始的体力活。
R&D-Agent 的出现,像是一位不知疲倦的 AI 实习生——它能自动完成数据挖掘、模型训练、实验迭代整个链路,让「AI 驱动数据驱动的 AI」真正落地。
图1:R&D-Agent 框架 Logo
R&D-Agent 由**微软研究院(Microsoft Research)主导开发,是其 AI for Science 战略的重要组成部分。项目最初聚焦于量化金融场景(Qlib)**的自动化研究,随后快速扩展到数据科学、Kaggle 竞赛、强化学习等多个领域。
截至目前,该项目在 GitHub 已收获超过 13,000 颗星,成为 MLE-bench(机器学习工程智能体基准测试)榜单的第一名——这意味着它比市面上所有 AI 编程助手更擅长搞定真实的机器学习工程任务。
传统 AI 开发流程中,数据准备、特征工程、模型选型、训练优化、结果分析等环节都需要人工干预。R&D-Agent 的设计哲学是将这一整条链路自动化,让 AI 智能体扮演「研究员」的角色,从问题定义到方案产出一气呵成。
其核心架构包含几个关键组件:
**Evolving Framework(演化框架)**是整个系统的大脑。它不是让 AI 一次生成一个方案就完事,而是像真正的科研人员一样,根据实验结果不断反思、改进方案。每一轮实验的结果会被记录、分析,形成知识积累,下一轮设计时会参考历史经验。
**Proposer(提案器)**负责提出研究假设和实验方案。它能理解任务目标,参考类似问题的已有解法,生成候选方案供后续验证。
**Coder(编码器)**是执行者,负责将提案转化为可运行的代码,实现数据处理、模型构建、训练脚本等。
**Runner(运行器)**负责执行实验、收集指标、管理计算资源。它能与 Slurm、Local 等多种执行环境对接。
**Interactor(交互器)**处理与外部系统的交互,包括读取数据源、调用 API、管理文件 IO 等。
**Evaluator(评估器)**对比实验结果,筛选最优方案,决定是否继续迭代。
R&D-Agent 的场景支持非常全面,目前已实现:
| 场景 | 说明 |
|---|---|
| Kaggle 竞赛 | 自动化参赛流程,涵盖数据探索→特征工程→模型搭建→提交的全流程 |
| 数据科学 | 通用数据分析和机器学习任务自动化 |
| Qlib 量化 | 微软自家的量化投研平台集成,支持金融数据挖掘 |
| 强化学习 | RL 任务的自动化训练和超参搜索 |
| 微调(Fine-tune) | LLM 微调流程自动化 |
| 通用模型 | 不限定领域的通用 AI 模型研发 |
图2:R&D-Agent 系统架构总览
打开项目代码,第一感受是工程化程度极高。它用 mypy 做类型检查(disallow_untyped_defs = true),ruff 做代码规范(120 字符行宽),coverage 要求 80% 以上,有 pre-commit hooks,还有完整的 CI 流水线(CodeQL 安全扫描)。这不是一个实验性 demo,而是一个生产级项目。
Runner 层支持多种执行环境:本地 Local 环境直接运行、Slurm 高性能计算集群(对需要 GPU 的训练任务尤为重要)、Docker 容器化隔离执行。无论你是个人开发者用笔记本跑实验,还是团队用超算集群批量训练,R&D-Agent 都能适配。
项目自带一个 Vue 3 + Element Plus 构建的 Web 管理界面,通过 Streamlit 托管。研究员可以在浏览器里查看实验进度、可视化结果、管理任务队列,不必 SSH 到服务器看日志。
图3:R&D-Agent Web UI 演示
这是最硬核的背书。MLE-bench 是 OpenAI 发布的基准测试,用 75 个真实 Kaggle 竞赛评估 AI 智能体的机器学习工程能力。R&D-Agent 在 Medium 和 High 难度赛道上均取得领先,综合成绩排名第一,击败了包括 Claude 等在内的众多强劲对手。
图4:MLE-bench 基准测试结果
普通用户一行命令搞定:
pip install rdagent
开发者模式也很简洁:
git clone https://github.com/microsoft/RD-Agent
cd RD-Agent
make dev
主要依赖包括:
没有 Docker 支持是最大的遗憾。README 明确说明「RD-Agent currently only supports Linux」,但没有提供容器化部署方案。对于追求环境隔离的生产部署,这是一个障碍。
此外,必须提供 LLM API Key(OpenAI 或兼容接口),这是一笔持续的成本。虽然也支持本地模型,但效果可能打折扣。
R&D-Agent 之所以引发关注,不仅仅是因为它是 SOTA,更因为它代表了一种从「人写 AI 代码」到「AI 写 AI 代码」的范式转变。
在传统的 AutoML 方案中,自动化通常止步于超参搜索或模型选择。而 R&D-Agent 尝试的是端到端的科研自动化——从理解问题、提出假设、编写代码、运行实验到分析结果,全部由 AI 完成,人只需要设定目标。
从增长曲线看,R&D-Agent 的 star 数量在 2025-2026 年间呈现快速上升态势,与其技术报告发布和 MLE-bench 霸榜的时间节点高度吻合。可以预见,随着 AI 基础设施的成熟,这类工具的数量和质量都会继续攀升。
R&D-Agent 是目前最成熟的 AI 自动化研发框架之一,代表微软在 AI for Science 领域的深厚积累。它将 AI 智能体从「聊天机器人」提升到「研究助手」的层次,工程化程度高、场景覆盖广、MLE-bench 成绩硬核。适合有 Python 基础、熟悉机器学习流程、愿意尝试前沿工具的研究者和开发者。
如果你厌倦了在 Jupyter Notebook 里一遍遍复制粘贴数据处理代码,或者在实验室里手动管理实验记录,这款工具值得一试——毕竟,谁不想拥有一个 24 小时不睡觉的 AI 研究员呢?