Biomni
Stanford 通用生物医学 AI Agent,集成 150 工具 + 59 数据库,自主执行 G
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Stanford 通用生物医学 AI Agent,集成 150 工具 + 59 数据库,自主执行 G
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:Biomni 官方 Logo — 由 Stanford SNAP 实验室出品
想象一下:一位生物医学科学家,面对堆积如山的文献、数据和实验工具,往往要花上几周时间才能把一个研究想法从脑海变成可验证的假设。光是查文献、整理数据、写代码跑分析,就耗尽了大部分精力。Stanford 大学 Jure Leskovec 教授团队说:"科学进步的瓶颈不是智力,而是机械性的重复劳动。" 于是,他们造出了 Biomni——一个能够全流程自主执行生物医学研究任务的 AI Agent。
传统的 AI 助手(如通用大模型聊天机器人)只能"回答问题",而无法真正"执行"科学工作流。当研究人员想验证一个假设时,往往需要:检索 PubMed/bioRxiv 上万篇文献、从 GWAS Catalog 提取基因变异数据、调用 Ensembl/UniProt 数据库查询基因功能、写 Python 脚本跑单细胞 RNA-seq 分析、生成可视化图表……这些步骤分散在十几个不同的工具和网站中,没有任何单一系统能够串联起来。
2025 年 5 月,Stanford SNAP 实验室联合 Genentech、Arc Institute、华盛顿大学、普林斯顿大学、UCSF 等顶尖机构,发布了 Biomni——一个通用型生物医学 AI Agent,能够像真正的研究员一样,自主规划和执行完整的生物医学研究工作流,从文献阅读、假设生成,到代码编写、数据分析、结果解释,全部在自然语言交互中完成。
"如果把 Agent 比作木匠,那木匠没有工具就只是一个能说话的人。Biomni 给这个木匠配备了一套完整的工具,让它真正能建造东西。" — Jure Leskovec 教授,Stanford 计算机科学系
Biomni 的核心架构分为两层,这种分层设计是其通用性的关键所在:
E1 是整个系统的基础设施层。 研究团队从 bioRxiv 上 2500 篇全文论文中,通过 AI 自动挖掘,提取并整合了 25 个生物医学子领域的计算资源,构建了一个统一的"生物医学动作空间":
| 资源类型 | 数量 |
|---|---|
| 专业化生物工具 | 150 个 |
| 软件包 | 105 个 |
| 数据库 | 59 个 |
覆盖的领域包括:遗传学、基因组学、细胞生物学、生理学、微生物学、药理学、生物工程、生物物理学、分子生物学、病理学等几乎所有主要生物医学子方向。每个工具都有标准化的描述文档(Schema),LLM 可以根据用户问题动态检索和选择合适的工具组合。
A1 是执行层,运行在 E1 环境之上。 它采用了 ReAct(Reason + Act)范式,将复杂任务分解为"推理-行动-观察-再推理"的循环:
from biomni.agent import A1
agent = A1(path='./data', llm='claude-sonnet-4-20250514')
agent.go("Plan a CRISPR screen to identify genes regulating T cell exhaustion")
A1 的核心决策机制包括三个部分:
用户上传 GWAS 汇总统计数据,用自然语言提问:"找出与乳腺癌相关的因果基因。" Biomni 会自动:检索 OpenTargets、GWAS Catalog 等数据库 → 用 Bayesian colocalization 方法进行因果推断 → 交叉验证多种证据 → 输出带文献引用的基因列表和置信度评分。
agent.go("Perform scRNA-seq annotation at [PATH] and generate meaningful hypothesis")
Biomni 自动识别细胞类型标记基因、参考已注释数据集、生成 UMAP 可视化和差异表达分析,并推断各细胞类型的生物学功能假设。在 EMBL-EBI 的单细胞数据集上,Biomni 对 DbQA(数据库问答)达到 74.4% 准确率,在 SeqQA(序列问答)上达到 81.9%,均超过人类专家水平(74.7% / 78.8%)。
要求 Biomni 设计 CRISPR 编辑方案,克隆 sgRNA 靶向人类 B2M 基因到 lentiCRISPR v2 Blast 质粒。Biomni 输出完整 protocol,包括转染细胞系选择、筛选策略、Sanger 测序验证方案。经 wet-lab 验证,所有步骤均正确执行,测序确认 sgRNA 插入完美对齐。
用户上传 30 位受试者的 458 个原始 Excel 文件(连续血糖监测、饮食记录、体力活动数据),Prompt:"分析这些数据,找出有趣的假设。"
| 指标 | Biomni | 人工估算 |
|---|---|---|
| 耗时 | 40 分钟 | 60+ 小时 |
| 发现 | 餐后平均核心体温升高 2.19 摄氏度,个体间响应差异显著 | — |
Biomni 完成了数据清洗、统一格式、生成可视化图表、发现生物学规律的全流程。
Biomni 核心代码用 Python 开发(>=3.11),主要依赖:
| 类别 | 依赖库 |
|---|---|
| Agent 框架 | langgraph==0.3.18、langchain 系列 |
| LLM 集成 | langchain-anthropic、langchain-openai、langchain-ollama |
| Web UI | gradio>=5.0,<6.0(支持 Gradio 6.x 时需降级) |
| 科学计算 | numpy、pandas、scipy、scikit-learn、matplotlib |
| 生物学工具 | tooluniverse、mcp |
代码质量规范相当严格:使用 Ruff 进行 linting,支持 F/E/W/I/B/C4/BLE/UP 等 12 类规则,并配置了 .pre-commit-config.yaml 自动化检查。项目使用 Pytest 测试框架,并提供了详细的贡献指南(CONTRIBUTING.md),体现出较高的工程成熟度。utils.py 单文件超过 1100 行,涵盖环境描述、工具管理、数据下载等核心逻辑,经过仔细的格式化和类型规范约束。
biomni/tool/ 目录下按生物医学子领域分类(生物化学、生物工程、生物物理学、癌症生物学、细胞生物学、遗传学、基因组学、免疫学、微生物学、分子生物学、病理学、药理学、生理学、系统生物学等),每个领域都有对应的 Schema 数据库(Pickle 格式的索引)和工具函数描述,共计 65 个文件,结构清晰、职责明确。
Biomni 同时提供两种使用方式:
Gradio Web 界面:一行代码启动本地可视化界面,适合不想写代码的研究人员。
agent.launch_gradio_demo() # 启动 http://localhost:7860
Python API:适合集成到现有研究工作流或批量处理。
支持自定义 LLM 提供者(Anthropic Claude、OpenAI GPT-4o、Azure OpenAI、Google Gemini、Groq、本地 Ollama,以及通过 SGLang 部署的本地 Qwen-32B 模型 Biomni-R0)。
Biomni 官方在 README 中明确标注了几点重要风险:
安全警告:当前版本的 Biomni 以完整系统权限执行 LLM 生成的代码,能够访问文件、网络和系统命令。在生产环境中使用时,务必在隔离沙箱环境中运行,避免处理敏感数据或暴露凭证。
依赖冲突:部分 Python 包因依赖冲突未预装(如某些高级分析库),需手动安装并取消代码注释。详见 docs/known_conflicts.md。
Web UI 验证码:Gradio 默认访问码为 Biomni2025,生产部署时应修改。
预印本状态:初始版本发表在 bioRxiv(未经同行评审),2026 年 7 月已在 Science 发表正式版本,但开源代码仓库的某些模块可能与最新平台版本存在差异。
截至 2026 年 7 月,Biomni 的原型平台已被 10,000+ 实验室采用,成为生物医学领域使用最广泛的 AI 协作者系统。研究团队正在推进 Biomni-E2(下一代生物医学动作空间)建设,面向社区开放工具贡献,重大贡献者将受邀成为论文共同作者。
此外,团队还发布了 Biomni-R0(基于 Qwen-32B 的推理模型,专为生物医学任务优化,可通过 SGLang 本地部署)和 Biomni-Eval1(包含 433 个评估实例、覆盖 10 类生物推理任务的基准测试)。
Biomni 代表了一个重要趋势:AI Agent 正从"回答问题"进化到"执行任务",在需要精确性、可重复性和多工具协作的科学研究领域,这种转变的潜力尤为显著。
数据来源:Stanford University News (2026.07)、bioRxiv (doi:10.1101/2025.05.30.656746)、GitHub snap-stanford/Biomni