VenusFactory2
AI蛋白质工程智能体平台,自然语言驱动40+模型完成突变预测、功能分类、数据库查询和模型微调
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI蛋白质工程智能体平台,自然语言驱动40+模型完成突变预测、功能分类、数据库查询和模型微调
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你是一位刚进入实验室的生物研究员,面对一个从未见过的蛋白质序列,想要预测它的功能、突变后的稳定性,或者直接设计一个全新的蛋白质变体——传统做法需要翻阅大量文献、手动运行多个独立工具、反复调整参数,整个过程可能耗费数周。而 VenusFactory2 的出现,就像给实验室配备了一位不知疲倦的 AI 助手:你只需用自然语言描述需求,它就能自动编排 40 多个 AI 模型和 11 个生物数据库,完成从数据获取到结果分析的全流程。
VenusFactory2 由上海交通大学梁晓晖教授团队(AI4Protein Lab)开发,团队长期专注于蛋白质语言模型(Protein Language Model, PLM)的研究与落地应用。2025年4月,团队开发的 VenusREM 在 ProteinGym 和 VenusMutHub 两大权威基准上双双取得第一,验证了其模型在突变效应预测上的领先能力。2026年1月,集成了 ICLR 2026 接收的 VenusX 模型,进一步强化了零样本突变评分能力。
项目的核心驱动力是降低 AI 蛋白质工程的门槛。蛋白质语言模型虽然已在学术圈广泛应用,但普通生物学家面对命令行、模型权重管理、多工具串联等复杂操作时往往望而却步。VenusFactory2 正是为了弥合这一技术与应用之间的鸿沟而生——无论你是否会写代码,都能通过 Web 界面完成专业级蛋白质分析任务。
VenusFactory2 采用典型的分层模块化架构,从底层到顶层依次为:
资源层(Resources):整合 40+ 蛋白质语言模型(PLM)和 11+ 生物数据库。模型涵盖主流预训练架构,包括 Meta AI 的 ESM 系列(8M ~ 15B 参数)、AI4Protein 自研的 Venus/ProSST/PETA 系列,以及 ProtBert、ProtT5、Ankh 等业界标杆模型。数据库涵盖 AlphaFold 结构库、RCSB PDB 蛋白质结构库、UniProt 蛋白数据库、KEGG 代谢通路库、BRENDA 酶数据库等。
工具层(Tools):9 大工具类别共 40+ 工具模块,分为 Mutation(突变效应预测)、Predict(功能分类预测)、Database(数据库查询下载)、Search(文献与专利检索)、Train(模型微调训练)、File(文件格式转换)、Denovo(全新蛋白质设计)、Discovery(蛋白质发现)、Visualize(结构可视化)。每个工具均封装为 MCP(Model Context Protocol)兼容的服务端点,支持 Agent 以标准化方式调用。
应用层(Application):封装为 Train(训练)、Eval(评估)、Predict(预测)、Tools(工具调用)四大业务模块,通过统一的 Python API 暴露。
Agent 层(Agent):基于 LangGraph + LangChain 构建的 Agent-0.1 智能体,是整个平台的大脑。用户以自然语言提出复杂任务(如"为 PDB:1ABC 设计热稳定性提升的突变"),Agent 自动拆解为多步骤计划,依次调用 RCSB PDB 下载结构 → ESM-2 扫描突变 → 稳定性评分 → 生成排序报告,全程无需人工干预。
接口层(Interfaces):支持三种交互方式——Web UI v2(FastAPI 后端 + React 前端,推荐)、Web UI v1(Gradio 旧版)、REST API(/docs 自动生成 Swagger 文档)、CLI(shell 脚本直接调用)。
这是 VenusFactory2 最核心的功能之一。用户上传蛋白质序列或 PDB 结构文件,指定若干突变位点(如 A23V、K45R),系统会综合 ESM-1v、ESM-2、ProSST、ProtSSN 等多个模型的结果,给出每个突变的ΔΔG稳定性评分。以 ESM-2 为例,其 650M 参数规模的模型在 ProteinGym 基准上已接近实验精度,配合零样本评分能力,1 分钟内即可完成一个蛋白质的全面突变扫描。
平台集成了 30+ 经过微调的专用模型,覆盖酶活性分类(EC Number)、基因本体论注释(GO BP/CC/MF)、亚细胞定位(DeepLoc 系列)、溶解度预测(DeepSol/eSOL)、膜蛋白分类等常见任务。每个模型背后都对应经过精心整理的基准数据集(部分来自 ProteinGym,部分来自团队自建数据)。预测速度因模型规模而异,ESM2-8M 轻量模型 < 5 秒,ESM2-3B 大模型约 30 秒。
对于有特殊需求的实验室,平台支持 7 种 PEFT(参数高效微调)方法:LoRA、QLoRA、DoRA、IA3、LoRA-FA、VeRA、LoRA+。以 ESM2-650M + DeepSol 数据集 + LoRA 方法为例,整个微调流程在单张 RTX 3090(24GB)上约需 15-20 分钟。平台提供了完整的训练脚本(bash script/train/train_plm_lora.sh),用户只需配置数据集路径和模型名称即可启动。训练完成后,模型自动注册到平台工具库中,可直接用于后续预测。
Agent 模式最实用的场景之一是自动化数据检索。传统上,研究人员需要分别登录 AlphaFold DB、RCSB PDB、UniProt 等多个网站,手动搜索目标蛋白、下载结构文件、转换格式。VenusFactory2 的数据库工具链将这些操作封装为可编程接口,Agent 只需一句"找到所有分辨率 < 2.0Å 的溶菌酶晶体结构",即可自动完成 RCSB 搜索 → 文件下载 → 本地存储的全流程,结果实时返回到工作目录。
VenusFactory2 提供了完整的 Docker 支持,是本次扫描中部署支持度最高的一类项目。根目录的 docker-compose.yaml 定义了 GPU 和 CPU 两种 profile,通过 docker compose --profile gpu up -d 即可一键启动。Dockerfile 采用多阶段构建(multi-stage):第一阶段用 Node.js 25 编译 React 前端,第二阶段以 NVIDIA CUDA 12.8 + Ubuntu 24.04 为基础镜像安装 Python 3.12、PyTorch 和 PyG 图神经网络库,最终镜像大小经过优化。
本地非 Docker 部署需要:Python 3.12+ 环境、CUDA 12.8 + PyTorch(GPU 模式)、PyTorch Geometric(用于图神经网络工具)、以及可选的 KIMI API Key(用于 Agent 模式)。前端需要 Node.js 和 pnpm。整体来说,有 Docker 经验的用户可以在 15-30 分钟内完成部署;对于没有 Docker 经验的用户,有一定的学习曲线。
GPU 显存需求取决于使用的模型规模:ESM2-8M/35M 最低可在 8GB 以下运行;ESM2-650M 推荐 8-16GB;ESM2-3B 推荐 16-24GB;ESM2-15B 需要多卡或 A100 40GB。CPU 模式也可用(通过 docker compose --profile cpu),但训练和大规模预测会非常慢。
尽管 VenusFactory2 功能全面,用户仍需注意以下局限:
模型精度边界:所有突变效应预测本质上是统计推断而非真正的物理模拟。对于涉及远距离残基相互作用、构象变化或金属离子依赖的复杂突变,零样本模型可能出现偏差。平台在 README 中也明确建议将 AI 预测结果与实验验证相结合。
Agent 模式的稳定性:Agent-0.1 目前标记为 Beta 阶段,多步骤任务中可能遇到 API Key 限额、网络超时或模型调用失败等问题。此外,Agent 模式依赖 KIMI(国产大模型)API,在部分地区可能面临访问限制。
依赖管理复杂性:PyTorch Geometric 及其依赖(torch_scatter、torch_sparse、torch_cluster 等)需要与 CUDA 版本精确匹配的 wheel 文件,pip install 过程中容易因版本冲突失败。Docker 部署可以很好地规避这一问题,这也是推荐 Docker 方式的主要原因。
VenusFactory2 代表着 AI 蛋白质工程从"专家工具"向"大众平台"演进的趋势。它不是简单地打包几个预训练模型,而是真正用 Agent 思维重构了整个蛋白质研究工作流——从文献检索到数据下载,从序列分析到模型训练,所有环节都可以通过自然语言驱动。这种"AI for Science"的平台化路径,正在为湿实验研究员打开一扇通往机器学习的大门。
项目技术报告已发表于 arXiv:2603.27303,VenusX 模型被 ICLR 2026 接收,团队在 ProteinGym 基准上的持续领先也验证了其研究实力。随着更多蛋白质结构预测和设计模型的出现,这类平台将成为连接 AI 前沿研究与实际生物工程应用的重要桥梁。