Spider2-V
首个系统评估VLM Agent在真实数据科学与工程工作流中自动化能力的NeurIPS 2024基准,494任务覆盖11种主流数据工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个系统评估VLM Agent在真实数据科学与工程工作流中自动化能力的NeurIPS 2024基准,494任务覆盖11种主流数据工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Spider2-V 项目概览
想象一下这样的场景:数据工程师每天早上要花两小时在 Snowflake 上核对报表、在 Dagster 上检查 DAG 运行状态、在 Superset 上更新仪表盘——这些重复性操作,本质上是"人指挥机器去操作机器"。2024 年,一支来自港科大、纽约大学、Salesforce 研究院等机构的研究团队,提出了一个灵魂拷问:当前最强大的多模态大模型(VLM),到底能在多大程度上替代人类完成这些专业软件操作?
Spider2-V 正是为回答这个问题而生。它是首个系统评估 VLM Agent 在 真实数据科学与工程工作流 中自动化能力的基准测试,发表在 NeurIPS 2024 上。
Spider2-V 诞生于同一团队的前作 OSWorld(2024 年 ICLR)的基础之上。OSWorld 证明了 VLM Agent 可以在真实操作系统(Ubuntu)上执行任务,而 Spider2-V 则将目光聚焦到了专业垂直领域——数据工程师日常打交道的那一整套工具链。
该基准由 494 个真实任务 构成,覆盖 11 种主流数据工具:
| 类别 | 工具 | 说明 |
|---|---|---|
| 数据库 | Snowflake、BigQuery | 云端数据仓库 |
| 调度 | Airflow、Dagster | 工作流编排 |
| BI | Superset、Metabase | 数据可视化仪表盘 |
| 集成 | Airbyte | 数据同步 |
| 开发 | Jupyter Notebook | 数据分析代码 |
| 文档 | Google Drive | 企业文档管理 |
| 服务 | ServiceNow、Hasura Cloud、dbt Cloud | 企业服务与数据转换 |
任务分为两类:verbose(详细步骤指引)和 abstract(模糊目标描述),测试 Agent 是否真正理解意图而非机械执行。此外,部分任务还需要真实 API 账号(Snowflake、BigQuery 等),模拟企业真实环境。
如果说 OSWorld 是让 AI 在一台"通用电脑"上考驾照,那么 Spider2-V 就是让它在数据工程师专属工位上完成岗位考核。考官不只是看 AI 有没有点击正确的按钮,还要求它理解业务语境——比如"找出本季度销售额下降的原因"这类模糊需求,需要 Agent 自动导航到 BigQuery、执行 SQL、解读结果、汇报发现。
Spider2-V 提供完整的可复现执行环境:
from desktop_env.envs.desktop_env import DesktopEnv
env = DesktopEnv(action_space="pyautogui")
obs = env.reset(task_config=example)
obs, reward, done, info = env.step("pyautogui.rightClick()")
score = env.evaluate() # 自动评分
Agent 可以选择不同的视觉感知策略:
团队测试了当时最强的多款 VLM,结果显示 VLM Agent 在专业数据工具上仍有很大进步空间:
| VLM | Abstract | Verbose | Account | Non-Account | Overall |
|---|---|---|---|---|---|
| GPT-4V | 11.3% | 16.6% | 11.2% | 15.4% | 14.0% |
| GPT-4o | 11.3% | 16.2% | 10.6% | 15.6% | 13.8% |
| Claude-3-Opus | 5.3% | 10.9% | 5.9% | 9.3% | 8.1% |
| Gemini-Pro-1.5 | 6.1% | 12.1% | 8.8% | 9.3% | 9.1% |
最佳成绩仅 14% 的通过率,揭示了当前 VLM Agent 在专业工作流自动化方面的巨大差距——verbose 任务(手把手教 AI 怎么做)明显优于 abstract 任务(只说目标不说步骤),说明推理规划能力仍是瓶颈。
评测框架支持可选的 RAG(检索增强生成)机制和执行反馈:前者通过检索相关文档辅助决策,后者根据每步执行结果动态调整策略。实验表明这些技巧能显著提升成功率。
难度较高,不适合普通用户直接部署。核心门槛:
官方承诺未来支持 VirtualBox,有望降低硬件门槛。
Spider2-V 填补了 VLM Agent 在专业垂直领域评测的空白。与 WebArena(Web 任务)、OSWorld(通用 OS 任务)形成三足鼎立,覆盖从通用计算到专业软件的完整谱系。
其核心贡献在于:
从趋势看,随着 Claude 4、GPT-5 等更强推理模型的出现,专业软件自动化有望成为 AI Agent 落地的下一个主战场。Spider2-V 的基准数据将成为衡量这一进展的标尺。
图2:Spider2-V 评测任务全景覆盖 11 种数据工程工具