awesome-data-agents
港科广团队发布的 L0-L5 数据 Agent 分级综述与论文资源库,已登陆 SIGMOD 2026
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
港科广团队发布的 L0-L5 数据 Agent 分级综述与论文资源库,已登陆 SIGMOD 2026
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象你去租车,租车公司告诉你这辆车"自动驾驶"——但你不知道它到底是能在停车场自动泊车,还是能独自穿越沙漠。数据 Agent 领域正面临同样的尴尬:NL2SQL 工具叫 Agent,完整的端到端数据平台也叫 Agent,术语的混乱让研究者无法对比方案,让企业不知道该信任什么系统。
香港科技大学(广州)的研究团队联合清华、人大等机构,发布了一份重量级综述论文《A Survey of Data Agents: Emerging Paradigm or Overstated Hype?》(arXiv:2510.23587),并配套建立了这个持续更新的论文资源库——Awesome Data Agents,系统梳理了数据 Agent 从 L0 到 L5 的演进图谱。2026 年 6 月,这项工作以 3 小时 Tutorial 的形式登上数据库顶会 SIGMOD 2026。
这份综述最核心的创新,是借鉴汽车自动驾驶分级标准 SAE J3016,提出了数据 Agent 的 L0–L5 六级分层体系:
| 等级 | 自主程度 | 人类角色 | Agent 角色 |
|---|---|---|---|
| L0 | 无自动化 | 主导者(独立完成) | 不存在 |
| L1 | 辅助 | 主导者(整合者) | 响应者(问答助手) |
| L2 | 部分自动化 | 主导者(编排者) | 程序执行者(按流程执行) |
| L3 | 条件自动化 | 监督者(审视者) | 主导者(自主运行) |
| L4 | 高度自动化 | 旁观者(授权者) | 主导者(主动出击) |
| L5 | 完全自动化 | 不存在 | 主导者(生成式创新) |
关键洞察:当前所有系统都处于 L1–L3 区间,没有任何系统真正达到 L3——"Proto-L3"(准 L3)才是当前前沿。这意味着数据 Agent 距离真正的自主运行,还有很长的路要走。
数据 Agent 的价值体现在三类核心任务中,每个任务域的 Agent 化深度各不相同:
数据分析是进展最快的领域,包括 NL2SQL(自然语言转 SQL)、TableQA(表格问答)、NL2VIS(自然语言转可视化)、非结构化数据分析和报告生成。DuckSQL、CHESS 等系统在 L1–L2 区间表现稳定,但面对复杂多表关联时仍依赖人工介入。
数据准备覆盖数据清洗、数据集成和数据发现。这一领域 L2 级 Agent 正在兴起,具备环境感知能力(访问数据湖、理解 schema 漂移),但真正自主的 L3 级数据清洗 Agent 仍属稀缺。
数据管理包括配置调优、查询优化和系统诊断,目前研究相对薄弱,大多数方案停留在 L1 辅助阶段。
论文深入分析了从 L2 到 L3 的关键技术瓶颈,归纳为五个维度:
感知(Perception):Agent 需要真正理解数据环境——不仅是读 schema,还要理解数据语义、发现数据质量问题、感知数据血缘关系。当前系统在这点上普遍薄弱。
规划(Planning):将复杂数据分析任务自动分解为可执行步骤,并具备反思能力——发现步骤失败时自主调整策略,而非直接报错退出。
行动(Action):超越预定义工作流,实现真正的自主流水线编排。Agent 应能根据任务需求动态发现、调用、甚至组合工具。
工具(Tools):自动发现可用工具、理解工具能力边界、评估工具输出质量,而非依赖人工注册的工具列表。
记忆(Memory):积累跨任务的战略知识——不仅仅是记住上次查询了什么表,而是记住哪些分析模式有效、哪些数据源质量可靠。
这个 GitHub 仓库是该综述的配套资源,包含四类核心内容:
论文清单(paper_list.xlsx):按 L0–L3 分类整理了数百篇相关论文,涵盖学术界和工业界的主要工作。每个工作包含:所属类别、子领域、数据 Agent 名称、论文链接、会议/期刊、年份和机构信息。
学术综述(reports/Data_Agents_Survey.pdf):完整论文 PDF,提供了数据 Agent 领域的系统性文献回顾。
SIGMOD 2026 Tutorial 幻灯片(slides/SIGMOD2026_tutorial/):4 个 Part 的完整 PDF,深度讲解分级体系、技术细节和未来研究方向。
数据提取脚本(src/extract_item.py):Python 脚本,用于从 Excel 论文清单生成 Markdown 格式列表,便于社区持续更新和贡献。

图1:数据 Agent 代表性工作总结——涵盖从 L0 手动到 Proto-L3 自主的演进路径
2026 年 3 月,团队还联合发起了 KDD Cup 2026: Data Agents for Complex Data Analysis Track(官网:dataagent.top),将数据 Agent 研究推向竞赛层面,吸引全球研究者测试和对比不同系统的能力边界。这是数据 Agent 从学术走向实践的重要里程碑。
作为学术资源库而非生产软件,该项目的代码结构简洁实用:extract_item.py(约 200 行)负责从 Excel 提取论文数据,使用 Python + pandas,代码注释清晰,分 Sheet 处理逻辑规范,适合学术协作和持续更新。文档质量极高:README 长达 38K 字符,覆盖完整的方法论、论文分类和贡献指南。整体属于高质量学术开源项目。
意义:这是目前数据 Agent 领域最全面的学术资源库,其分级体系为行业提供了统一语言,让研究者和企业能够准确描述和对比系统能力。它还揭示了 L2→L3 这一关键跨越中的技术空白,为未来研究指明方向。
局限:作为一个文献综述类资源库,它不提供可直接运行的代码或工具,用户需要自己从各论文实现中提取方案。此外,论文清单的更新依赖社区贡献,实时性有限。
无需安装任何依赖,直接访问 GitHub 仓库即可:
一句话总结:Awesome Data Agents 是数据 Agent 领域的"行业地图"——它不提供工具,但告诉你现在有哪些工具、它们处于什么水平、未来应该向哪里走。无论你是数据库研究者、AI 工程师还是企业决策者,这都是理解数据 Agent 当前真实状态的最好起点。