ai-dev-kit
让 Claude Code / Cursor 等 AI 编程工具原生理解 Databricks 平台
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让 Claude Code / Cursor 等 AI 编程工具原生理解 Databricks 平台
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样的场景:你是 Databricks 平台上的数据工程师,凌晨三点接到一个需求——要把上游 Kafka 消息队列的实时数据,经过 CDC(变更数据捕获)和 SCD Type 2(缓慢变化维度)处理,写入 Delta Lake 的一张历史拉链表。
传统的做法是:翻文档、查 API、写 Spark 代码、反复调试。等你真正跑通,天都亮了。
但如果你有一把「瑞士军刀」,可以直接对 AI 编程助手(如 Claude Code)说:「帮我创建一个 Spark 声明式管道,从 Kafka 实时摄取数据,实现 SCD Type 2」——然后 AI 替你把一切搞定。这就是 Databricks AI Dev Kit 存在的意义。
它不是又一个 AI 编程工具,而是一套给 AI 编程工具使用的 Databricks 能力装备包。无论你用 Claude Code、Cursor、Codex 还是 Copilot,Dev Kit 都能让 AI 助手「原生理解」Databricks 的所有概念和接口。
Databricks AI Dev Kit 由 Databricks Field Engineering(现场工程)团队打造和维护,2025 年 12 月首次提交 GitHub,至今不过半年多已积累超过 1600 颗星、350 个 Fork,增长势头强劲。
这个时间节点并非偶然。2025 年是 AI 编程助手大规模普及的元年——Claude Code、Cursor、Windsurf、Codex、Gemini CLI 相继登场。但这些工具在面对企业级数据平台时,往往「有心无力」:它们不懂 Unity Catalog、不理解 Genie Spaces、不知道 Spark Declarative Pipeline 的语法。Databricks 作为全球最大的 lakehouse 平台,数百万数据工程师和数据科学家每天都在上面工作,Field Engineering 团队敏锐地捕捉到这个需求,推出了这套工具包。
项目已获得 Databricks Certified Gold Project(Databricks 官方金牌认证项目),这意味着其代码质量、安全合规性和维护活跃度都经过了 Databricks 官方审核。
AI Dev Kit 不是单一工具,而是一个可自由组合的四层架构:
这是最底层的 Python 包,提供了面向 Databricks 的高级函数封装。开发者或 AI 助手可以直接 import 调用,无需关心底层 API 细节。
核心模块包括:
execute_sql() 自动选择可用仓库,返回标准 Python 字典列表。认证机制设计尤为精妙:支持单用户(环境变量或 Databricks CLI 配置文件)和多用户(通过 contextvars 在每个请求中注入用户凭证)。多用户模式由 set_databricks_auth() 实现,让同一个应用可以为不同用户操作各自的 Databricks 资源——这是构建企业级 AI 应用的基础能力。
依赖方面:databricks-sdk >= 0.81.0(Databricks 官方 SDK)、pydantic >= 2.0(数据验证)、sqlglot >= 20.0(SQL 解析)、sqlfluff >= 3.0(SQL linting),均为业界主流库。
这是整个项目最核心的创新点。基于 FastMCP 框架实现,将 Databricks 的操作能力以 MCP(Model Context Protocol)协议暴露给 AI 编程助手。
MCP 是 Anthropic 主导的 AI 工具调用协议,类似于 AI 世界的「USB-C 接口」——只要实现了 MCP server,任何 MCP client(如 Claude Code、Cursor、Genie Code)都可以调用这些工具。
当前 MCP Server 提供了 50+ 工具,按功能分为:
| 工具分类 | 文件 | 规模 | 典型工具 |
|---|---|---|---|
| Unity Catalog | unity_catalog.py | 38KB | 建表、管理安全策略 |
| Genie | genie.py | 21KB | 自然语言查询、知识助手 |
| Lakehouse | lakebase.py | 20KB | Volume 文件操作、自动缩放 |
| Compute | compute.py | 16KB | 集群管理、DBR 版本 |
| Agent Bricks | agent_bricks.py | 20KB | AI Agent 构建块 |
| Pipelines | pipelines.py | 10KB | 流式管道、SCD Type 2 |
| AI/BI Dashboards | aibi_dashboards.py | 6KB | 可视化仪表盘 |
| Vector Search | vector_search.py | 12KB | 向量检索索引 |
| SQL | sql.py | 6KB | 查询执行 |
| Apps | apps.py | 6KB | Databricks Apps 部署 |
特别值得注意的是 agent_bricks.py(20KB),这是专门为 AI Agent 构建设计的工具集,包含 Agent 执行、状态管理、工具编排等能力,是构建 RAG(检索增强生成)知识助手的基础。
MCP Server 支持 manifest.py(6.2KB)定义的中间件机制,可扩展拦截和处理 MCP 请求生命周期。
Skills 是一组 Markdown 格式的指南文件(共 20+ 个目录),每个 skill 对应一个 Databricks 功能域,内含操作步骤、最佳实践和代码示例。安装后,AI 编程助手在处理相关任务时会「自动学习」这些技能。
代表技能包括:
安装方式灵活多样:
install_skills.sh 安装到本地 .claude/skills 目录/Workspace/Users/<user>/.assistant/skills,让 Genie Code(Databricks 内置 AI 编程工具)直接使用install_genie_code_skills.py 下载并上传(无需本地终端)这意味着无论你是在本地 IDE 写代码,还是在 Databricks Notebook 上工作,都能获得一致的 AI 辅助体验。
这是整个工具包中最「重」的部分,也最能体现工程复杂度。前端基于 React 18 + TypeScript + Vite,后端基于 FastAPI + SQLAlchemy + PostgreSQL(Lakebase)。
核心能力:
部署通过 Databricks Bundle(databricks.yml),一键部署到 Databricks App 环境,包含一个 PostgreSQL(Lakebase)数据库和 Databricks App 实例。
架构图(来自仓库 databricks-tools-core/docs/architecture.svg)清晰展示了四层之间的依赖关系:builder-app 依赖 MCP Server,MCP Server 依赖 tools-core,skills 则独立安装到各个 AI 工具的配置目录中。
安装方式(Mac/Linux):
bash <(curl -sL https://raw.githubusercontent.com/databricks-solutions/ai-dev-kit/main/install.sh)
一行命令搞定,自动检测已安装的 AI 编程工具(Claude Code、Cursor、Codex、Gemini CLI 等),并安装对应的配置和技能包。
前提条件:
uv(Python 包管理器,强烈推荐)不支持的场景:没有 Databricks 账号和 CLI 认证,工具包完全无法工作。但这是合理的——它本来就是 Databricks 的专属工具。
AI Dev Kit 与 Databricks 平台高度耦合是其最大的局限。如果你同时使用 Databricks、Snowflake、BigQuery,它只能服务 Databricks 那一半。这与 dbt(数据转换)的跨平台策略形成鲜明对比。
项目 README 中专门提到了供应链安全:检测到 litellm 1.82.7-1.82.8 版本存在已知漏洞后,已将 litellm 从主依赖中移除,仅在测试目录保留并固定到安全版本。这是一个成熟开源项目应有的安全响应速度。
当 AI 助手使用这些工具时,仍可能出现参数错误、权限误判等问题。尤其是对生产环境的写操作(创建表、删除 Job),建议在开发环境充分测试后再授权 AI 执行。
Databricks AI Dev Kit 代表了一个更大的趋势:AI-First 开发工具链。
传统的数据平台工具(如 Databricks 本身)需要开发者学习大量 API、概念和最佳实践。AI 编程助手的出现改变了这个范式:不是让人学工具,而是让工具(AI)学会平台的一切。Dev Kit 就是这座桥梁——它把 Databricks 的 50+ 操作能力标准化地暴露给 AI,让 AI 真正成为 Databricks 平台的「本地居民」。
从 GitHub 增长曲线看,项目在半年内突破 1600+ 星,说明这个需求在 Databricks 用户群体中有相当的共性。Databricks Field Engineering 团队选择以开源方式维护这个项目,不仅有助于快速收集用户反馈,也在构建一个围绕 Databricks + AI 编程的开发者生态。
可以预见,随着 Claude Code、Cursor 等工具的进一步普及,这类「AI 编程工具 + 企业平台」的中间层适配器会越来越多。Databricks 率先吃到了这只螃蟹。
| 维度 | 评估 |
|---|---|
| 项目定位 | AI 编程工具的 Databricks 能力增强包 |
| 架构设计 | 四层可组合:核心库 → MCP Server → Skills → Builder App |
| 技术深度 | MCP 协议实践、FastMCP 框架、多用户 contextvars 认证 |
| 开发者体验 | 一键安装,支持主流 AI 编程工具 |
| 平台局限 | 仅限 Databricks,无跨平台计划 |
| 适用人群 | Databricks 数据工程师、AI 开发者、数据科学家 |