DB-GPT
开源 Agentic AI 数据分析助手,自然语言驱动 SQL 生成、代码执行与多数据源分析
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源 Agentic AI 数据分析助手,自然语言驱动 SQL 生成、代码执行与多数据源分析
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你正在运营一家电商城铺,后台数据库里有过去三年的销售记录、用户行为日志和库存数据。往常分析这些数据,需要找数据分析师写 SQL、跑脚本、等排期——现在,你只需要对着电脑说一句话:"分析一下去年第四季度哪个品类的复购率最高",DB-GPT 就能自动连接你的数据库、编写 SQL、跑出结果、生成可视化图表。
这就是 DB-GPT 正在做的事:让 AI 直接成为你的数据分析助手。
图1:DB-GPT 系统架构全景,支持多数据源接入与 Agent 化分析流程
数据库是现代企业的核心资产,但真正能从数据中提取洞察的人少之又少。传统 BI 工具依赖预设报表,门槛高、迭代慢;普通业务人员想查一条数据,往往需要拜托技术人员。
2023 年底,随着大语言模型(LLM)能力的爆发,一个新的方向浮出水面:能不能让 AI 直接"读懂"数据库,用自然语言驱动数据分析?DB-GPT 正是这个方向的早期探索者之一,由 eosphoros-ai 团队发起,2023 年 12 月发布论文(arXiv:2312.17449),次年正式开源,并在 GitHub 上迅速积累了近两万颗星,成为 AI + Data 领域最具影响力的开源项目之一。
项目背后的核心理念是"Agentic"——DB-GPT 不只是被动回答问题,而是主动规划任务步骤、调用工具(SQL 查询、Python 代码执行、向量检索)、迭代优化结果,模拟一位专业数据分析师的工作方式。
可以把 DB-GPT 想象成一个配备了专业工具箱的数据分析师:
整套工具在 AWEL(Agentic Workflow Expression Language)框架下编排,实现了任务的自动化规划与执行。
DB-GPT 支持同时接入多种数据源——结构化的 MySQL、PostgreSQL 表格,半结构化的 CSV/Excel 文件,以及非结构化的知识库文档。这意味着业务人员不需要把数据"搬运"到统一平台,DB-GPT 可以在原始数据所在的位置直接进行分析。
这是 DB-GPT 最核心的能力。用户用中文或英文提问,LLM 自动解析意图、推断表结构、编写 SQL 语句,并在真实数据库中执行。系统内置了 Schema 理解模块,能感知表的字段含义、外键关系,从而生成更精准的查询语句。
对于 SQL 难以完成的复杂分析(如机器学习建模、时序预测、统计检验),DB-GPT 可以在沙箱环境中安全执行 Python 代码。这解决了传统 Text-to-SQL 方案"只能查数、无法分析"的痛点。
Skills 是 DB-GPT 的可扩展机制。开发者可以将常用的分析流程(如"Excel 数据清洗 → 可视化 → 导出报告")封装为 Skills 并发布到社区。DB-GPT 支持从 GitHub 直接导入 Skills,形成类似"插件市场"的生态。截至目前,社区已积累了大量覆盖金融、电商、数据工程等场景的 Skills。
DB-GPT 不绑定某个特定 LLM,默认兼容 OpenAI GPT 系列,同时也支持阿里通义(DashScope)、Moonshot Kimi、MiniMax 等国内模型。用户可以根据自己的数据隐私需求选择本地部署或云端 API 调用,灵活平衡成本与效果。
图2:DB-GPT Web UI 界面,支持对话式数据分析与可视化输出
DB-GPT 提供了三种安装方式,适合不同技术背景的用户:
方式一(最简):PyPI 一行命令
uv pip install dbgpt-app
dbgpt start
首次运行会交互式引导选择 LLM 提供商并输入 API Key,之后访问 http://localhost:5670 即可使用。对非技术用户最友好,无需克隆代码仓库,无需配置 Docker。
方式二:docker-compose 一键部署
项目根目录提供了 docker-compose.yml,包含 MySQL 数据库 + Web 服务的完整配置,一条命令即可启动包含数据库和前端服务的完整环境:
SILICONFLOW_API_KEY=xxx docker compose up -d
适合有 Docker 基础、希望快速体验完整功能的用户。
方式三:从源码安装
提供了一键安装脚本,支持 macOS 和 Linux:
curl -fsSL https://raw.githubusercontent.com/eosphoros-ai/DB-GPT/main/scripts/install/install.sh | bash
支持 OpenAI、Kimi、MiniMax 等多种 LLM Profile,适合需要深度定制或参与开发的用户。
Web UI 使用体验:打开 http://localhost:5670 后,你会看到一个类似 ChatGPT 的对话界面,但左侧有数据源管理面板。可以上传 CSV/Excel、连接数据库、选择或导入 Skills,然后通过对话完成分析任务。生成的结果包括数据表格、图表和分析报告。
DB-GPT 的代码采用 Python + TypeScript(前端 Next.js)的混合架构:
整体架构遵循"数据平面 + 控制平面分离"的设计原则:LLM 驱动的分析逻辑(控制平面)与数据源的接入、查询执行(数据平面)完全解耦,方便接入新的数据源或新的 LLM 提供商。
DB-GPT 也不是银弹,以下问题值得关注:
1. SQL 生成的准确性仍有瓶颈
在表结构复杂、JOIN 层次多、或涉及窗口函数的场景下,LLM 生成的 SQL 有概率出现语义偏差。DB-GPT 内置了 SQL 语法检查和执行校验,但不保证 100% 正确,用户仍需对关键结果进行人工核对。
2. 数据安全是核心顾虑
虽然 DB-GPT 支持私有化部署,但将数据库凭证和 LLM API Key 暴露给外部 API(如 OpenAI)仍是一些企业客户的主要顾虑。开源版本对本地 LLM(如 Ollama)的集成支持有待完善,对硬件要求较高。
3. 大规模数据分析性能有限
当前架构更适合中小规模数据集的探索性分析,对亿级数据的即席查询性能受限于数据库本身的查询能力,DB-GPT 本身不做查询优化。
4. Skills 生态尚处早期
社区 Skills 的质量参差不齐,缺乏权威认证机制,企业级生产环境直接复用存在一定风险。
DB-GPT 的出现填补了"开源 Agentic 数据分析"这一细分领域的空白。自 2023 年底开源以来,项目持续保持高频迭代,GitHub Stars 接近 19,000,Forks 超过 2,700,是该领域星标数量最多的开源项目之一。
它的意义不只是做了一个好产品,更代表了一种趋势:数据分析正从"技术驱动"走向"AI 驱动",从"专家专属"走向"人人可用"。随着 LLM 能力的持续提升和数据隐私法规的完善,这类工具在企业级数据分析场景中的应用空间将持续扩大。
DB-GPT 已发布学术论文(arXiv:2312.17449),配套文档体系完善(docs.dbgpt.cn),社区活跃度高,是一个值得关注和跟进的开源项目。