DeepAnalyze
首个 Agentic LLM 数据分析师,一键生成专业分析报告,支持全流程自动化
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个 Agentic LLM 数据分析师,一键生成专业分析报告,支持全流程自动化
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这样的经历:老板丢给你一份 10 万行的 Excel 报表,让你"分析一下有什么规律",然后你对着满屏的数字发呆,不知道从哪下手——清洗数据、选模型、画图、写报告,一套流程下来半天没了。而现在,想象一个 AI 助理,你只要把数据文件扔给它,它就能像一位资深数据分析师一样,自己跑代码、自己出图、自己生成一份结构清晰的研究报告,全程不需要你插手。
这就是 DeepAnalyze 试图做的事——把数据科学工作流彻底自动化。
图1:DeepAnalyze 官方 Logo
数据科学之所以难以被 AI 自动化,是因为它从来不是一个单一任务,而是一条长长的流水线:数据加载 → 清洗 → 探索性分析 → 特征工程 → 建模 → 可视化 → 报告撰写。每一步都可能遇到意料之外的数据问题,分析师需要凭借经验判断下一步该做什么——这是典型的"开放性决策"问题,传统的规则系统根本无法应对。
大语言模型(LLM)的出现让这条路出现了转机。当模型足够强大时,它不仅能理解自然语言指令,还能生成并执行 Python 代码,甚至能在执行结果的基础上反思、调整策略,进行多轮迭代。但这需要一个前提:模型必须经过专门的 Agentic 训练,学会管理代码执行循环、理解数据任务的工作流,而不仅仅是做问答。
DeepAnalyze 正是在这个背景下诞生的——由**中国人民大学数据科学实验室(ruc-datalab)**训练,发布了专门的论文(arXiv:2510.16872),并在 HuggingFace 上开源了完整的模型、代码、训练数据和演示案例。
如果说传统的数据分析工具(如 Excel、SPSS)是"手动挡汽车",那 DeepAnalyze 更像是"数据科学领域的自动驾驶仪":
它的底层是 DeepAnalyze-8B,一个专门为数据科学任务微调的语言模型。8B 参数规模意味着它足够轻量,普通开发者可以在消费级 GPU 上运行,同时又足够强大,能够处理复杂的多步骤分析推理。
图2:DeepAnalyze-8B 模型架构与训练流程示意
DeepAnalyze 的核心能力可以归结为两大类:
第一类:端到端数据科学流水线(Specific Data Tasks)
给定一个数据集和具体分析目标(如"预测客户流失概率"),DeepAnalyze 能够自主完成整个流程:加载数据 → 清洗缺失值和异常值 → 特征工程 → 模型选择与训练 → 评估与调优 → 生成可视化结果。开发者只需调用一个 DeepAnalyzeVLLM 类,传入模型路径和数据路径即可。代码示例极为简洁:
from deepanalyze import DeepAnalyzeVLLM
deepanalyze = DeepAnalyzeVLLM("/path/to/model")
answer = deepanalyze.generate(prompt, workspace="/path/to/data/")
print(answer["reasoning"])
第二类:开放式数据研究(Open-ended Data Research)
这是更有挑战性的场景——当你不知道数据里有什么,想让 AI 自己去"挖掘"时,DeepAnalyze 同样能搞定。它支持多种数据格式:结构化数据(CSV、Excel、数据库)、半结构化数据(JSON、XML、YAML)、非结构化数据(TXT、Markdown)。它能跨数据源联合查询,最终输出分析师级别的研究报告。
图3:DeepAnalyze WebUI 交互界面
DeepAnalyze 提供了完整的接入层,覆盖从技术极客到业务人员的各类用户:
| 接入方式 | 说明 | 适用人群 |
|---|---|---|
| Python API | 直接调用 DeepAnalyzeVLLM 类 | 开发者、Data Scientist |
| FastAPI 服务 | 部署 REST API,支持 OpenAI-style 接口 | 需要集成的系统 |
| WebUI v2 | 图形化界面,支持 HeyWhale API + Docker 沙箱 | 业务人员、轻量用户 |
| Jupyter 集成 | 基于 jupyter-mcp-server,在 Jupyter 中直接使用 | 数据分析师 |
| CLI 终端 | 命令行交互,无需浏览器 | 运维、无界面服务器 |
值得注意的是,官方在 2025 年 12 月还推出了 API Key 服务(通过 Google Form 或飞书申请),用户无需自己部署模型,直接调用官方托管的 API 即可使用,大大降低了门槛。
图4:DeepAnalyze 在金融数据分析场景的实际效果
从代码结构来看,DeepAnalyze 的技术选型非常务实:
Dockerfile 的设计也体现了工程上的考量:基于 nvidia/cuda:12.1.0-devel-ubuntu22.04,预装了 vLLM 和大量 ML 库,通过 docker-compose.yml 可以一键启动带 GPU 支持的推理环境。
图5:DeepAnalyze 生成的金融数据分析报告示例
从部署角度看,DeepAnalyze 的工程化程度相当高:
如果选择使用官方 API Key(需申请),部署门槛会大幅降低,但数据隐私需要自行评估。
DeepAnalyze 也存在一些客观局限:
DeepAnalyze 的意义不仅在于它是一个好用的工具,更在于它代表了 LLM 在垂直领域 Agentic 化的趋势。2025 年是 AI Agent 元年,但大多数 Agent 项目聚焦在编程(Code Agent)、搜索(Research Agent)等方向,数据科学领域的自动化一直进展缓慢。DeepAnalyze 的出现证明了:经过针对性微调的 8B 模型,在数据科学任务上可以取得不错的效果,且具备真正的实用价值。
从增长曲线来看,GitHub Stars 达到 4182(还在增长),说明开发者社区对其关注度很高。随着更多企业级数据分析和 AI 应用场景的落地,这类工具的需求会持续增长。
总结:DeepAnalyze 是目前最完整的开源自主数据科学 Agent 方案,模型、代码、训练数据全开源,工程化程度高(Docker/API/WebUI 全套),适合有 GPU 资源且对数据隐私有控制权的技术团队。对于普通用户,官方 API Key 方式是更轻量的入门选择。