ai-data-science-team
用一群各有专长的 AI 代理,自动完成数据加载、清洗、可视化、建模的全流程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用一群各有专长的 AI 代理,自动完成数据加载、清洗、可视化、建模的全流程
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一个真实场景:你接手一份陌生数据集,需要先做 EDA 探索,再清洗异常值、填补缺失,然后做特征工程、建模、调参,最后把结果记录到 MLflow。每一个步骤你都要自己写代码、自己查文档、自己 debug。做完一次还好,但如果这份数据每天都要更新,每次都要重复这套流程呢?
传统的机器学习工作流是线性串行的——数据工程师、数据科学家、模型工程师各自为战,代码散落在不同 Jupyter Notebook 里,版本混乱、难以复用。更让人头疼的是,当你要把整套流程自动化时,往往面临多语言工具链的集成地狱。
ai-data-science-team 正是来解决这个问题的。它的核心理念是:不给一个 AI 打工,而是让一群各有专长的 AI 代理组成团队,协同完成端到端的数据科学任务。5358 个 GitHub Star 证明了这种思路的吸引力。

图1:AI Data Science Team Logo
ai-data-science-team 由 Business Science 组织开发和维护,这是一个专注于数据科学教育培训的技术团队,旗下拥有著名的 sklearn-pandas、modeltime 等 R/Python 工具包,在数据科学社区有相当的影响力。
项目最初定位为"AI 数据科学家的效率工具包",随着 LangChain/LangGraph 生态的成熟,团队逐步将底层实现从 LangChain 0.x 迁移到 LangChain 1.0+ 的消息优先 API,并引入了 Supervisor 模式来协调多代理协作。2025 年最新版本(v0.0.0.9017)正式推出了旗舰应用 AI Pipeline Studio,将代理协作能力封装为可视化 Web 应用。

图2:AI Pipeline Studio 主界面(来源:项目 README)
如果你把 AI Pipeline Studio 想象成一个数据工厂,那么各个 Agent 就是工厂里的专职工人:
这些"工人"不是孤立工作的——它们由一个 Supervisor DS Team(主管代理)统一调度。Supervisor 负责理解用户任务,将其分解为子步骤,然后路由给最合适的 Agent,最后汇总各 Agent 的输出返回给用户。

图3:多代理协作架构示意
项目基于 LangGraph 构建有状态的多代理图(Multi-Agent Graph)。supervisor_ds_team.py 是整个编排系统的核心:
Supervisor 采用消息历史检查点(MemorySaver)实现会话持久化,同一个对话中多轮交互不丢失上下文。消息合并策略很有意思:不仅去重,还专门识别并丢弃 LangGraph 内部的 Agent Output Report JSON 块——这些调试信息对用户无意义但会撑爆 LLM 上下文窗口,最大程度保持上下文精简。
Agent 生成的 Python 代码不会直接在宿主环境执行,而是通过 run_code_sandboxed_subprocess 隔离运行,防止恶意代码影响主系统。数据清理代理默认执行一套标准化清洗流程(删除高缺失列、均值/众数填补、去除重复行和极端异常值),但也接受用户自定义修改——在灵活性和规范性之间取得平衡。
AI Pipeline Studio 是整个项目的旗舰应用(apps/ai-pipeline-studio-app/app.py),基于 Streamlit 构建,提供 7 大功能模块:Visual Editor(可视化流水线设计)、Table(数据表格浏览)、Chart(交互式图表生成)、EDA(探索性数据分析报告)、Code(自动生成代码查看)、Model(模型训练与管理)、Predictions(预测结果输出)。
Pipeline Studio 支持手动步骤(用户自己拖拽节点)和 AI 步骤(AI 自动编排)混合使用,输出可保存为 metadata-only(轻量)或 full-data(完整)两种模式,支持 rehydrate(从 metadata 重建完整数据状态)。

图4:AI Data Science Team 全景
| 层级 | 技术 |
|---|---|
| Agent 框架 | LangChain 1.0+ / LangGraph |
| LLM 接口 | OpenAI GPT 系列 / Ollama 本地模型 |
| Web 框架 | Streamlit |
| 数据处理 | Pandas, NumPy, scikit-learn |
| 可视化 | Plotly |
| ML 平台 | H2O AutoML, MLflow |
| 数据库 | SQLAlchemy |
| 代码安全 | 沙箱 subprocess |
依赖设计非常克制——没有引入 Dask/Spark 这类分布式计算框架,而是专注于用可靠的轻量级工具完成端到端数据科学流程,这降低了部署门槛。
git clone https://github.com/business-science/ai-data-science-team.git
cd ai-data-science-team
pip install -e .
streamlit run apps/ai-pipeline-studio-app/app.py
整个安装过程在 10 分钟内完成。运行后浏览器打开 http://localhost:8501 即可使用。
项目要求用户自备 OpenAI API Key(或配置 Ollama 连接本地模型)。没有 GPU 也可以运行——因为所有计算都在本地 Pandas/NumPy 上执行,大模型调用走 API 网络请求。内存建议 4GB 以上,磁盘 2GB 足够。
代码模块化程度很高。如果只想用某个特定 Agent(如数据清洗),可以直接 import 对应的 Python 类,不需要跑整个 Streamlit 应用:
from ai_data_science_team.agents import DataCleaningAgent
from langchain_openai import ChatOpenAI
model = ChatOpenAI(model="gpt-4o")
agent = DataCleaningAgent(model=model)
result = agent.invoke_agent(user_instructions="去除缺失值超过40%的列")
必须指出,这个项目目前处于 Beta 阶段(v0.0.0.9017),官方明确警告:"Breaking changes may occur until 0.1.0"。对于生产环境使用,这意味着依赖版本锁定不当可能导致未来升级踩坑。
另外,Agent 生成代码的正确性完全依赖底层 LLM 的能力。简单清洗任务(填补均值/众数)表现稳定,但复杂的特征工程逻辑可能出现幻觉——生成看起来合理但语义错误的 Pandas 操作。对于关键业务场景,强烈建议人工审查 Agent 生成的代码。
多代理协作目前依赖 Supervisor 的路由能力,如果任务边界模糊(如"分析这份数据"这种模糊指令),Supervisor 可能在多个 Agent 之间反复横跳,效率反而不如单代理。这提示我们:AI Agent 不是万能药,明确任务边界才能发挥最大价值。
ai-data-science-team 代表了一个正在快速发展的方向:AI Agent 工作流自动化。从 AutoGPT 到 LangGraph,从单代理到多代理协作,社区一直在探索"如何让 AI 真正替代重复劳动"。
相比通用 AI 助手,这个项目选择深耕数据科学垂直领域——每一个 Agent 都是为特定数据任务量身定制的,产出的代码质量远高于通用 LLM 的随机生成。这种"领域专家代理团队"的模式,可能是未来 AI 辅助编程的主流形态之一。
从 GitHub Star 增长曲线看,项目在 2024 年中期有一次明显加速,与 LangChain 1.0 发布和 Supervisor 功能上线的节奏吻合。Business Science 团队持续更新,Roadmap 显示未来将支持更多数据源(AWS S3、Google BigQuery)和更丰富的模型集成(Claude、Gemini)。
如果你在寻找一个开箱即用、有 Web UI、支持多代理协作的数据科学 AI 工具链,ai-data-science-team 是目前 GitHub 上 5000+ Star 量级中难得的 Python 原生方案,值得一试。