cube-studio
data-infra/cube-studio加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
一家中型互联网公司决定自建 AI 训练平台。算法工程师们面对的是:训练脚本散落在各个开发者的本地目录,GPU 资源靠人工分配,模型上线需要运维逐台部署,不同项目用的 PyTorch 版本还不兼容。算法团队提训练需求,运维团队排期两星期,模型上线后再出问题,溯源困难。这种"手工小作坊"式的 AI 开发模式,正是 CubeStudio 试图系统性解决的核心痛点。
CubeStudio 是由 data-infra 团队开源的云原生一站式人工智能平台,开源协议 MIT,已在数千家企业实现私有化部署,GitHub 获 2500+ stars,是目前国产开源 AI 平台中社区活跃度最高的项目之一。
CubeStudio 起源于腾讯音乐内部算法平台,最初用于支撑音乐推荐、音频理解等业务的模型训练与上线需求。随着内部需求日益复杂,团队将平台能力逐步沉淀并开源,迁移至 data-infra 组织下持续迭代。
值得关注的是,该项目在 2023 年经历了从 tencentmusic/cube-studio 到 data-infra/cube-studio 的仓库迁移,背后反映出腾讯音乐基础架构团队独立发展的战略意图。平台当前已支持从传统机器学习、深度学习到大模型的全链路覆盖,是国内为数不多同时具备 MLOps 全流程能力与国产算力深度适配的开源替代方案。
CubeStudio 的功能体系极为庞大,可以划分为以下核心模块:
1. 多租户算力调度
平台原生支持 Kubernetes 多集群纳管,可在单一界面下管理 T4/V100/A100 等多种 GPU 卡型。亮点在于对国产算力的深度适配:昇腾 NPU、寒武纪、海光 DCU、摩尔线程、沐曦、百度昆仑芯均有官方支持。GPU 调度支持 binpack 策略、vGPU 虚拟化显存切分、IB/RoCE RDMA 网络,以及 GPU 共享/独占多种模式。算力市场模块还支持算力租赁与按需占用。
2. 拖拉拽 Pipeline 编排
平台内置基于 Argo Workflow 的任务流编排引擎,支持通过 Web 界面以拖拽方式构建训练/推理 Pipeline。训练节点支持 PyTorch、TensorFlow、MXNet 等主流框架,以及 Ray 分布式训练、Volcano GPU 调度。超参搜索集成 NNI,支持网格搜索、随机搜索、贝叶斯优化等多种策略。
3. 大模型训练与推理
大模型是 CubeStudio 近两年重点发力的方向。训练侧支持 DeepSeek 等主流开源大模型的 SFT 微调、奖励模型(Reward Model)训练和 RLHF 强化学习;推理侧集成 vLLM、Ollama、MindIE 等多个推理引擎,支持多机并行推理。此外还提供私有知识库构建、LLMOps 智能体编排和 AI 模型市场功能。
4. 自动化标注与数据管理
平台内置图文音多模态自动化标注工具,覆盖图像分割、语音转写等常见标注场景,与训练 Pipeline 形成数据闭环。
CubeStudio 采用典型的微服务分层架构:

前端通过 Nginx 反向代理对外提供服务,部署架构支持接入公司 SSO / LDAP 账号体系,实现企业级权限管控。
CubeStudio 支持两种部署路径:
Docker Compose 单机体验部署(推荐尝鲜)
平台提供了开箱即用的 docker-compose.yml,位于 install/docker/ 目录下。部署命令仅需:
cd install/docker
docker-compose up -d
启动后访问 http://localhost,默认账号密码即可登录。docker-compose 编排了 4 个核心容器:MySQL(数据库)、Redis(缓存)、myapp(后端)、frontend(前端),资源占用相对可控,适合 2-4 块 GPU 的单机环境体验。
Kubernetes 生产级部署(推荐企业使用)
生产环境推荐使用 Kubernetes 部署。install/kubernetes/ 目录下提供了完整的 Helm Chart 和 YAML 清单,覆盖:
腾讯系产品用户还可以通过 start-with-kubesphere.sh 对接 KubeSphere 管理平台,实现图形化集群运维。
部署门槛评估
| 维度 | 评估 |
|---|---|
| 基础设施要求 | 需要 Kubernetes 集群(生产)/ Docker(体验),最低 4 核 8G + 1 块 GPU |
| 网络依赖 | 需要 GPU 驱动、NVIDIA Device Plugin、存储卷,建议专线或内网环境 |
| 运维复杂度 | 高,涉及 K8s、存储、网络、GPU 调度等多组件联调 |
| 部署文档 | 较完善,提供 Wiki 和 install/README.md |
1. 文档以中文为主,英文社区参与度有限
尽管项目在 GitHub 上有不错的国际 stars,但 Issue 讨论、Wiki 文档均以中文为主,对非中文开发者存在一定门槛。
2. 部署复杂度高,不适合个人用户
相比 Gradio/Streamlit 等轻量级 AI 应用框架,CubeStudio 的定位是企业级平台,最小化部署也需要 Docker 环境,纯粹的个人开发者很难快速上手。
3. 部分功能依赖腾讯云/腾讯内部生态
平台部分镜像托管在腾讯云 CCR(ccr.ccs.tencentyun.com),国内用户拉取较顺畅,海外用户可能面临镜像访问问题。
在开源 AI 平台领域,CubeStudio 填补了国产信创环境 MLOps 工具链的空白。与 Kubeflow 全家桶相比,CubeStudio 的优势在于开箱即用、界面友好、国产算力深度适配;与阿里云 PAI、腾讯云 TI-ONE 等商业平台相比,开源免费、无厂商锁定。
从增长曲线看,该项目自 2023 年迁移至 data-infra 后保持稳定迭代,Issue 响应活跃,Star 增长稳健(2500+),在大模型浪潮下其 LLM 训练推理能力成为新的增长驱动力。

平台整体架构图:涵盖从算力调度到模型上线的完整链路