cube-studio
腾讯音乐开源的企业级云原生MLOps平台,支持Notebook开发、拖拉拽Pipeline编排与分布式训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
腾讯音乐开源的企业级云原生MLOps平台,支持Notebook开发、拖拉拽Pipeline编排与分布式训练
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,一个音乐平台的内容运营团队想要训练一个推荐模型——他们需要 Notebook 环境处理数据、用 GPU 训练模型、把训练流程编排成流水线、最后把模型部署成 API 服务。在过去,这需要运维搭集群、工程师配环境、算法工程师手动跑脚本,至少折腾几周。而 Cube Studio 正在把这件事变得像搭积木一样简单。
Cube Studio 由**腾讯音乐娱乐集团(TME)**数据 Infra 团队开源,最初是为了解决内部算法团队在模型训练和部署过程中的效率问题。作为中国最大的在线音乐平台之一,腾讯音乐拥有海量用户行为数据和内容资产,其算法团队每天需要处理大量机器学习任务——从歌曲推荐、搜索排序到歌词生成,AI 能力是产品体验的核心支撑。
随着业务规模扩大,传统的「工程师 SSH 登录服务器、手动跑脚本」模式很快触及天花板:资源配置混乱、训练环境不统一、模型上线流程冗长、GPU 资源利用率低下。于是团队决定基于 Kubernetes + Kubeflow 构建一套统一的企业级 ML 平台,并将这一能力开源,希望帮助更多企业解决类似的 MLOps 难题。2022 年 5 月正式开源至今,已收获超过 5000 个 GitHub Stars。但需注意:该项目已于 2026 年 5 月 18 日宣布归档,不再活跃维护。
如果把机器学习模型的生产过程比作一家工厂,那么 Cube Studio 就是这座工厂的全流程操作系统。数据是原材料,算子是加工工具,而整个平台负责协调从原材料入库到产品出厂的每一步。
对于 AI 开发者而言,这意味着:你不需要自己建工厂,只需要专注于写代码。资源配置、环境搭建、任务调度这些脏活累活,平台帮你搞定。对于企业而言,Cube Studio 提供了一整套合规、可审计、可复用的算法资产管理机制。

图1:Cube Studio 平台整体架构 — 涵盖从基础设施到上层应用的完整技术栈
Cube Studio 内置基于 Kubeflow 的在线 Jupyter Notebook 环境,支持 Python 2/3、PyTorch、TensorFlow、MXNet 等主流运行时。开发者可以直接在浏览器中编写代码、调试模型,无需在本地配置复杂的 Python 环境。更重要的是,Notebook 实例运行在 K8s 集群中,可以动态申请 GPU 资源,按需扩缩容。
这一能力对于团队协作尤为重要:不同成员可以同时使用独立的环境,互不干扰;环境配置通过容器镜像固化,确保「代码能跑」的可复现性。对于企业来说,所有代码和数据都保留在平台内部,满足数据安全合规要求。
这是 Cube Studio 最具特色的功能之一。用户不需要写一行代码,就可以通过可视化拖拽界面构建复杂的机器学习流水线。每个流水线节点是一个算子(Operator),可以是数据处理、模型训练、超参搜索、模型评估等;节点之间通过数据流连接,形成端到端的自动化链路。
平台内置了丰富的基础算子(TF/PyTorch/MXNet 分布式训练、Ray/NNI 超参搜索等),同时也支持自定义算子,满足不同业务场景的特殊需求。流水线调试也很方便——可以单步执行、查看中间输出、修改后重跑,极大提升了算法实验的迭代效率。
Cube Studio 基于 Volcano(Kubernetes 原生批处理调度器)和 Ray 实现了多机多卡分布式训练能力。平台支持 TensorFlow、PyTorch、MXNet 三大主流深度学习框架的分布式模式,开发者只需在配置中指定 GPU 数量和通信策略,平台自动完成资源调度和分布式环境配置。
对于大规模模型(如 GPT 类语言模型),平台还支持GPT-RDMA 高速通信优化和混合精度训练,通过 RDMA 网络和 NCCL 通信库显著降低多机通信开销,提升大规模训练的效率。
基于 NNI(Neural Network Intelligence)框架,平台支持贝叶斯搜索、随机搜索、Grid Search 等多种超参调优算法,并将搜索过程可视化展示。超参搜索任务作为独立的工作流节点接入主 Pipeline,可以自动探索最优超参组合,并将结果上报平台用于分析。
模型训练完成后,Cube Studio 提供一键模型部署能力,将训练好的模型封装为 HTTP/gRPC API 服务,支持 GPU 推理和自动扩缩容。平台内置了模型版本管理、灰度发布、A/B 测试等生产级功能,帮助算法团队将模型从实验验证快速推进到生产上线。
平台还包含一个AIHub 模块,提供预置的 AI 能力(如 GPT 私有知识库、智能聊天机器人等),用户可以快速接入这些能力,无需从零训练模型。
必须坦诚地说:Cube Studio 不适合个人用户或小团队直接部署。
平台定位是企业级 MLOps 平台,部署需要以下基础设施:
项目提供了 Kubesphere 一键部署脚本(install/kubernetes/start-with-kubesphere.sh),可以在已配置好的 Kubesphere 平台上半自动化部署,但初始化 Kubesphere 本身也需要一定工作量。平台也支持单节点部署(用于开发测试),但功能会有所裁剪。

图2:Cube Studio 单节点部署界面效果
对于有 Kubernetes 运维经验的企业来说,部署难度尚可接受;但对于没有 K8s 背景的团队,建议考虑使用腾讯云等云厂商托管的 Kubeflow 服务,而非自建。
1. 项目已归档: 2026 年 5 月 18 日,TencentMusic 宣布该仓库归档,停止维护。这意味着不再有功能更新、Bug 修复和安全补丁。使用前需评估这一风险。
2. 技术栈较重: 完整部署需要 10+ 个组件,学习曲线陡峭,维护成本高。
3. 国产云特性依赖: 很多组件(阿里云 OSS 存储、Kubesphere 等)有明显的国产云生态绑定,迁移到其他云厂商可能面临兼容性问题。
4. 与云厂商 MLOps 竞争: 腾讯云、阿里云、百度云均提供了托管的机器学习平台(如腾讯云 TI-ONE、阿里云 PAI),这些托管服务开箱即用,无需运维 Kubernetes。对于大多数企业,直接使用云厂商托管服务可能是更务实的选择。
尽管 Cube Studio 已归档,但它代表了中国互联网大厂在 MLOps 领域的实战经验输出。在开源之初,它为国内企业构建机器学习平台提供了可参考的架构范式——基于 Kubernetes 的云原生方案、多租户资源隔离、Pipeline 可视化编排等理念,至今仍是企业级 MLOps 平台的主流设计。
5000+ Stars 背后反映了业界对「企业级一站式 ML 平台」这一命题的持续关注。即使不再活跃维护,Cube Studio 的架构思路和技术选型对正在构建或选型 MLOps 平台的企业仍有参考价值。