YuE
开源全曲音乐生成模型,输入歌词即可创作含人声和伴奏的完整歌曲,Apache 2.0 许可
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源全曲音乐生成模型,输入歌词即可创作含人声和伴奏的完整歌曲,Apache 2.0 许可
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你对着一台 AI 说「写一首关于夏天的流行歌,要有副歌,要有中文rap」,几分钟后,一首完整的 3 分钟歌曲就诞生了——包括人声、伴奏、旋律和歌词。
这就是 YuE 正在做的事。
图1:YuE 项目 Logo
YuE(乐)是由香港科技大学(HKTU)与 M-A-P 团队联合开发的开源全曲音乐生成基础模型,开源协议为 Apache 2.0。
它的工作方式有些像 Suno.ai,但核心模型完全开源可复现。2025 年 1 月发布后迅速获得关注,GitHub 已有超过 6000 颗星、740 次 fork,成为音乐生成领域最活跃的开源项目之一。
过去一年,AI 音乐生成领域热闹非凡,但大多数产品是闭源的:Suno、Udio 都需要付费订阅才能深度使用。对于独立音乐人、开发者或研究者来说,「能不能自己跑一个」是一个关键问题。
YuE 正是填补了这个空白。它不仅开源了模型权重和推理代码,还配套提供了完整的微调(LoRA)框架、多种预训练检查点、以及详尽的技术报告(arXiv:2503.08638)。这在音乐生成领域是相当罕见的透明度。
更难得的是,团队明确鼓励用户将生成内容用于商业作品——唯一的要求是标注「YuE by HKUST/M-A-P」。这与 Stable Diffusion 当年推动 AI 绘画普及的思路一脉相承。
YuE 的核心是一个两阶段音乐生成管道,设计思路非常清晰:
第一阶段(YuE-s1,7B 参数 LLM):基于 LLaMA 架构的 70 亿参数语言模型,负责将歌词和风格标签转换为音乐 token 序列。这一步既可以用 CoT(Chain-of-Thought,链式思维)模式直接生成,也可以用 ICL(In-Context-Learning,上下文学习)模式,以一首参考歌曲来「教会」模型想要的风格。
ICL 模式特别有趣:给它一首 30 秒的流行歌曲,它能生成出风格相似的新曲——包括人声音色和伴奏风格的迁移。
第二阶段(YuE-s2,1B 参数上采样器):将第一阶段输出的离散音乐 token 转换为高保真音频波形。背后使用了自定义音频编解码器(xcodec),把音频 tokenize 成离散 token,再通过上采样器还原为 44.1kHz 的 WAV 文件。
这个两阶段设计在工程上非常务实:LLM 部分负责「创意」(写什么旋律、加什么乐器),上采样器负责「保真度」(音质够不够好)。两者解耦后,可以各自独立优化。
需要直说:YuE 不是一款普通用户可以直接上手的工具。
它没有官方 Docker 镜像,没有 docker-compose 一键启动,最「友好」的入门方式是:
硬件要求方面,24GB 以下的 GPU 只能跑 2 个 session(约 1 分钟音频),要生成完整歌曲建议 H800/A100 等 80GB+ 显存的卡。生成速度也较慢:H800 跑 30 秒音频需要 150 秒,RTX 4090 需要 360 秒。
YuE 的出现标志着开源 AI 音乐生成进入了一个新阶段。
此前,Stable Diffusion 之于 AI 绘画、LLaMA 之于 LLM,都证明了开源社区的力量可以迅速拉平与闭源产品的差距。YuE 正在对音乐生成做同样的事。6000+ 颗星、活跃的 Discord 社区、多个社区 UI 的涌现,都说明这个开源生态正在快速生长。
从技术趋势看,音乐生成正在从「生成一段音频」进化到「生成一首完整歌曲」,从「单轨生成」进化到「人声+伴奏联合生成」,从「随机风格」进化到「可控风格迁移」。YuE 恰好站在这些趋势的交汇点上。
未来,如果 llama.cpp 支持落地、vLLM/sglang 等推理引擎集成进来,YuE 的部署门槛会大幅下降。届时,它可能真正成为独立音乐人的创作工具包,就像 Stable Diffusion 之于设计师一样。
| 场景 | 推荐方式 |
|---|---|
| 零基础 Windows 用户 | Pinokio 一键安装 |
| 想可视化操控 | YuE-UI(Gradio,8GB VRAM 可跑) |
| 想在 Colab 里玩 | YuE-extend(社区 notebook) |
| 深度开发者 | 直接 clone 仓库 + Python 推理脚本 |
| 想微调自己的模型 | finetune/ 目录下的 LoRA 训练代码 |
无论选择哪条路径,YuE 都是目前最值得关注和尝试的开源音乐生成项目。它的开源精神和工程透明度,在闭源主导的音乐 AI 领域里弥足珍贵。