YuE2 是一个开源的 AI 音乐生成模型:给它一段歌词和一句风格描述(比如「中文情歌,钢琴慢节奏伴奏」),它就能输出一首带人声和伴奏的完整歌曲,成品质量在公开评测中与商业产品 Suno v5/v6 同档。项目代码在 GitHub 开源,仓库 multimodal-art-projection/YuE 已有约 7.1k star、812 fork,适合三类人用:想做歌但不会编曲的创作者、想把音乐生成能力接进自己产品的开发者、以及研究 AI 音乐的研究者。

它解决什么问题:把「作曲」和「演奏」拆开

常见的 AI 音乐生成是黑盒:给一句提示词,模型直接吐出一整首歌,中间过程看不见也改不了,不满意只能重新生成。YuE2 采用「符号规划」:先自动写出一份包含旋律与和弦的乐谱,再根据乐谱合成人声和伴奏。乐谱是文本形式的中间产物,可以查看、试听、手动修改,改完再重新渲染。作曲与演奏被拆成两步,这是它和 Suno 这类产品最本质的差异。

上手门槛:一张 24GB 显存的 NVIDIA 显卡

运行环境是 Linux + Python 3.12 + 支持 BF16 的 NVIDIA GPU(显存 24GB)。安装后执行官方示例即可生成歌曲,输出 48kHz 立体声(接近 CD 音质)的 flac 文件,同时保留乐谱、语义 token 等中间产物,方便回看和复用。模型文件首次运行会从 Hugging Face 自动下载。

三种玩法

  • 创作新歌:歌词 + 风格提示 → 生成可编辑乐谱 → 输出完整歌曲。默认「完整规划」模式(cot=full)会先产出旋律与和弦方案,这个方案就是你可以动手改的乐谱。
  • 零样本翻唱:把一段现成录音转成新风格,不需要针对这首歌额外训练。官方在 948 首作品上评测,翻唱保留原曲特征的指标 CLEWS mAP 达到 0.647。
  • Agent 对话改曲:官方附带 yue2-music 技能,AI 助手(Agent,能自主执行多步操作的 AI 程序)可以按对话要求修改和弦、风格、歌词,再输出新录音。官方演示曲 The Last Train 经过 9 步对话、14 个版本,从中文流行改成英文爵士,并新增了萨克斯独奏。

质量数据:开源模型进入第一梯队

WildSongBench 是一个公开的音乐生成评测集(192 条提示词,2026 年 9 月 12 日评测)。YuE2 取 best-of-8(从 8 个候选中选最佳)时综合得分 6.9632,在 17 个评测设置中最高,高于 Suno v5(6.8721)、Suno v5.5(6.7150)、Suno v6(6.5562);音频质量单项 8.2714,与 Suno v5 的 8.1698 接近。评测方也提示最高分之间的差距不大,差异不一定统计显著——更准确的说法是:开源模型第一次稳稳站进了商业模型的第一梯队。

配套资源:理解、转谱、评测三件套

仓库同步发布了三个配套模型与数据集:

  • MERT2:音乐理解模型(分析歌曲内容、流派等信息的 AI),MARBLE 基准 15 项指标中 14 项最优,GTZAN 流派识别准确率 91.72%。
  • SheetSage2:音频转乐谱模型,把录音转成可编辑乐谱,是翻唱和改曲的前置步骤。
  • WildSongBench:评测数据集与评分协议,供后续模型横向比较。

许可证:代码和权重分开授权

代码采用 Apache 2.0,可自由商用;模型权重采用 CC BY-NC 4.0,仅限非商业使用。想商业化部署的团队需要先确认权重授权。

结论

开源音乐生成走到 Suno 同档位,YuE2 是目前最值得试的选项之一。它的核心价值不是「又多了一个音乐生成模型」,而是「先写乐谱、再合成声音」的可控路径:生成的歌曲能听、能看、能改,也能被 AI 助手按对话修改。对在意可控性和可编辑性的创作者与开发者,这条路径比黑盒生成更有长期价值。