YuE2 是什么
YuE2 是香港科技大学与 M-A-P 团队联合开源的音乐生成模型,它是开源音乐模型 YuE 的升级版本。YuE2 能根据歌词和风格提示先生成一份可编辑的 ABC 乐谱(包含旋律与和弦),再把这份乐谱渲染为 48kHz 的完整歌曲,让整个创作过程从”黑盒抽卡”变成白盒可控。在 WildSongBench 评测中,YuE2 的 SongBench 综合得分达到 6.9632,表现超过 Suno v5 等商业系统。
YuE2 官方主页:Music, with a plan(来源:map-yue2.github.io 页面截图)
要理解 YuE2 的设计动机,需要先看清 AI 音乐生成长期存在的一个矛盾:绝大多数商业模型都是端到端的黑盒。你输入一句”一首关于夏天的民谣”,系统直接吐出一段音频;如果副歌不好听,你只能改提示词重新抽一次,而新的一版可能连主歌都变了。这种”整体重抽”的工作方式,和专业音乐人”先写谱、再试奏、改两小节、再录一遍”的流程完全相反。
YuE2 的解法是在文本条件和最终波形之间,插入一层显式的符号乐谱。模型先把歌词与风格要求翻译成 ABC 记谱法写成的旋律与和弦骨架,这一步的产物是纯文本,人类可以直接读懂、直接改;随后再基于这份乐谱渲染出带人声和伴奏的完整音频。乐谱因此成了一个”白盒接口”——既可以被人修改,也可以被 AI Agent 修改,而修改之后重新渲染即可,不必整首歌。
这里也顺便理清 YuE 与 YuE2 的关系。YuE 是同一团队推出的初代 lyrics2song 开源模型,走的是自回归语言模型路线,把音频离散成声学 token 后逐 token 生成长音频,并配套了 SheetSage2 做”音频转乐谱”。YuE2 则是在此基础上的升级版本:它把原先隐式的生成过程拆成了显式的符号规划加声学渲染两段,架构换成 AR-NAR 混合专家,控制粒度从”整首重抽”细化到”改一个和弦、换一段旋律”。
部署门槛方面,YuE2 主模型约 3.6B 参数,遵循 Apache 2.0 开源协议,单张 24GB 显存的显卡即可完成全本地离线推理。这意味着个人创作者和小型工作室不必依赖云端服务,歌词和作品也不必上传到第三方服务器,对在意数据和版权合规的用户尤为友好。
评测成绩是另一个被关注的点。在 WildSongBench 基准上,YuE2 的 best-of-8 配置取得 6.9632 的 SongBench 综合得分,官方给出的对照中高于 Suno v5.5 的 6.7150。需要说明的是,best-of-8 意味着同一提示生成 8 次取最优,因此这个数字更接近”能力上限”而非”一次出图稳定值”,实际使用体验还要看单次的平均表现。
从更宏观的视角看,YuE2 的出现对开源社区还有一个信号意义:AI 音乐生成第一次同时具备了”质量对标商业产品”和”过程完全透明”两个属性。对研究者,它提供了一个可以复现、可以改进的基线;对工具开发者,它的乐谱中间层天然适合接入 Agent 与工作流系统;对普通创作者,它把”在自己显卡上写一首歌”从概念变成了现实。这也是它发布后在社区引发广泛讨论的原因。
YuE2 的主要功能
YuE2 的能力可以概括为四条主线:创作、翻唱、编辑、理解。四条线共享同一个模型权重,切换的只是乐谱的来源——这也是它作为 YuE 升级版本在产品形态上最大的不同:初代 YuE 的各能力分散在不同尺寸的模型里,而 YuE2 把它们统一到了单一 Checkpoint 中。
- 基于乐谱的结构化创作:输入创作主题与歌词,系统首先输出结构严谨的 ABC 符号化乐谱,随后递进式地完声与编曲伴奏的完整合成。因为中间产物是文本乐谱,用户可以在渲染前就看清旋律走向与和声配置,而不是等音频出来才知道好不好听。
- 免微调的零样本翻唱:配合 SheetSage2 工具直接提取原曲的乐理骨架,无需针对翻唱任务做任何微调,就能用全新的曲风或全新的文本重新演绎已有作品。官方给出的 CLEWS mAP 源曲保留度为 0.647,说明旋律骨架的还原有量化保障。
- 智能体交互式二次修正:支持与 AI Agent 展开多轮对话,精准调整音乐的速度、和声走向乃至曲式结构,随时重新渲染出新版本。这让”再快一点””副歌换成小调”这类口头反馈第一次有了明确的执行对象。
- 录音全自动转谱:借助 SheetSage2 将任意音频转化为可视、可编辑的乐谱,为作品改编与二次创作提供入口。一段哼唱、一段现场录音,都可以先变成谱子再往下走。
- 全曲级音乐理解(MERT2):提供深度的音乐表征支持,在 MARBLE 基准测试的 15 个项目中拿下 14 项 SOTA,为上层转谱与生成任务打下基础。理解能力越强,转谱和翻唱的保真度就越高。
YuE2 的技术原理
YuE2 作为 YuE 的升级版本,架构上最大的变化是从单一自回归生成,转向”符号规划 + 声学渲染”的分段式设计。
- 显式符号中枢设计:YuE2 在条件文本与最终波形之间构建了 ABC 乐谱作为中间桥梁。这种白盒化机制打破了生成式 AI 的黑盒迷雾,使人类创作者或 Agent 能在波形渲染前直接干预曲调走向。这一层也是它区别于前代 YuE 的核心所在。
- AR-NAR 混合专家架构:模型搭载单体 Mixture-of-Transformers 骨架。自回归(AR)专家负责按序预测乐谱与语义 Token,锁定歌曲的结构逻辑与歌词对齐;非自回归(NAR)专家利用双向注意力机制对声学隐变量做 Flow Matching 预测(25Hz × 64),把控音频品质。两类专家共享混合自注意力层与 FFN,在单一 Checkpoint 内统筹规划与渲染。
- 无损 VAE 声学渲染管线:NAR 专家输出的隐变量经由 VAE 解码器无缝转化为 48kHz 立体声高采样率音频。训练端同步协同 SheetSage2 提取乐谱目标、MERT2+CVQ 生成语义 Token 目标,以及 VAE 编码器生成隐变量目标,三段目标对齐后才形成完整监督。
- 同源权重的多任务融合:无论是创作、无样本翻唱还是对话式编辑,均共享同一个 Checkpoint,仅凭乐谱来源差异自动切换工作流。翻唱时会切换为”仅旋律”模式,把伴奏部分留给模型重新适配新曲风,从而获得最大的改编度。
- 模块化分阶段推断 API:推断路径解耦为 plan() → generate_semantic() → synthesize() → decode() 四大阶段,乐谱、语义 Token 及声学隐变量全部落盘保存。创作者可以随时导出中间件修改,也可以在保持原方案的前提下更换解码方案,实验弹性很高。
YuE2 的 GitHub 开源仓库(来源:github.com 页面截图)
如何使用 YuE2
YuE2 面向有一定工程能力的用户,官方推荐在 Linux 环境下部署。与云端音乐产品”打开网页就能用”不同,本地部署需要自己准备环境,但换来的是对生成过程的完全掌控——每一步的中间产物都在你自己的磁盘上。下面按从零到出第一首歌的顺序梳理。
- 准备部署环境:推荐运行环境为 Linux 系统与 Python 3.12,并配置支持 BF16 精度运算的 NVIDIA 显卡。首次执行时,模型权重会自动从 Hugging Face 完成挂载,因此需保证网络可访问 Hugging Face。
- 克隆仓库并安装:克隆 GitHub 代码库后建立虚拟环境,运行安装指令完成依赖安装。建议使用的虚拟环境,避免与其他项目的依赖版本冲突。
- 生成第一首歌:执行示例脚本 python examples/generate.py –output outputs/first-song,便能在输出目录中取得包含 FLAC 无损音频、ABC 乐谱及中间产物的全套成品。这一步的意义在于确认整条链路(下载权重、规划乐谱、渲染音频)都能跑通。
- 通过 Python API 调用:通过 YuE2Pipeline.from_pretrained(“m-a-p/YuE2-3B”) 加载管线后,利用 cot 参数切换创作模态——设为 “full” 可生成完备乐谱(默认);设为 “melody” 仅约束主旋律;设为 “off” 则直接端到端生成。
- 翻唱与精细化编辑:先用 SheetSage2 将原曲转为旋律 ABC 谱,再以 cot=”melody” 传入新歌词或风格重构;也可以调用 pipe.plan() 导出乐谱,经人工或 Agent 修改后,带入 –abc-file edited.abc –cot full 参数重新渲染。
- 扩展为 Agent 技能:可将项目内置的 skills/yue2-music/ 挂载至支持 SKILL.md 的 Agent 体系,通过自然语言对话完成写歌、修谱以及不同音轨版本的比对。
YuE2 的使用场景
由于乐谱层可读写,YuE2 适合的场景往往不是”一次性出成品”,而是”需要反复修改、需要解释得清”的创作与教学任务。判断一个需求适不适合 YuE2,可以看它是否满足两个条件之一:要么需要人参与到生成过程中间,要么对数据不出本地有硬性要求。
- 音乐人与非专业创作者:灵感快速落地的工具。即使不懂复杂乐理,也能依据提示词生成完整歌曲,并借助 ABC 乐谱对个别乐句做精细微调。对于习惯在 DAW 里工作的音乐人,乐谱还能直接导出为后续编曲的参考。
- 二创改编与音乐翻唱:配合转谱功能将经典曲目转换风格(如流行转爵士、摇滚转古风),或更换多语言歌词,大幅降低短视频二创与社媒传播的创作门槛。做这类的批量内容,也可以对比着看 抖音音乐创作实验室 这类面向短视频场景的平台。
- 影视、游戏与广告配乐 Demo:制作方可快速生成带人声或纯伴奏的候选配乐,低成本试错后再决定是否聘请真人团队制作,显著压缩前期沟通成本。若团队已有云端音乐生成工作流,MELO音乐 这类多模态平台也值得放在一起评估。
- 教学示范与乐理分析:音乐院校教师可针对特定和弦走向生成伴奏范例,学生能对照 ABC 乐谱同步聆听与重构,形成”听得见、看得见、改得动”的互动教学闭环。这是纯黑盒模型很难替代的一类场景。
- 本地化与隐私敏感的创作流程:由于遵循 Apache 2.0 协议、支持单卡 24GB 本地部署,歌词、旋律构思和成品都不必离开本地设备,适合对素材保密有要求的商业项目。需要参考曲库与素材时,可配合 糖果无损音乐 这样的资源站做风格调研。
YuE2 与 Suno v5.5 竞品多维对比
下表按官方给出的口径,把 YuE2 与商业闭源产品 Suno v5.5 放在几个关键维度上对照。可以看到两者并非全面碾压关系:YuE2 胜在可控性、开放度和本地部署,Suno v5.5 在歌词咬字清晰度和文本语义匹配上更优。
| 对比维度 | YuE2(港科大 / M-A-P 团队) | Suno v5.5(Suno Inc.) |
|---|---|---|
| 产品定位与开放度 | 开源学术与应用模型(约 3.6B 参数),支持全本地部署 | 商业闭源 API 服务的云端生成产品 |
| 生成质量指标 | SongBench Avg 达到 6.9632(Bo8 模式)/ 6.7316(标准版),榜单表现居前列 | SongBench Avg 为 6.7150,综合评分略低于 YuE2 的两个版本 |
| 核心生成机制 | 乐谱规划白盒模式:先产出可编辑 ABC 乐谱再渲染 48kHz 音频,全流程可视 | 黑盒端到端波形生成,缺乏可交互的中间乐理表示 |
| 精细化控制力 | 可直接读写与替换乐谱音符,支持 Agent 对话式精修和声与节奏 | 主要依赖 Prompt 提示词引导,修改过程依赖整曲随机重抽 |
| 改编与翻唱能力 | 零样本乐谱翻唱:搭配转谱引擎,CLEWS mAP 达到 0.647,旋律把控精确 | 缺乏显式乐理提取层,仅凭 Prompt 引导,原曲走势与旋律保持度不可控 |
| 歌词吐字清晰度 | PER 发音错误率 9.79%(Bo8)/ 8.44%(标准版) | PER 仅 5.96%,歌词咬字与清晰度表现更为优异 |
| 文本语义匹配 | MuLan 指标 0.5051 | MuLan 指标 0.5089,文本语义契合度略高 |
| 部署与数据隐私 | Apache 2.0 协议,权重开放下载,24GB 单显卡即可本地私有化运行 | 完全托管于云端,需上传歌词与作品,无法私有化部署 |
YuE2 的常见问题解答
- YuE2 和上一代 YuE 是什么关系?
- YuE2 是初代开源音乐模型 YuE 的升级版本,由同一批团队——香港科技大学与 M-A-P——联合推出。初代 YuE 走的是自回归语言模型路线,把音频离散成声学 token 后逐 token 生成;YuE2 则引入了”先写 ABC 乐谱、再渲染音频”的符号规划机制,并改用 AR-NAR 混合专家架构,把创作过程从黑盒变成了可编辑的白盒。功能上,YuE2 在创作之外新增了零样本翻唱、Agent 对话式编辑和分阶段推断 API。
- 本地运行 YuE2 需要什么硬件?
- 官方推荐环境为 Linux 系统与 Python 3.12,并配置支持 BF16 精度运算的 NVIDIA 显卡。主模型约 3.6B 参数,单张 24GB 显存的显卡即可完成全本地离线推断。首次执行时模型权重会自动从 Hugging Face 下载,因此需要保证网络可访问 Hugging Face,并预留相应的磁盘空间用于存放权重和中间产物。
- 生成的乐谱可以导出到专业音乐软件里继续用吗?
- 可以。YuE2 的中间产物是 ABC 记谱法格式的纯文本乐谱,包含旋律与和弦信息,推断过程中的乐谱、语义 Token 和声学隐变量都会落盘保存。ABC 是一种通用且被广泛支持的记谱格式,可以导入到多种打谱与 DAW 工具中继续编辑。也就是说,YuE2 的定位是”创作起点”而非”出版终点”,混音、母带、人声对齐等后期工作仍建议在专业音频工作站中完成。
YuE2 官网网址
以下为 YuE2 的官方入口与资源地址,建议通过官方渠道获取最新的模型权重、安装说明与使用示例。
- YuE2 官方主页:https://map-yue2.github.io/
- GitHub 仓库地址:https://github.com/multimodal-art-projection/YuE
- Hugging Face 模型权重:https://huggingface.co/m-a-p/YuE2-3B
OpenI AI时代点评
YuE2 最值得肯定的一点,是它没有继续在”黑盒生成质量”这条路上卷参数,而是回头解决了一个更基础的问题:创作者到底能不能控制 AI 生成的东西。把 ABC 乐谱做成中间层之后,”改一个和弦””把副歌换成小调”这类需求第一次有了直接的操作对象,而不必靠反复抽卡碰运气。对音乐人来说,这种可控性往往比单次生成的惊艳程度更有长期价值。
同时也要客观看待它的位置。评测口径上,6.9632 的 SongBench 成绩来自 best-of-8 配置,代表能力上限;而在 PER 歌词错误率和 MuLan 语义匹配这两项上,Suno v5.5 仍然占优。加上本地部署需要 24GB 显存、环境搭建有一定门槛,YuE2 目前更适合愿意折腾的创作者、研究者和对数据隐私有要求的团队,而不是追求开箱即用的普通用户。
如果你是从上一代 YuE 过来的,YuE2 的升级点相当明确:乐谱层、AR-NAR 架构、零样本翻唱和分阶段推断 API,每一项都指向”可控”这一个目标,值得为它重新搭一次环境。若你更关心不同路线的横向选择,可以在 OpenI 上把 MELO音乐、抖音音乐创作实验室 等条目一并对比后再决定。最新进展请以 YuE2 官方主页 的说明为准。


