YuE2

AI工具4分钟前更新 AI工具集
0 0 0

YuE2 是什么

YuE2 是香港科技大学与 M-A-P 团队联合开源的音乐生成模型,它是开源音乐模型 YuE 的升级版本。YuE2 能根据歌词和风格提示先生成一份可编辑的 ABC 乐谱(包含旋律与和弦),再把这份乐谱渲染为 48kHz 的完整歌曲,让整个创作过程从”黑盒抽卡”变成白盒可控。在 WildSongBench 评测中,YuE2 的 SongBench 综合得分达到 6.9632,表现超过 Suno v5 等商业系统。

YuE2YuE2 官方主页:Music, with a plan(来源:map-yue2.github.io 页面截图)

要理解 YuE2 的设计动机,需要先看清 AI 音乐生成长期存在的一个矛盾:绝大多数商业模型都是端到端的黑盒。你输入一句”一首关于夏天的民谣”,系统直接吐出一段音频;如果副歌不好听,你只能改提示词重新抽一次,而新的一版可能连主歌都变了。这种”整体重抽”的工作方式,和专业音乐人”先写谱、再试奏、改两小节、再录一遍”的流程完全相反。

YuE2 的解法是在文本条件和最终波形之间,插入一层显式的符号乐谱。模型先把歌词与风格要求翻译成 ABC 记谱法写成的旋律与和弦骨架,这一步的产物是纯文本,人类可以直接读懂、直接改;随后再基于这份乐谱渲染出带人声和伴奏的完整音频。乐谱因此成了一个”白盒接口”——既可以被人修改,也可以被 AI Agent 修改,而修改之后重新渲染即可,不必整首歌。

这里也顺便理清 YuE 与 YuE2 的关系。YuE 是同一团队推出的初代 lyrics2song 开源模型,走的是自回归语言模型路线,把音频离散成声学 token 后逐 token 生成长音频,并配套了 SheetSage2 做”音频转乐谱”。YuE2 则是在此基础上的升级版本:它把原先隐式的生成过程拆成了显式的符号规划加声学渲染两段,架构换成 AR-NAR 混合专家,控制粒度从”整首重抽”细化到”改一个和弦、换一段旋律”。

部署门槛方面,YuE2 主模型约 3.6B 参数,遵循 Apache 2.0 开源协议,单张 24GB 显存的显卡即可完成全本地离线推理。这意味着个人创作者和小型工作室不必依赖云端服务,歌词和作品也不必上传到第三方服务器,对在意数据和版权合规的用户尤为友好。

评测成绩是另一个被关注的点。在 WildSongBench 基准上,YuE2 的 best-of-8 配置取得 6.9632 的 SongBench 综合得分,官方给出的对照中高于 Suno v5.5 的 6.7150。需要说明的是,best-of-8 意味着同一提示生成 8 次取最优,因此这个数字更接近”能力上限”而非”一次出图稳定值”,实际使用体验还要看单次的平均表现。

从更宏观的视角看,YuE2 的出现对开源社区还有一个信号意义:AI 音乐生成第一次同时具备了”质量对标商业产品”和”过程完全透明”两个属性。对研究者,它提供了一个可以复现、可以改进的基线;对工具开发者,它的乐谱中间层天然适合接入 Agent 与工作流系统;对普通创作者,它把”在自己显卡上写一首歌”从概念变成了现实。这也是它发布后在社区引发广泛讨论的原因。

YuE2 的主要功能

YuE2 的能力可以概括为四条主线:创作、翻唱、编辑、理解。四条线共享同一个模型权重,切换的只是乐谱的来源——这也是它作为 YuE 升级版本在产品形态上最大的不同:初代 YuE 的各能力分散在不同尺寸的模型里,而 YuE2 把它们统一到了单一 Checkpoint 中。

  1. 基于乐谱的结构化创作:输入创作主题与歌词,系统首先输出结构严谨的 ABC 符号化乐谱,随后递进式地完声与编曲伴奏的完整合成。因为中间产物是文本乐谱,用户可以在渲染前就看清旋律走向与和声配置,而不是等音频出来才知道好不好听。
  2. 免微调的零样本翻唱:配合 SheetSage2 工具直接提取原曲的乐理骨架,无需针对翻唱任务做任何微调,就能用全新的曲风或全新的文本重新演绎已有作品。官方给出的 CLEWS mAP 源曲保留度为 0.647,说明旋律骨架的还原有量化保障。
  3. 智能体交互式二次修正:支持与 AI Agent 展开多轮对话,精准调整音乐的速度、和声走向乃至曲式结构,随时重新渲染出新版本。这让”再快一点””副歌换成小调”这类口头反馈第一次有了明确的执行对象。
  4. 录音全自动转谱:借助 SheetSage2 将任意音频转化为可视、可编辑的乐谱,为作品改编与二次创作提供入口。一段哼唱、一段现场录音,都可以先变成谱子再往下走。
  5. 全曲级音乐理解(MERT2):提供深度的音乐表征支持,在 MARBLE 基准测试的 15 个项目中拿下 14 项 SOTA,为上层转谱与生成任务打下基础。理解能力越强,转谱和翻唱的保真度就越高。

YuE2 的技术原理

YuE2 作为 YuE 的升级版本,架构上最大的变化是从单一自回归生成,转向”符号规划 + 声学渲染”的分段式设计。

  1. 显式符号中枢设计:YuE2 在条件文本与最终波形之间构建了 ABC 乐谱作为中间桥梁。这种白盒化机制打破了生成式 AI 的黑盒迷雾,使人类创作者或 Agent 能在波形渲染前直接干预曲调走向。这一层也是它区别于前代 YuE 的核心所在。
  2. AR-NAR 混合专家架构:模型搭载单体 Mixture-of-Transformers 骨架。自回归(AR)专家负责按序预测乐谱与语义 Token,锁定歌曲的结构逻辑与歌词对齐;非自回归(NAR)专家利用双向注意力机制对声学隐变量做 Flow Matching 预测(25Hz × 64),把控音频品质。两类专家共享混合自注意力层与 FFN,在单一 Checkpoint 内统筹规划与渲染。
  3. 无损 VAE 声学渲染管线:NAR 专家输出的隐变量经由 VAE 解码器无缝转化为 48kHz 立体声高采样率音频。训练端同步协同 SheetSage2 提取乐谱目标、MERT2+CVQ 生成语义 Token 目标,以及 VAE 编码器生成隐变量目标,三段目标对齐后才形成完整监督。
  4. 同源权重的多任务融合:无论是创作、无样本翻唱还是对话式编辑,均共享同一个 Checkpoint,仅凭乐谱来源差异自动切换工作流。翻唱时会切换为”仅旋律”模式,把伴奏部分留给模型重新适配新曲风,从而获得最大的改编度。
  5. 模块化分阶段推断 API:推断路径解耦为 plan()generate_semantic()synthesize()decode() 四大阶段,乐谱、语义 Token 及声学隐变量全部落盘保存。创作者可以随时导出中间件修改,也可以在保持原方案的前提下更换解码方案,实验弹性很高。

YuE2YuE2 的 GitHub 开源仓库(来源:github.com 页面截图)

如何使用 YuE2

YuE2 面向有一定工程能力的用户,官方推荐在 Linux 环境下部署。与云端音乐产品”打开网页就能用”不同,本地部署需要自己准备环境,但换来的是对生成过程的完全掌控——每一步的中间产物都在你自己的磁盘上。下面按从零到出第一首歌的顺序梳理。

  1. 准备部署环境:推荐运行环境为 Linux 系统与 Python 3.12,并配置支持 BF16 精度运算的 NVIDIA 显卡。首次执行时,模型权重会自动从 Hugging Face 完成挂载,因此需保证网络可访问 Hugging Face。
  2. 克隆仓库并安装:克隆 GitHub 代码库后建立虚拟环境,运行安装指令完成依赖安装。建议使用的虚拟环境,避免与其他项目的依赖版本冲突。
  3. 生成第一首歌:执行示例脚本 python examples/generate.py –output outputs/first-song,便能在输出目录中取得包含 FLAC 无损音频、ABC 乐谱及中间产物的全套成品。这一步的意义在于确认整条链路(下载权重、规划乐谱、渲染音频)都能跑通。
  4. 通过 Python API 调用:通过 YuE2Pipeline.from_pretrained(“m-a-p/YuE2-3B”) 加载管线后,利用 cot 参数切换创作模态——设为 “full” 可生成完备乐谱(默认);设为 “melody” 仅约束主旋律;设为 “off” 则直接端到端生成。
  5. 翻唱与精细化编辑:先用 SheetSage2 将原曲转为旋律 ABC 谱,再以 cot=”melody” 传入新歌词或风格重构;也可以调用 pipe.plan() 导出乐谱,经人工或 Agent 修改后,带入 –abc-file edited.abc –cot full 参数重新渲染。
  6. 扩展为 Agent 技能:可将项目内置的 skills/yue2-music/ 挂载至支持 SKILL.md 的 Agent 体系,通过自然语言对话完成写歌、修谱以及不同音轨版本的比对。

YuE2 的使用场景

由于乐谱层可读写,YuE2 适合的场景往往不是”一次性出成品”,而是”需要反复修改、需要解释得清”的创作与教学任务。判断一个需求适不适合 YuE2,可以看它是否满足两个条件之一:要么需要人参与到生成过程中间,要么对数据不出本地有硬性要求。

  1. 音乐人与非专业创作者:灵感快速落地的工具。即使不懂复杂乐理,也能依据提示词生成完整歌曲,并借助 ABC 乐谱对个别乐句做精细微调。对于习惯在 DAW 里工作的音乐人,乐谱还能直接导出为后续编曲的参考。
  2. 二创改编与音乐翻唱:配合转谱功能将经典曲目转换风格(如流行转爵士、摇滚转古风),或更换多语言歌词,大幅降低短视频二创与社媒传播的创作门槛。做这类的批量内容,也可以对比着看 抖音音乐创作实验室 这类面向短视频场景的平台。
  3. 影视、游戏与广告配乐 Demo:制作方可快速生成带人声或纯伴奏的候选配乐,低成本试错后再决定是否聘请真人团队制作,显著压缩前期沟通成本。若团队已有云端音乐生成工作流,MELO音乐 这类多模态平台也值得放在一起评估。
  4. 教学示范与乐理分析:音乐院校教师可针对特定和弦走向生成伴奏范例,学生能对照 ABC 乐谱同步聆听与重构,形成”听得见、看得见、改得动”的互动教学闭环。这是纯黑盒模型很难替代的一类场景。
  5. 本地化与隐私敏感的创作流程:由于遵循 Apache 2.0 协议、支持单卡 24GB 本地部署,歌词、旋律构思和成品都不必离开本地设备,适合对素材保密有要求的商业项目。需要参考曲库与素材时,可配合 糖果无损音乐 这样的资源站做风格调研。

YuE2 与 Suno v5.5 竞品多维对比

下表按官方给出的口径,把 YuE2 与商业闭源产品 Suno v5.5 放在几个关键维度上对照。可以看到两者并非全面碾压关系:YuE2 胜在可控性、开放度和本地部署,Suno v5.5 在歌词咬字清晰度和文本语义匹配上更优。

对比维度YuE2(港科大 / M-A-P 团队)Suno v5.5(Suno Inc.)
产品定位与开放度开源学术与应用模型(约 3.6B 参数),支持全本地部署商业闭源 API 服务的云端生成产品
生成质量指标SongBench Avg 达到 6.9632(Bo8 模式)/ 6.7316(标准版),榜单表现居前列SongBench Avg 为 6.7150,综合评分略低于 YuE2 的两个版本
核心生成机制乐谱规划白盒模式:先产出可编辑 ABC 乐谱再渲染 48kHz 音频,全流程可视黑盒端到端波形生成,缺乏可交互的中间乐理表示
精细化控制力可直接读写与替换乐谱音符,支持 Agent 对话式精修和声与节奏主要依赖 Prompt 提示词引导,修改过程依赖整曲随机重抽
改编与翻唱能力零样本乐谱翻唱:搭配转谱引擎,CLEWS mAP 达到 0.647,旋律把控精确缺乏显式乐理提取层,仅凭 Prompt 引导,原曲走势与旋律保持度不可控
歌词吐字清晰度PER 发音错误率 9.79%(Bo8)/ 8.44%(标准版)PER 仅 5.96%,歌词咬字与清晰度表现更为优异
文本语义匹配MuLan 指标 0.5051MuLan 指标 0.5089,文本语义契合度略高
部署与数据隐私Apache 2.0 协议,权重开放下载,24GB 单显卡即可本地私有化运行完全托管于云端,需上传歌词与作品,无法私有化部署

YuE2 的常见问题解答

YuE2 和上一代 YuE 是什么关系?
YuE2 是初代开源音乐模型 YuE 的升级版本,由同一批团队——香港科技大学与 M-A-P——联合推出。初代 YuE 走的是自回归语言模型路线,把音频离散成声学 token 后逐 token 生成;YuE2 则引入了”先写 ABC 乐谱、再渲染音频”的符号规划机制,并改用 AR-NAR 混合专家架构,把创作过程从黑盒变成了可编辑的白盒。功能上,YuE2 在创作之外新增了零样本翻唱、Agent 对话式编辑和分阶段推断 API。
本地运行 YuE2 需要什么硬件?
官方推荐环境为 Linux 系统与 Python 3.12,并配置支持 BF16 精度运算的 NVIDIA 显卡。主模型约 3.6B 参数,单张 24GB 显存的显卡即可完成全本地离线推断。首次执行时模型权重会自动从 Hugging Face 下载,因此需要保证网络可访问 Hugging Face,并预留相应的磁盘空间用于存放权重和中间产物。
生成的乐谱可以导出到专业音乐软件里继续用吗?
可以。YuE2 的中间产物是 ABC 记谱法格式的纯文本乐谱,包含旋律与和弦信息,推断过程中的乐谱、语义 Token 和声学隐变量都会落盘保存。ABC 是一种通用且被广泛支持的记谱格式,可以导入到多种打谱与 DAW 工具中继续编辑。也就是说,YuE2 的定位是”创作起点”而非”出版终点”,混音、母带、人声对齐等后期工作仍建议在专业音频工作站中完成。

YuE2 官网网址

以下为 YuE2 的官方入口与资源地址,建议通过官方渠道获取最新的模型权重、安装说明与使用示例。

  1. YuE2 官方主页https://map-yue2.github.io/
  2. GitHub 仓库地址https://github.com/multimodal-art-projection/YuE
  3. Hugging Face 模型权重https://huggingface.co/m-a-p/YuE2-3B

OpenI AI时代点评

YuE2 最值得肯定的一点,是它没有继续在”黑盒生成质量”这条路上卷参数,而是回头解决了一个更基础的问题:创作者到底能不能控制 AI 生成的东西。把 ABC 乐谱做成中间层之后,”改一个和弦””把副歌换成小调”这类需求第一次有了直接的操作对象,而不必靠反复抽卡碰运气。对音乐人来说,这种可控性往往比单次生成的惊艳程度更有长期价值。

同时也要客观看待它的位置。评测口径上,6.9632 的 SongBench 成绩来自 best-of-8 配置,代表能力上限;而在 PER 歌词错误率和 MuLan 语义匹配这两项上,Suno v5.5 仍然占优。加上本地部署需要 24GB 显存、环境搭建有一定门槛,YuE2 目前更适合愿意折腾的创作者、研究者和对数据隐私有要求的团队,而不是追求开箱即用的普通用户。

如果你是从上一代 YuE 过来的,YuE2 的升级点相当明确:乐谱层、AR-NAR 架构、零样本翻唱和分阶段推断 API,每一项都指向”可控”这一个目标,值得为它重新搭一次环境。若你更关心不同路线的横向选择,可以在 OpenI 上把 MELO音乐抖音音乐创作实验室 等条目一并对比后再决定。最新进展请以 YuE2 官方主页 的说明为准。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...