MuScriptor

MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型

MuScriptor,一款由 Kyutai 与 Mirelo 倾力打造的尖端开源多乐器音乐转录模型,正以前所未有的精度和效率,将纷繁复杂的真实世界音乐音频转化为标准的 MIDI 格式。

MuScriptor 究竟是什么?

MuScriptor 是一款开创性的开源多乐器音乐转录工具,由 Kyutai 与 Mirelo 携手推出。它能够自动将涵盖各种音乐流派的真实世界音乐音频,精准地转录成 MIDI 文件。值得一提的是,MuScriptor 是首个在包含 17 万首歌曲的庞大真实数据集上进行训练的模型。其核心采用了纯解码器 Transformer 架构,并提供从 6000 万到 14 亿四种不同参数规模的版本,极大地满足了不同用户的性能和精度需求。该模型还具备乐器条件控制功能,并且其源代码已根据 MIT 协议进行开源。

MuScriptor 的核心亮点

  • 多乐器音频的精准转录:MuScriptor 能够将包含多种乐器的真实音乐音频,自动转化为通用的 MIDI 格式。它能够识别并转录钢琴、吉他、鼓、贝斯等多达 36 种不同的乐器。
  • 广泛的音乐流派兼容性:无论是流行、古典、摇滚还是重金属,MuScriptor 都能游刃有余地处理。它能够适应各种复杂的真实混音场景,确保转录的准确性。
  • 灵活的乐器条件控制:用户可以指定需要转录的目标乐器集合,实现高度定制化的输出。这一功能还能够确保在跨片段的乐器识别中保持高度的一致性。
  • 多规格模型选择,兼顾性能与精度:MuScriptor 提供了 6000 万、1.03 亿、3.07 亿以及 14 亿四种参数规模的模型。用户可以根据实际需求,在轻量化部署和追求极致精度之间做出最佳选择。
  • 端到端全自动处理流程:只需输入 5 秒的音频片段,MuScriptor 即可自动完成分帧、特征提取、音符检测以及最终的 MIDI 生成等全过程,操作极为便捷。

MuScriptor 的技术内涵

  • 纯解码器 Transformer 架构的创新应用:该模型以 5 秒音频切片为输入,将 16kHz 的单声道音频转化为 mel-spectrogram,并利用自回归的方式预测 MIDI 风格的 token 序列,从而实现了端到端的多乐器转录。
  • 三阶段精细化训练策略:MuScriptor 的训练过程分为三个关键阶段。首先,模型在 150 万条合成 MIDI 数据上进行预训练,打下坚实基础。接着,在 17 万首真实音乐上进行微调,提升对真实音乐的适应性。最后,通过对 300 首高质量标注数据进行 GRPO 风格的强化学习后训练,进一步优化输出质量,使其更加贴近人类的期望。
  • 精妙的乐器条件控制机制:通过前缀嵌入,MuScriptor 能够接收用户指定的乐器集合。这种设计不仅让用户能够自定义转录的乐器种类,还借助 classifier-free guidance 技术,稳定了跨片段的乐器分配一致性。
  • 强大的数据合成与增强管线:在预训练阶段,MuScriptor 采用了动态合成流程。通过对 MIDI 数据进行音高偏移、速度变化、乐器随机化等符号级增强,并利用 250 多种 soundfont 合成音频,同时加入随机失谐,极大地提升了模型的泛化能力。

扫描微信二维码,回复“开源”,即可加入AI开源项目交流群,与众多开发者一同探索。

如何体验 MuScriptor 的强大功能

  • 环境的先行准备:首先,您需要克隆 MuScriptor 的 GitHub 仓库,并按照说明安装所需的依赖项。请确保您的系统支持 Python 和 PyTorch 等主流深度学习框架。
  • 获取模型权重:您可以从官方渠道下载对应参数规模(1.03 亿、3.07 亿或 14 亿)的模型权重文件。
  • 模型加载与初始化:利用提供的推理代码,您可以轻松地初始化 MuScriptor 模型。在加载模型时,还可以选择是否启用乐器条件控制功能。
  • 输入待转录的音频:将您想要转录的音频文件(支持多种格式)输入模型。模型会自动将其分割成 5 秒的片段进行处理。
  • 获取生成的 MIDI 文件:模型处理完成后,将输出标准的 MIDI 文件。您可以直接将这些 MIDI 文件导入到您的数字音频工作站(DAW)或乐谱编辑软件中,进行后续的创作和编辑。

MuScriptor 的卓越优势

  • 无与伦比的真实世界泛化能力:与那些主要依赖合成数据训练的模型(如 MT3)相比,MuScriptor 在海量的 17 万首真实多乐器音乐上进行了训练。这使得它在处理复杂真实的混音场景时,错误率显著降低。MuScriptor 无疑是目前最出色的开源多乐器转录模型。
  • 强化学习赋能的高质量输出:通过 GRPO 风格的强化学习后训练阶段,MuScriptor 在音符的 onset、offset 和 frame 级别的 F1 分数均得到了显著提升,有效减少了漏检和误检现象。
  • 高度灵活的乐器条件控制:用户能够精确指定需要转录的乐器种类,不仅能精简输出结果,更能确保跨音频片段的乐器识别保持高度一致性,避免了因片段划分而导致的乐器分配波动。
  • 多规格开源,普惠大众:MuScriptor 提供了从 6000 万到 14 亿的四种模型规模,既能满足边缘设备的部署需求,也能兼顾追求高精度用户的需求。其代码采用 MIT 协议开源,权重文件则以 CC BY-NC 4.0 协议开放获取。

MuScriptor 的项目链接

  • GitHub 仓库:https://github.com/muscriptor/muscriptor
  • HuggingFace 模型库:https://huggingface.co/MuScriptor
  • arXiv 技术论文:https://arxiv.org/pdf/2607.08168v1

MuScriptor 与同类竞品的深度对比

对比维度MuScriptorYourMT3+
发布方Kyutai / Mirelo学术研究团队
架构纯解码器 Transformer分层注意力 Transformer + MoE
训练数据150万合成 MIDI + 17万真实音乐 + 300首 RL 数据小规模合成数据 + 有限真实数据
核心策略真实数据微调 + 强化学习后训练架构改进 + 跨数据集增强
乐器控制支持显式乐器条件控制不支持
开源协议代码 MIT / 权重 CC BY-NC 4.0部分开源
真实音频表现Multi F1 约 41.6,显著领先作为 baseline 被超越
力度信息分词器暂不支持视具体实现而定

MuScriptor 的多元化应用场景

  • 音乐制作的得力助手:音乐制作人可以将现有的无 MIDI 音频快速转换为可编辑的 MIDI 轨道,从而轻松进行重新编曲、混音或采样操作。
  • 乐谱自动生成的革新:音乐教育机构和出版方能够利用 MuScriptor 将录音自动转化为乐谱,大幅降低人工扒谱的成本和时间。
  • 音乐信息检索的强大支撑:为和弦识别、调性分析、风格分类等下游任务提供高质量的符号化输入,极大地推动了相关研究的进展。
  • 生成式音乐建模的基石:为音乐生成模型提供海量、高质量的 MIDI 训练数据,有力地促进了符号音乐生成领域的研究与发展。
  • 音乐考古与存档的利器:将历史录音、现场演出等非结构化音频转化为结构化的 MIDI 数据,便于进行数字化保存、深入分析和信息挖掘。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...