MuScriptor – Kyutai 联合 Mirelo 开源的多乐器音乐转录模型
MuScriptor,一款由 Kyutai 与 Mirelo 倾力打造的尖端开源多乐器音乐转录模型,正以前所未有的精度和效率,将纷繁复杂的真实世界音乐音频转化为标准的 MIDI 格式。
MuScriptor 究竟是什么?
MuScriptor 是一款开创性的开源多乐器音乐转录工具,由 Kyutai 与 Mirelo 携手推出。它能够自动将涵盖各种音乐流派的真实世界音乐音频,精准地转录成 MIDI 文件。值得一提的是,MuScriptor 是首个在包含 17 万首歌曲的庞大真实数据集上进行训练的模型。其核心采用了纯解码器 Transformer 架构,并提供从 6000 万到 14 亿四种不同参数规模的版本,极大地满足了不同用户的性能和精度需求。该模型还具备乐器条件控制功能,并且其源代码已根据 MIT 协议进行开源。
MuScriptor 的核心亮点
- 多乐器音频的精准转录:MuScriptor 能够将包含多种乐器的真实音乐音频,自动转化为通用的 MIDI 格式。它能够识别并转录钢琴、吉他、鼓、贝斯等多达 36 种不同的乐器。
- 广泛的音乐流派兼容性:无论是流行、古典、摇滚还是重金属,MuScriptor 都能游刃有余地处理。它能够适应各种复杂的真实混音场景,确保转录的准确性。
- 灵活的乐器条件控制:用户可以指定需要转录的目标乐器集合,实现高度定制化的输出。这一功能还能够确保在跨片段的乐器识别中保持高度的一致性。
- 多规格模型选择,兼顾性能与精度:MuScriptor 提供了 6000 万、1.03 亿、3.07 亿以及 14 亿四种参数规模的模型。用户可以根据实际需求,在轻量化部署和追求极致精度之间做出最佳选择。
- 端到端全自动处理流程:只需输入 5 秒的音频片段,MuScriptor 即可自动完成分帧、特征提取、音符检测以及最终的 MIDI 生成等全过程,操作极为便捷。
MuScriptor 的技术内涵
- 纯解码器 Transformer 架构的创新应用:该模型以 5 秒音频切片为输入,将 16kHz 的单声道音频转化为 mel-spectrogram,并利用自回归的方式预测 MIDI 风格的 token 序列,从而实现了端到端的多乐器转录。
- 三阶段精细化训练策略:MuScriptor 的训练过程分为三个关键阶段。首先,模型在 150 万条合成 MIDI 数据上进行预训练,打下坚实基础。接着,在 17 万首真实音乐上进行微调,提升对真实音乐的适应性。最后,通过对 300 首高质量标注数据进行 GRPO 风格的强化学习后训练,进一步优化输出质量,使其更加贴近人类的期望。
- 精妙的乐器条件控制机制:通过前缀嵌入,MuScriptor 能够接收用户指定的乐器集合。这种设计不仅让用户能够自定义转录的乐器种类,还借助 classifier-free guidance 技术,稳定了跨片段的乐器分配一致性。
- 强大的数据合成与增强管线:在预训练阶段,MuScriptor 采用了动态合成流程。通过对 MIDI 数据进行音高偏移、速度变化、乐器随机化等符号级增强,并利用 250 多种 soundfont 合成音频,同时加入随机失谐,极大地提升了模型的泛化能力。
扫描微信二维码,回复“开源”,即可加入AI开源项目交流群,与众多开发者一同探索。
如何体验 MuScriptor 的强大功能
- 环境的先行准备:首先,您需要克隆 MuScriptor 的 GitHub 仓库,并按照说明安装所需的依赖项。请确保您的系统支持 Python 和 PyTorch 等主流深度学习框架。
- 获取模型权重:您可以从官方渠道下载对应参数规模(1.03 亿、3.07 亿或 14 亿)的模型权重文件。
- 模型加载与初始化:利用提供的推理代码,您可以轻松地初始化 MuScriptor 模型。在加载模型时,还可以选择是否启用乐器条件控制功能。
- 输入待转录的音频:将您想要转录的音频文件(支持多种格式)输入模型。模型会自动将其分割成 5 秒的片段进行处理。
- 获取生成的 MIDI 文件:模型处理完成后,将输出标准的 MIDI 文件。您可以直接将这些 MIDI 文件导入到您的数字音频工作站(DAW)或乐谱编辑软件中,进行后续的创作和编辑。
MuScriptor 的卓越优势
- 无与伦比的真实世界泛化能力:与那些主要依赖合成数据训练的模型(如 MT3)相比,MuScriptor 在海量的 17 万首真实多乐器音乐上进行了训练。这使得它在处理复杂真实的混音场景时,错误率显著降低。MuScriptor 无疑是目前最出色的开源多乐器转录模型。
- 强化学习赋能的高质量输出:通过 GRPO 风格的强化学习后训练阶段,MuScriptor 在音符的 onset、offset 和 frame 级别的 F1 分数均得到了显著提升,有效减少了漏检和误检现象。
- 高度灵活的乐器条件控制:用户能够精确指定需要转录的乐器种类,不仅能精简输出结果,更能确保跨音频片段的乐器识别保持高度一致性,避免了因片段划分而导致的乐器分配波动。
- 多规格开源,普惠大众:MuScriptor 提供了从 6000 万到 14 亿的四种模型规模,既能满足边缘设备的部署需求,也能兼顾追求高精度用户的需求。其代码采用 MIT 协议开源,权重文件则以 CC BY-NC 4.0 协议开放获取。
MuScriptor 的项目链接
- GitHub 仓库:https://github.com/muscriptor/muscriptor
- HuggingFace 模型库:https://huggingface.co/MuScriptor
- arXiv 技术论文:https://arxiv.org/pdf/2607.08168v1
MuScriptor 与同类竞品的深度对比
| 对比维度 | MuScriptor | YourMT3+ |
|---|---|---|
| 发布方 | Kyutai / Mirelo | 学术研究团队 |
| 架构 | 纯解码器 Transformer | 分层注意力 Transformer + MoE |
| 训练数据 | 150万合成 MIDI + 17万真实音乐 + 300首 RL 数据 | 小规模合成数据 + 有限真实数据 |
| 核心策略 | 真实数据微调 + 强化学习后训练 | 架构改进 + 跨数据集增强 |
| 乐器控制 | 支持显式乐器条件控制 | 不支持 |
| 开源协议 | 代码 MIT / 权重 CC BY-NC 4.0 | 部分开源 |
| 真实音频表现 | Multi F1 约 41.6,显著领先 | 作为 baseline 被超越 |
| 力度信息 | 分词器暂不支持 | 视具体实现而定 |
MuScriptor 的多元化应用场景
- 音乐制作的得力助手:音乐制作人可以将现有的无 MIDI 音频快速转换为可编辑的 MIDI 轨道,从而轻松进行重新编曲、混音或采样操作。
- 乐谱自动生成的革新:音乐教育机构和出版方能够利用 MuScriptor 将录音自动转化为乐谱,大幅降低人工扒谱的成本和时间。
- 音乐信息检索的强大支撑:为和弦识别、调性分析、风格分类等下游任务提供高质量的符号化输入,极大地推动了相关研究的进展。
- 生成式音乐建模的基石:为音乐生成模型提供海量、高质量的 MIDI 训练数据,有力地促进了符号音乐生成领域的研究与发展。
- 音乐考古与存档的利器:将历史录音、现场演出等非结构化音频转化为结构化的 MIDI 数据,便于进行数字化保存、深入分析和信息挖掘。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


