MiniMax Music 3.0

AI工具19分钟前更新 AI工具集
0 0 0

MiniMax Music 3.0 – MiniMax 开源的音乐生成模型

MiniMax Music 3.0 是 MiniMax 公司重磅发布的尖端音乐生成模型,它标志着开放权重 AI 音乐创作领域迈入了一个全新的阶段。该模型创新性地采用了由 8B Global LLM 与 0.6B Local LLM 构成的分层式架构,并深度整合了 Flow Matching 与 Flow-VAE 连续隐状态合成技术。这一技术组合赋予了模型强大的表现力,能够依据用户提供的歌词及结构化音乐指引,创作出时长最高达 5 分钟、音质达到 32kHz 立体声标准的完整音乐作品。无论是对段落的精准把控,还是在长音频中保持节奏、歌声特色与音乐主题的高度统一,MiniMax Music 3.0 都能轻松胜任,真正实现了从最初的创作构思到高品质音频成品的无缝转化。

MiniMax Music 3.0 的核心功能亮点包括:

  • 完整歌曲创作:支持打造长达 5 分钟的音乐作品,涵盖从前奏、主歌、副歌到桥段、尾奏等全套结构。
  • 歌词引导式生成:只需输入歌词和风格描述,即可自动生成包含人声演唱与器乐编曲的专业级成品。
  • 精细化段落编排:通过 [Verse]、[Chorus]、[Bridge] 等标签,用户可以精确操纵歌曲每一部分的氛围走向与编曲细节。
  • 卓越的长程稳定性:确保在数分钟的音频播放中,音乐的主题逻辑、节拍律动、歌手音色及编曲编排始终保持连贯且不走样。
  • 录音室级音质:输出的 32kHz、16-bit 立体声 WAV 文件,音色纯净且层次分明,具备极高的听感品质。
  • 智能提示词润色:内置的 music-caption-rewriter 引擎能自动将简单的描述词转化为包含元数据、人声细节及编曲架构的专业级提示词。

在技术实现层面,MiniMax Music 3.0 展现了深厚的工程底蕴:

  • 混合式自回归架构(Hybrid-LM):8B 参数的 Global LLM(基于 Qwen3 优化)负责把控宏观的音乐结构与语义逻辑,而 0.6B 参数的 Local LLM 则专注于微观声学细节的填充,两者高效协作,确保了音乐作品在“骨架”与“血肉”上的完美平衡。
  • 多层残差向量量化(RVQ):通过 8 层 RVQ 编码系统,首层负责核心语义,后续层级逐级填充声学细节,在保证生成稳定性的同时,极大地提升了音乐的重建质量。
  • 连续隐状态合成技术:通过将 LLM 的隐状态直接输入至 Flow Matching 模块,并配合 123M 参数的 Flow-VAE 进行解码,模型能够保留极其细腻的高维声学信息,使人声发音、乐器表现及整体音色更加真实自然。
  • 结构化创作框架:将单一的描述转化为包含“全局元数据”、“人声细节”与“编曲演进”的三段式指令,让 AI 能够精准执行复杂的音乐创作意图。

若想在本地体验这款强大的模型,用户需准备两张支持 CUDA 的 NVIDIA 显卡,并配置好 SGLang-Omni 推理环境。通过 HuggingFace 拉取模型权重后,利用 sgl-omni 启动服务,即可通过 API 接口发送包含歌词段落标签与编曲指令的请求,进而获取高质量的 WAV 音频文件。对于追求极致效果的用户,强烈建议使用内置的提示词增强工具,以确保生成的音乐精准符合预想的风格。

对比行业内的闭源竞品,MiniMax Music 3.0 的核心竞争力在于其“开放权重”的灵活性与“结构化控制”的专业性。它不仅赋予了开发者本地部署的,还通过精细化的三段式描述体系,解决了 AI 音乐创作中常见的“不可控”问题。从音乐人的 Demo 制作,到游戏动态配乐、短视频音轨定制以及广告营销音频生产,MiniMax Music 3.0 正在以其卓越的性能表现,成为各行业创作者的强力助手。

欲了解更多详情,请访问项目官网:https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model 或关注 GitHub 仓库:https://github.com/MiniMax-AI/MiniMax-Music3。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...