MAGI-2-preview – Sand.ai 开源的多模态视频生成模型
MAGI-2-preview:Sand.ai 推出性千亿参数多模态视频生成模型
Sand.ai 公司近日发布了其备受瞩目的开源项目 MAGI-2-preview,这标志着在多模态视频生成领域迈出了历史性的一步。MAGI-2-preview 作为全球首个千亿参数的 MoE(Mixture-of-Experts)多模态视频生成模型,拥有高达 114B 的总参数量,然而其激活参数却仅为 6B,这一特性预示着在保持强大生成能力的同时,显著降低了推理成本。
该模型继承了 MAGI 系列的单流架构精髓,巧妙地将文本、视频和音频信息整合至同一 Transformer 框架内进行联合建模。这种原生多模态的融合方式,使得模型能够从根本上实现对不同模态信息的深度理解与生成,从而在 AA 视频生成榜单上斩获第六名的佳绩。MAGI-2-preview 不仅提供了模型代码和预训练权重,更重要的是,它为视频生成领域探索高效的 Scaling(规模化)新路径提供了宝贵的实践范例。
MAGI-2-preview 的核心亮点
- 全能多模态视频创作:MAGI-2-preview 能够驾驭文本、图像、甚至视频到视频的生成任务,并无缝融合音频的理解与生成能力,实现真正的多模态视频创作。
- MoE 架构的智慧激活:尽管拥有 114B 的庞大参数规模,模型在每次推理过程中仅激活 6B 参数,极大地优化了计算效率,降低了运行门槛。
- 一体化单流设计:彻底颠覆了以往通过交叉注意力拼接多模态信息的传统方法,MAGI-2-preview 从最底层即实现了画面与声音的统一建模,确保了信息交互的流畅性。
- 突破性的 Scaling 效率:针对视频生成特有的长序列挑战,MAGI-2-preview 优化了 MoE 的通信机制和训练稳定性,有效解决了超长序列处理中的跨卡通信瓶颈问题。
MAGI-2-preview 的技术基石
- MoE 混合专家系统:以 114B 的总容量为基础,单次前向计算仅需调用 6B 参数,实现了模型容量与实际计算量的有效分离,是其高效性的关键。
- 精妙的单流 Transformer:文本、视频、音频的 token 在输入阶段即汇入同一 Transformer,通过自注意力机制实现跨模态信息的直接交互。相比于多塔结构,这种设计更能捕捉到音画之间的细微同步关系。
- 分布式通信的革新:针对视频数据长序列的特点,模型重构了专家并行下的 token 路由和通信策略,显著减少了 GPU 间的数据传输开销。
- 多重保障的训练稳定性:通过动态路由、专家负载均衡以及多模态数据联合训练等三重机制,确保了模型在复杂训练过程中的稳定性。
想要深入了解或参与到 AI 开源项目交流中,请关注微信公众号并回复“开源”,加入我们的专属交流群。
如何激活 MAGI-2-preview 的潜力
- 环境搭建指南:首先,克隆 MAGI-2-preview 的 GitHub 仓库(SandAI-org/MAGI-2-preview),并根据 README 文件中的说明完成依赖库的配置。
- 获取模型权重:预训练权重可在 GitHub Releases 页面下载。
- 执行推理操作:通过修改配置文件和脚本参数,您可以灵活选择
t2v(文本到视频)、i2v(图像到视频)或v2v(视频到视频)等生成模式。操作方式可参考 MAGI-1 的run.sh脚本。 - 硬件配置建议:具体的硬件要求将由官方文档进一步更新。目前可参考 MAGI-1 的配置,例如使用多张 H100 GPU 进行 24B 参数的模型训练,或者在单卡拥有 24GB VRAM 的设备上运行 4.5B 模型。
MAGI-2-preview 的独特优势
- 开放与商用并存:MAGI-2-preview 采用 Apache 2.0 协议,这意味着模型本身、预训练权重以及推理代码均可免费使用,并支持商业化部署。
- 千亿 MoE 的先驱:作为全球首个开源的千亿级 MoE 视频生成模型,它为视频生成领域的规模化发展开辟了新的道路。
- 低成本高性能的典范:仅需 6B 的激活参数即可驱动 114B 的模型,其推理成本远低于同等规模的稠密模型。
- 深度融合的原生多模态:单流架构确保了音视频信息在模型底层就得到深度融合,避免了后期对齐可能带来的延迟和质量损失。
MAGI-2-preview 的相关链接
- 官方博客:https://sand.ai/blog/magi-2-preview
- GitHub 仓库:https://github.com/SandAI-org/MAGI-2-preview
- HuggingFace 模型库:https://huggingface.co/sand-ai/MAGI-2-preview
MAGI-2-preview 与竞品的比较
| 对比维度 | MAGI-2-preview | Wan2.7-Video |
|---|---|---|
| 开发者 | Sand.ai | 阿里通义实验室 |
| 架构特点 | MoE + 单流自回归 Transformer | 3D DiT + MoE + 流匹配 |
| 总参数量 | 114B | 270B(基于 14B 系列) |
| 激活参数量 | 6B | 140B |
| 生成范式 | 自回归 | 扩散(流匹配) |
| 多模态能力 | 原生音视频联合建模(单流整合) | 文本/图像/视频/音频全输入支持 |
| 视频生成时长 | 继承 MAGI-1 流式能力,未明确具体上限 | 2-15 秒 |
| 视频分辨率 | 未明确 | 720P / 1080P |
| 开源协议 | Apache 2.0(支持商用) | 开源(权重开放) |
| 核心优势 | 高效 Scaling,原生多模态视频生成 | 视频编辑、参考生视频、运镜控制、表情驱动 |
| 榜单表现 | AA 视频生成榜第六名 | DesignArena V2V 榜首 |
| 视频编辑功能 | 未明确 | 支持一句话修改视频、风格迁移、局部内容替换 |
MAGI-2-preview 的广泛应用前景
- 商业广告与短剧创作:凭借 MoE 的强大叙事建模能力,MAGI-2-preview 可生成分钟级的连贯剧,为广告和短剧制作提供强大支持。
- 影视后期预演与融合:其原生音频理解能力,使得配音、音效与画面能够实现精准同步的生成与后期编辑,极大地提升影视制作效率。
- AI 视频研究的基石:作为首个开源的千亿级视频 MoE 模型,MAGI-2-preview 为学术界提供了可复现的 Scaling 基准,推动 AI 视频领域的研究发展。
- 企业级私有化部署:基于 Apache 2.0 协议,MAGI-2-preview 适用于金融、医疗等对数据安全要求极高的行业,构建自主可控的视频生成解决方案。
- 实时流媒体生成新可能:稀疏激活的特性显著降低了推理成本,为实现低延迟的实时视频生成和直播场景提供了技术支撑。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


