AI文生视频

MAGI-2-preview

Sand.ai开源的千亿参数MoE多模态视频生成模型,114B总参数仅激活6B

标签: 大模型API全网最稳定的官方企业级渠道
一站式AI创作平台

MAGI-2-preview官网

MAGI-2-preview 是 Sand.ai 开源的多模态视频生成模型,也是目前全球第一个开源的千亿参数级 MoE 视频模型。总参数 114B,但每次推理只激活 6B——容量和算力就此解耦,跑起来的成本远低于同等规模的稠密模型。

它延续了 MAGI 系列的单流架构:文本、视频、音频从第一层就进同一个 Transformer 联合建模,不走”多塔拼接再对齐”的老路。这样音画同步的细节是在底层长出来的,而不是后期硬凑。模型目前在 AA 视频生成榜排第六,代码和预训练权重已全部开放。

MAGI-2-preview

主要功能

  • 多模态视频生成:文生视频、图生视频、视频生视频三种模式都支持,原生带音频理解。
  • MoE 稀疏激活:114B 总容量,单次前向只点亮 6B 专家,推理开销压得很低。
  • 单流统一架构:跳过 cross-attention 拼接,画面和声音从输入层就在同一注意力空间里交换信息。
  • 面向视频的 Scaling 优化:针对超长序列重构了专家并行的 token 路由和跨卡通信策略。
  • 训练稳定性机制:动态路由、专家负载均衡、多模态联合训练三重保障,缓解 MoE 常见的训练崩塌。

如何使用MAGI-2-preview

  • 拉取代码:克隆 GitHub 仓库 SandAI-org/MAGI-2-preview,按 README 装依赖。
  • 下载权重:从 GitHub Releases 或 HuggingFace 获取预训练权重。
  • 选择生成模式:改配置文件切换 t2v / i2v / v2v,脚本格式沿用 MAGI-1 的 run.sh。
  • 准备硬件:官方尚未给出 preview 版的确切配置,可参考 MAGI-1 的方案——24B 需多卡 H100,4.5B 版单张 24GB 显存可跑。

使用场景

  • 长视频广告与短剧:大容量适合建模复杂叙事,能撑起分钟级的连贯剧情。
  • 影视预演:原生音频能力让配音、音效跟画面一起生成,省掉后期对轨。
  • 学术研究:千亿级视频 MoE 权重开源,给学界提供了一条可复现的 Scaling 基线。
  • 企业私有化部署:Apache 2.0 协议对金融、医疗这类数据不能出内网的行业友好。
  • 实时流媒体:稀疏激活带来的低推理成本,让低延迟的直播场景生成变得可行。

产品价格与版本

MAGI-2-preview 采用 Apache 2.0 协议开源,权重与推理代码免费且可商用。当前是 preview 预览版,正式版尚未发布。横向比一下阿里通义的 Wan2.7-Video:后者走 3D DiT 加流匹配的扩散路线,总参数 270B、激活 140B,在视频编辑(一句话改视频、风格迁移、局部替换)和运镜控制上更成熟,明确支持 2 到 15 秒、720P/1080P。MAGI-2-preview 走的是自回归加 MoE,强项在推理成本和原生音视频联合建模,编辑能力和时长上限目前还没公布。两者定位不同,不是简单的谁强谁弱。

常见问题解答

114B 的模型,普通团队跑得动吗?
关键看激活参数而非总参数——每次只激活 6B,显存占用和算力需求都比同规模稠密模型低一大截。不过 114B 的权重本身还是要完整加载,存储和多卡配置仍有门槛,preview 版官方配置要求还没定。
它和 MAGI-1 是什么关系?
MAGI-2-preview 延续了 MAGI-1 的单流自回归架构和流式生成能力,主要升级是引入 MoE 把容量拉到千亿级,并把音频纳入原生建模。使用方式上,运行脚本格式也基本沿用 MAGI-1。
可以商用吗?
可以。Apache 2.0 协议允许商用与二次开发,这在千亿级视频模型里比较少见。但它是 preview 版本,上生产前建议先在自己的素材上做充分评测。

官网网址

项目官网:https://sand.ai/blog/magi-2-preview

GitHub 仓库:https://github.com/SandAI-org/MAGI-2-preview

HuggingFace 模型库:https://huggingface.co/sand-ai/MAGI-2-preview

OpenI AI时代点评

视频生成这两年一直被算力卡着脖子——想要质量就得堆参数,堆完了推理又贵到没法商用。MAGI-2-preview 把 MoE 搬进视频领域,用 6B 激活撬动 114B 容量,等于给这个死结提供了一个解法。更重要的是它真的开源了权重,而不是只放个技术报告。

单流架构是另一处值得关注的取舍。音画在底层同一空间里建模,理论上同步性会比后期对齐更自然,代价是序列长度暴涨、通信压力大,所以团队才花大力气重构专家并行的路由策略。至于实际生成质量,preview 版还没有足够的第三方评测,视频时长和分辨率也没公布,观望一段时间更稳妥。想找已经能直接上手的多模态工具,可以对比看看 AstraFlow星图 这类偏应用层的方案。

数据评估

MAGI-2-preview浏览人数已经达到14,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:MAGI-2-preview的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找MAGI-2-preview的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于MAGI-2-preview特别声明

本站OpenI提供的MAGI-2-preview都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由OpenI实际控制,在2026年 8月 6日 上午11:04收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,OpenI不承担任何责任。

相关导航