VDN-MiniMax-H3

AI工具10小时前更新 AI工具集
0 0 0

VDN-MiniMax-H3 是什么

VDN-MiniMax-H3 是 OpenVDN 团队开源的一套视频生成加速方案,基于已开源的 MiniMax-H3 视频生成模型改造而成。项目同时公开了模型权重、训练代码与优化后的推理实现,目标是在几乎不损失画质的前提下,把视频扩散模型最昂贵的去噪开销压到最低。官方给出的成绩相当直观:在 8 张 NVIDIA B200 显卡上,仅用 8 步去噪、约 11 秒就能生成一段 14 秒左右的 768p 视频,出片速度已经快过视频本身的播放时长。

与常见的”换个更小的模型”或”单纯砍步数换速度”不同,VDN-MiniMax-H3 走的是架构重构路线:用局部滑动窗口 Softmax 注意力保住画面细节,用远距离线性注意力处理长程时序上下文,再通过 DMD2 蒸馏把去噪步数从常规的 50 步压缩到 8 步。整个过程中 MiniMax-H3 的原始主干权重不被破坏,新增能力以可合并的分支与 LoRA 适配器形式挂载,随时可以拆下还原。

VDN-MiniMax-H3VDN-MiniMax-H3 开源项目仓库

VDN-MiniMax-H3 的主要功能

  1. 混合注意力推理:把视频 Token 之间的注意力拆成两条互补分支,局部区域继续使用精确的滑动窗口 Softmax,远距离上下文交给双向线性注意力,兼顾画质与效率。
  2. 8 步少步蒸馏:采用 DMD2 蒸馏方案训练 turbo 权重,让模型学会用 8 步完成原本 50 步的去噪过程,显著缩短端到端生成时间。
  3. 帧级联合求解(VDA):把逐 Token 的状态更新升级为逐帧联合求解,通过正规方程让一帧内的空间 Token 共同决定状态,天然非扩张、无需硬性缩放。
  4. 三阶段平稳适配:通过逐层对齐、端到端分支适配与 LoRA 联合微调三个阶段,让新增分支平稳接入预训练模型,避免随机初始化扰动原有生成能力。
  5. 分支专用并行:将 Softmax 分支与 VDA 分支分配到不同 GPU 上执行,适配两者的计算特性差异,比标准 Ulysses 序列并行再降低 13.3% 的延迟。
  6. 自定义提示词编码:提供文本转特征向量的工具,开发者可以把自己的提示词编码为 pt 特征文件后传入推理流程,实现更可控的生成。
  7. 开箱即用的推理脚本:仓库附带单卡与多卡推理脚本,覆盖 FP8 精度与多种硬件配置,方便按自身算力直接复现官方数据。

VDN-MiniMax-H3 的技术原理:局部精确、远程压缩

视频生成之所以慢,主要慢在注意力上。一段十几秒的视频经过 VAE 压缩后,仍有十几帧、每帧上千个潜变量 Token,再叠加文本与音频 Token,序列长度远超文本场景;而 Softmax 注意力的开销随序列长度呈平方增长,50 步去噪等于把这笔平方账重复 50 次。据官方拆解,在单张 B200 上,原始模型单步去噪中 Softmax 注意力核就占据了注意力耗时的绝大部分,是名副其实的性能瓶颈。

VDN-MiniMax-H3 的解法是把注意力拆开算。Softmax 分支沿用原模型的分块方式,每 5 个连续潜变量帧为一块,每块只与自身及前后相邻块做精确注意力,首帧与尾帧被设为边界锚点,保证长视频首尾信息不会在压缩中丢失;线性分支则分别汇总当前窗口之前与之后的信息,刻意排除窗口内帧与边界锚点,避免与 Softmax 分支重复计算。在代表性负载下,约 52% 的 Token 关系走 Softmax 路径,48% 走线性路径。

两条分支的输出尺度并不相同,直接相加会让局部细节被远程记忆淹没,或反过来压过远程上下文。为此 VDN-MiniMax-H3 为两条分支各配一个随输入内容变化的 Sigmoid 门控与的输出投影,线性分支先经 RMSNorm 归一化再门控,最后才在残差流中合并,由内容动态决定”近处”与”远处”信息的权重。

VDN-MiniMax-H3VDN-MiniMax-H3 权重与模型页

VDN-MiniMax-H3 的三阶段训练与少步蒸馏

把一个随机初始化的新分支塞进已经训练成熟的大模型,最大的风险是把原有能力带崩。VDN-MiniMax-H3 用 A1、A2、B 三个阶段规避这个问题:A1 是逐层对齐,冻结整个网络只训练新增的线性分支,让每一层的新分支输出对齐原模型该层表示,相当于给新分支一个好的初始化;A2 把各层混合模块接回完整去噪网络做端到端联合优化,原 Softmax 分支、QKVO 投影与前馈网络继续保持冻结;B 阶段才在 QKV 与输出投影上加入 LoRA,与线性分支共同训练,其余预训练参数仍然不动。

其中有个细节值得一提:Softmax 门控在 A1、A2 阶段被一直冻结,直到 B 阶段才允许训练。原因是如果不冻住,优化器会找到一条捷径——把原有 Softmax 分支的门控关小来降低损失,结果新分支没学会、旧分支反而被削弱。整个适配过程全程锁定预训练主干,最后再用 DMD2 蒸馏把 50 步压到 8 步。官方也解释了为什么没有追求更激进的 4 步:8 步在质量与速度之间的权衡更合适。最终发布的内容就是一条线性分支加两个很小的 LoRA 适配器,推理时可以合并进主干。

如何使用 VDN-MiniMax-H3

  1. 准备环境:克隆项目仓库并创建 Python 3.12 环境,按仓库说明安装 PyTorch 与项目依赖,再执行附带的环境初始化脚本。
  2. 下载权重:从模型社区下载 OpenVDN/vdn-minimax-h3 权重包到本地 ckpts 目录,权重体积较大,需要预留充足的磁盘空间。
  3. 运行示例:先跑通仓库自带的单卡 8 步 FP8 示例脚本,用附带的编码后提示词生成第一段视频,确认环境无误。
  4. 多卡部署:若使用单机八卡,按硬件选择对应的 H200 或 B200 推理脚本,即可复现官方的十几秒级出片速度。
  5. 自定义提示词:使用仓库提供的编码脚本,把文本提示词通过对应的文本编码器转成 pt 特征文件,再在推理命令中指定该特征文件与输出路径。
  6. 集成与验证:将合并后的权重接入自有推理管线,建议先单套跑通确认画面正常,再叠加其他加速组件,避免不同方案之间互相干扰。

VDN-MiniMax-H3 的使用场景

  1. 广告与营销素材量产:十几秒级的出片速度让品牌方可以在一次提案中批量生成多版本产品动态素材,快速做 A/B 筛选。
  2. 影视预演与分镜验证:导演和分镜师可以在拍摄前反复生成不同运镜与节奏的预览片段,把沟通成本从几天压缩到几分钟。
  3. 实时交互式视频创作:创作者修改提示词后几乎可以即时看到结果,大幅缩短”构思—生成—调整”的迭代周期。
  4. 游戏与虚拟内容生产:为个性化动态内容、过场动画与 NPC 表现提供按需生成能力,减少预烘焙素材的体量。
  5. 社交媒体内容创作:短视频创作者可以按热点快速产出配套画面,把创意到成品的周期压到最短。相关方向也可以参考站内的即梦 AI(Seedance 视频)通义万相AI视频
  6. 学术研究与工程优化:作为混合注意力与少步蒸馏的完整开源实现,适合用作视频扩散模型推理加速方向的对照组与基线。

VDN-MiniMax-H3:同类工具对比

同为视频生成加速,VDN-MiniMax-H3 与 Sparse VideoGen2(SVG2)代表了两种截然不同的技术路线。

对比维度VDN-MiniMax-H3Sparse VideoGen2(SVG2)
核心思路用混合注意力(局部 Softmax + 远距离线性 VDA)替代全量二次方注意力,结合少步蒸馏训练无关的稀疏注意力框架,通过语义感知排列识别关键 Token 并重新排序
技术路线架构改造 + 三阶段训练适配 + 8 步 DMD2 蒸馏语义聚类 + 动态预算控制 + 定制稀疏注意力内核,无需重训
加速表现相对单卡 Dense H3 基线约 74.5 倍在 HunyuanVideo 等模型上约 2 倍量级
生成速度8×B200、8 步,约 11 秒生成 14 秒 768p 视频稀疏化后仍需分钟级完成短视频生成
画质表现视觉细节与指令遵循接近 50 步 Dense H3相同稀疏率下 PSNR 优于其他稀疏方法
适用模型专用于 MiniMax H3 改造通用框架,可即插即用于多种 DiT 模型
训练成本需要三阶段训练与蒸馏零训练成本,直接用于推理

VDN-MiniMax-H3 的常见问题解答

VDN-MiniMax-H3 是一个新模型还是加速方案?
它是一套加速方案而非从零训练的新模型。项目基于已开源的 MiniMax-H3 改造,新增部分只有一条线性注意力分支和少量 LoRA 适配器,原始主干权重保持不变,推理时可以合并进主干,也可以拆下还原。
普通消费级显卡能跑 VDN-MiniMax-H3 吗?
官方基准面向数据中心级硬件,参考配置是 8 张 H200 或 B200,权重包体积较大,需要预留充足的显存与磁盘。单卡也能运行,只是耗时明显高于多卡配置;消费级显卡不在官方支持列表内,建议先确认显存与依赖版本是否满足要求。
11 秒出片这个数字是怎么测出来的?
官方口径是稳态去噪耗时,不包含模型加载、预热、提示词编码、VAE 解码、视频编码与文件传输。换句话说,真实业务中的端到端延迟会高于这个数字,但它足以说明去噪环节本身的优化幅度。

VDN-MiniMax-H3 项目地址与官网网址

目前 VDN-MiniMax-H3 的代码、权重与训练推理实现均已开放,开发者可以从以下入口获取:

OpenI AI时代点评

VDN-MiniMax-H3 的价值不只在”又一个视频模型开源”,而在于它把线性注意力在长视频生成上的一种兑现方式完整跑通了:不是用全线性替换逼用户接受画质折损,而是用”局部精确 + 远程压缩 + 门控融合 + 分阶段适配”的组合,让新架构以可合并的形式挂到现成模型上。对视频生成这条线来说,注意力的平方开销从此有了一个经过质量验证的解法,其思路对其他”注意力太贵”的大模型同样有参考价值。

当然也要看到边界:官方 74.5 倍的加速比是相对单卡 Dense 基线的稳态去噪口径,复现门槛真实存在,第三方复现目前也不多。它更适合被理解为工程与架构层面的开源贡献,而不是开箱即用的消费级产品。对国内做视频生成应用的团队来说,把 VDN-MiniMax-H3 与阶跃视频绘蛙AI生图/视频免费AI生成视频等方案放在一起评估,会比单看某一个加速比数字更有意义。建议先访问 https://github.com/OpenVDN/vdn-minimax-h3 阅读官方说明,再根据自身算力决定是否投入复现。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...