Wan-Dancer

AI工具2个月前更新 AI工具集
31 0 0

Wan-Dancer – 阿里通义开源的人像舞蹈视频生成模型

Wan-Dancer:阿里通义万相倾力打造的革新性音乐驱动人像舞蹈视频生成引擎

Wan-Dancer,由阿里通义万相精心研发并开源,是一款突破性的音乐驱动人像舞蹈视频生成模型。它能够接收一张人物照片与一段音乐作为输入,进而生成节奏精准、动作流畅、风格鲜明的超高质量舞蹈视频。该模型首次打破了传统视频生成在时序长度上的瓶颈,支持生成长达 15 秒至 3 分钟的 720p/30fps 超长连贯视频。其强大的功能覆盖了中国古典舞、韩舞、街舞、踢踏舞、拉丁舞等五种风格迥异的舞种,并且支持通过 LoRA 技术实现个性化的舞蹈动作定制。

Wan-Dancer 的核心亮点

  • 音乐赋能的舞蹈创作:只需提供一张人物肖像和一段音乐,Wan-Dancer 即可自动生成与音乐节拍完美契合的舞蹈视频。
  • 分钟级超长视频输出:告别以往短视频的局限,Wan-Dancer 能够稳定生成从 15 秒到 3 分钟不等的连贯高清舞蹈影像。
  • 多元舞蹈风格兼容:模型囊括了中国古典舞、K-Pop、街舞、踢踏舞、拉丁舞等五大类截然不同的舞蹈风格,满足多样化创作需求。
  • LoRA 助力个性化定制:通过少量特定舞蹈数据的训练,即可打造专属的舞蹈风格,轻松实现同款舞蹈的精准复刻。
  • 关键帧二次精细编辑:全局阶段生成的关键帧支持手动调整,为换装和动作细节的精确控制提供了极大的灵活性。

Wan-Dancer 的技术精髓

  • 全局关键帧规划(Global DiT):该技术基于对音乐整体结构的深刻理解,生成具有长时一致性的关键帧,从而规划出舞蹈动作的骨架和关键姿态,确保了视频在宏观时间尺度上的连贯性。
  • 局部时序细化(Local DiT):在全局关键帧的框架下,这一技术进一步打磨动作细节和帧间的过渡,有效解决了动作单一、重复的问题,显著提升了复杂动作的表现力。
  • 动态帧率适配机制:引入 RoPE(Rotary Positional Embedding)来映射绝对时间信息,使得模型能够精确地将不同时长的音乐与舞蹈动作进行时序对齐,彻底消除了长序列视频中可能出现的漂移现象。
  • 光流的连续性优化:利用基于光流的损失函数来优化帧间的过渡效果,即使在快速旋转、复杂步法等高难度场景下,也能保持动作的自然流畅和连贯性。

您可以通过微信关注并回复“开源”字样,加入AI开源项目交流群,获取更多前沿资讯。

如何体验 Wan-Dancer

  • 在线即时体验:请访问魔搭创空间 (https://www.modelscope.cn/studios/Wan-AI/Wan-Dancer),上传一张 9:16 竖屏的单人正面照片和一段 10–30 秒的音乐,选择您偏好的舞种后,即可点击生成。
  • 本地部署部署部署:将 GitHub 仓库克隆至本地,按照指引安装所需的依赖环境。随后,通过 ModelScope 下载 14B 模型权重,并依次运行全局关键帧推理脚本和局部时序细化脚本。
  • 通过 Diffsynth-Studio 推理:在安装好 DiffSynth-Studio 后,调用 WanVideoPipeline 加载全局/局部模型配置。接着,您需要设置参考图像、音乐文件路径以及关键帧掩码等参数,即可启动视频生成过程。

Wan-Dancer 的突出优势

  • 分层解耦的卓越架构:采用全局 DiT 进行长时一致性的关键帧规划,再由局部 DiT 精细打磨动作细节与帧间过渡,有效解决了时序漂移和动作重复等难题。
  • 动态帧率适配的精准同步:通过 RoPE 映射绝对时间信息,确保了不同时长音乐与舞蹈动作的严丝合缝的同步。
  • 增强的连续性表现:基于光流的损失函数优化,使得模型在处理快速旋转、复杂步法等场景时,依然能呈现出自然流畅的轨迹。
  • 高度一致的身份保持能力:输入的参考图像中的人物身份特征在生成长序列视频的过程中能够保持稳定,有效避免了角色发生畸变。

Wan-Dancer 项目相关链接

  • 项目官方网站:https://humanaigc.github.io/wan-dancer-project/
  • GitHub 代码仓库:https://github.com/Wan-Video/Wan-Dancer
  • HuggingFace 模型库:https://huggingface.co/Wan-AI/Wan-Dancer-14B
  • 技术论文(arXiv):https://arxiv.org/pdf/2607.09581

Wan-Dancer 与同类竞品的深度比较

对比维度Wan-DancerMuseDance
研发机构阿里通义万相石溪大学 + 字节跳动 + 苹果
核心架构分层解耦双 DiT(全局关键帧规划 + 局部时序细化)端到端 U-Net 扩散,基于 Stable Diffusion v1.5
训练策略全局与局部模型分别训练、分别推理两阶段训练:第一阶段外观预训练,第二阶段冻结空间注意力并注入音乐/节拍/模块
音乐理解专用 Music Encoder + RoPE 时间映射AST(Audio Spectrogram Transformer)提取音乐嵌入,通过交叉注意力注入
节拍对齐RoPE 动态帧率适配,将绝对时间映射到生成过程Librosa 提取节拍位置,one-hot 编码后通过交叉注意力显式对齐
控制光流损失优化帧间过渡 + Prompt 速度标注对齐模块:利用历史生成帧的隐状态做时序自注意力
身份保持参考图像经 VAE 编码 + 全局关键帧锚定约束第一阶段学习外观 + 冻结空间注意力 + ReferenceNet 特征融合
生成时长分钟级(15 秒–3 分钟)短视频片段(实验设置 4 秒 @ 12fps)
分辨率/帧率720p / 30fps640×640 / 12fps(实验配置)

Wan-Dancer 的多元应用场景

  • 短视频内容创作:为抖音、快手、小红书等平台快速生成个性化舞蹈视频,无需真人出镜即可实现风格多样的舞蹈内容量产。
  • 虚拟偶像与数字人表演:为直播、虚拟演唱会及数字人账号定制特定舞种的连贯表演素材,显著降低虚拟角色舞蹈动作的制作成本。
  • 舞蹈教学与编舞辅助:借助音乐节拍对齐与关键帧预览功能,辅助舞蹈教师拆解动作节奏、设计编舞方案,并生成标准化教学演示视频。
  • 广告与影视预演:低成本生成分镜级别的舞蹈镜头预览,帮助导演与创意团队在拍摄前快速验证舞蹈编排与视觉风格,加速决策流程。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...