HOMIE

AI工具2个月前更新 AI工具集
20 0 0

HOMIE – 香港科技大学开源的数字人视频生成框架

HOMIE:香港科技大学倾力打造的革新性数字人视频生成框架

在人工智能飞速发展的浪潮中,香港科技大学开源的 HOMIE 数字人视频生成框架,以其前沿的技术和强大的功能,为数字内容创作领域带来了新的突破。该框架巧妙地融合了 Wan2.1-T2V-14B 骨干网络与 Qwen3-VL 多模态大模型,旨在解决数字人视频生成中的核心挑战,实现对数字人、商品、Logo 以及文字等关键要素的统一处理。

HOMIE 的诞生,精准地攻克了人与物体的自然交互、品牌 Logo 的精准贴合、OCR 文字的逼真还原以及多视角下的一致性保持这四大难题。值得一提的是,HOMIE 的模型训练过程高效至极,仅需约 1 万 A100 小时的计算资源,便能达到远超同类开源模型的 OCR 准确率(提升 38.7%),同时支持单卡 480P 至多卡 720P 的推理,极大地降低了电商带货、虚拟主播等行业在视频制作上的门槛。

HOMIE 的核心能力解析

  • 个性化的人与物交互视频: HOMIE 能够让多个数字人与多种物体在同一视频中和谐共存,不仅确保了每个角色的外观一致性,更能实现诸如手持、展示、递交商品等自然且符合逻辑的交互动作。
  • 智能化的 Logo 与概念精准附着: 借助多模态大模型(MLLM)的深度语义理解能力,HOMIE 可以自动将品牌 Logo 或其他抽象概念精准地“植入”到语义最相关的物体上,彻底摆脱了在提示词中繁琐地描述位置关系的束缚。
  • 高保真的 OCR 文字生成: 通过引入 OCR 参考图,HOMIE 能够确保产品包装、标签上的文字在生成的视频中清晰锐利、字迹分明,有效解决了 AI 视频生成中文字模糊不清的顽疾。
  • 卓越的多视角一致性展现: 对于需要展示多角度细节的物品,如手办、3D 模型或,HOMIE 能够基于用户提供的多视角参考图,在物体发生旋转或移动时,始终保持其外观和细节的高度一致性。

HOMIE 的技术精髓探究

  • 先进的整体架构: HOMIE 的核心是阿里 Wan2.1-T2V-14B 的 DiT 模型,并巧妙地集成了 Qwen3-VL-2B-Thinking 作为视觉理解的“大脑”,辅以 UmT5 文本编码器和 VAE 视觉编码器,构建了一个融合“文本+多模态语义+视觉”三维信息的高效生成系统。
  • 创新的 MLLM 集成策略: 在不影响原有文本控制能力且无需高昂重对齐成本的前提下,HOMIE 将多模态大模型的强大语义推理能力无损地注入到 DiT 模型中,使其能够深刻理解参考图像之间的复杂关联。
  • 全局多模态自注意力引导(GMG): 在 DiT 的自注意力机制内部,HOMIE 将 MLLM 提取的语义特征与 VAE 的视觉标记(token)进行全局层面的深度对齐。通过精妙的投影、池化和仿射变换,确保生成过程中的每一个视频标记都能充分“感知”到参考图像的全局语义信息。
  • 模态-参考嵌入(MRE): 为 MLLM 特征标记和 VAE 视觉标记分别赋予了独特的模态嵌入,同时为不同的参考图像分配的参考嵌入。这种设计能够将同一主体的多视角或 OCR 参考图标记有效地关联起来,从而避免信息混淆。
  • 高效的三阶段渐进式训练: HOMIE 采用了创新的三阶段训练策略:单主体 480P → 多主体 480P → 高清 720P。整个训练过程仅需 5.5K 步,远低于行业内同类方法数万步的训练需求。

欲加入AI开源项目交流群,请关注微信并回复“开源”。

如何轻松驾驭 HOMIE

  • 环境搭建: 首先,从 GitHub 克隆 HOMIE 的代码仓库至本地,并按照指引完成所有必要的环境依赖安装。
  • 权重获取: 从 HuggingFace 下载官方提供的预训练权重,并将其放置在指定的模型目录中。
  • 素材准备: 准备好用于生成视频的参考图像,这可能包括人物照片、商品图片、品牌 Logo 图或包含 OCR 文字的图像等。
  • 提示词撰写: 精心编写文本提示词,清晰地描述目标视频中数字人与物体之间的互动方式以及期望的场景效果。
  • 执行推理: 运行 HOMIE 的推理脚本。框架将自动整合多模态参考信息,并生成高度个性化的视频。
  • 分辨率选择: 单块 GPU 即可实现 832×480 分辨率的视频生成;若使用多卡 FSDP 配置,则可进一步提升至 720P 高清输出。

HOMIE 的核心优势亮点

  • 一站式解决方案: HOMIE 整合了人-物交互、Logo 贴牌、OCR 文字保真和多视角一致性四大核心任务的处理能力,用户无需在不同场景下切换多套模型。
  • 卓越的训练效率: 仅需 5.5K 步(约 1 万 A100 小时)的训练即可达到优异性能,训练成本远低于业界普遍需要的 3-4 万步。
  • MLLM 无损集成: 在保留文本编码器强大可控性的同时,HOMIE 实现了多模态大模型的语义推理能力无损注入,避免了昂贵的重对齐过程。
  • 领先的生成质量: OCR 准确率提升高达 38.7%,多视角一致性提升 8.2%。在一项包含 40 名用户的研究中,HOMIE 的整体质量获得了 64.7% 的用户青睐,位居首位。
  • 灵活的推理部署: 支持从 480P 单卡到 720P 多卡推理,并能输出 1280×720 竖屏视频,完美适配直播带货和短视频制作的实际需求。

获取 HOMIE 的资源入口

  • 项目官网: https://yiyangcai.github.io/homie-page.github.io
  • GitHub 仓库: https://github.com/YIYANGCAI/HOMIE
  • HuggingFace 模型库: https://huggingface.co/yychai/homie-r2v-wan2.1
  • arXiv 技术论文: https://arxiv.org/pdf/2607.18217

HOMIE 与竞品对比分析

对比维度HOMIESkyReels-V3
发布方香港科技大学昆仑万维
骨干网络Wan2.1-T2V-14B自研视频模型
MLLM 集成Qwen3-VL-2B,保留文本编码器无损注入集成 MLLM,但替换文本编码器
OCR 准确率0.452(开源最高)0.326
多视角一致性 (DINOrec)0.6850.654
主体一致性 (Face-Sim)0.7860.751
Logo 细节保真能忠实渲染 Logo 细节Logo 位置正确但细节易模糊
训练成本5.5K 步 / ~1 万 A100 小时未公开,推测远高于 HOMIE
开源协议Apache 2.0(可商用)开源可商用

HOMIE 的多样化应用场景

  • 电商直播带货新范式: 生成由指定数字人手持特定商品进行演示的带货视频,支持 1280×720 竖屏输出,无缝对接主流短视频平台。
  • 品牌广告的智能植入: 自动将品牌 Logo 精准添加到语义相关的产品上,无需手动指定位置,极大简化了广告制作流程。
  • 虚拟主播与数字人交互升级: 在保持数字人身份一致性的同时,实现与各类商品的自然、流畅的交互。
  • 产品多角度精彩呈现: 用户只需提供手办、3D 模型或的多视角参考图,HOMIE 即可生成流畅的旋转展示视频,确保各角度细节完美复现。
  • 包装文字的清晰呈现: 借助 OCR 参考图,HOMIE 保证产品包装、标签上的文字在视频中清晰可辨,尤其适用于食品、化妆品、保健品等需要展示详细成分或说明的行业。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...