Hallo 官网
Hallo是由复旦大学、百度、苏黎世联邦理工与学团队联合推出的开源音频驱动肖像动画生成项目(Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation):只需一张静态人像照片加一段驱动音频,就能让照片中的人物”开口说话”,生成口型、表情与头部姿态自然同步的动态视频。项目于 2024 年 6 月在 GitHub 开源,基于扩散模型与端到端生成框架,在口型同步精度、画面质量与动作多样性上表现突出,是目前数字人口播、AI 视频创作领域最受关注的开源方案之一,社区已衍生出支持中文的 JoyHallo、画质升级的 Hallo2 等版本。

主要功能
- 音频驱动肖像动画:输入一张人像照片与一段语音(WAV 等常见格式),端到端生物说话视频,无需录制真人出镜素材。
- 层次化音频驱动视觉合成:通过分层音频-视觉对齐模块,将语音信号精确映射到唇形、表情与头部姿态,口型同步精度显著优于传统参数化模型方案。
- 表情与姿态自适应控制:支持对表情、姿势、唇部的权重调节(pose/face/lip weight),可按需控制生成效果的幅度与风格。
- 经典影视片段模仿:官方展示了模仿《穿普拉达的女王》《绿皮书》《无间道》等经典片段的生成效果,动作与情绪表现力强。
- 完全开源可商用:采用 MIT 许可证在 GitHub 开放源码与预训练模型,可本地部署,也可通过 HuggingFace Space 在线体验。
使用方法
- 获取项目:访问 Hallo 项目主页 或 GitHub 仓库获取源码与文档。
- 环境部署:官方要求 Ubuntu 20.04/22.04 + CUDA 12.1 环境(实测 A100 等显卡),克隆仓库后用 conda 创建 Python 3.10 环境,安装依赖与 ffmpeg。
- 下载预训练模型:从 HuggingFace 克隆 hallo 预训练模型包(含 UNet 去噪器、人脸分析、音频编码等组件),按目录结构放入 pretrained_models。
- 准备素材:源图裁剪为正方形、人脸占画面 50%-70% 且正面朝向;驱动音频建议清晰人声(官方训练数据以英文为主,中文可用社区版 JoyHallo)。
- 运行推理:执行 scripts/inference.py 传入源图与音频,即可在输出目录得到驱动后的肖像动画视频。
使用场景
- 数字人口播与短视频:自媒体与电商团队用静态形象照批量生成口播视频,无需真人出镜、无需重复录制。
- 影视与创意制作:为角色配音生成动态表演,模仿经典桥段、制作二创内容与概念短片。
- 虚拟形象互动:为虚拟主播、数字员工、游戏 NPC 等静态形象赋予说话与表演能力。
- 科研与二次开发:作为扩散模型驱动的语音动画研究基线,社区已衍生 WebUI、ComfyUI 插件、Docker、Windows 整合包等生态工具。
常见问题
- Hallo 是在线工具还是开源项目?
- 是开源项目,需要自行部署(或使用社区搭建的 HuggingFace Space 在线 Demo),官方不提供商业化的在线生成服务。
- 支持中文语音吗?
- 官方版本训练数据以英文为主,中文效果有限;社区推出的 JoyHallo 专门优化了中文(普通话)驱动能力,可作为替代。
- 对硬件有什么要求?
- 官方在 A100 级显卡上测试,消费级显卡也可尝试推理但速度较慢;没有 GPU 的用户建议使用在线 Demo 或云端算力。
OpenI AI时代点评
Hallo 的价值在于把“一张照片 + 一段音频 = 说话视频”这件事做成了完全开源、可本地部署的方案,口型同步与头部动作的自然度在同期开源项目中属第一梯队,配合表情/姿态权重可控,非常适合数字人口播与创意二创。需要注意的是:它不是开箱即用的在线工具,部署有一定门槛;英文驱动效果最好,中文场景建议换用 JoyHallo;生成时长与画面稳定性也还有提升空间。同类方案中,在线产品可以看 HeyGen,开源路线还可以对比 EchoMimic。整体适合有部署能力的开发者、数字人团队与二创玩家。👉 访问 Hallo 项目主页
Hallo 官网入口网址
数据评估
关于Hallo特别声明
本站OpenI提供的Hallo都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由OpenI实际控制,在2024年 8月 3日 上午6:08收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,OpenI不承担任何责任。

