InstructAV2AV – 智源联合北大开源的音视频联合编辑模型
InstructAV2AV,由北京智源人工智能研究院与北京大学携手打造,是一款开创性的音视频联合编辑模型。它赋予用户仅凭一句自然语言指令,即可在端到端生成流程中同步编辑视频画面与相应声音的能力,彻底摆脱了繁琐的手工掩码或分步操作。该模型精通台词修改、人物替换、对象插入与移除等多种编辑任务,同时能巧妙维持背景与环境声的原始状态,确保声画间的精准同步。
InstructAV2AV的强大功能解析
- 忠于原貌的语音重塑:在保持人物形象不变的前提下,仅需替换其言语内容。
- 视听元素整体置换:能够将画面中特定人物及其伴随的声音与台词一并更换。
- 动态实例的注入:支持向画面中新增对象,并自动生成与之完美契合的声音。
- 移除指定元素的音频同步:可删除画面中的特定对象,并同步移除其在音轨上的对应声音。
- 多维度属性的灵活编排:人物的外观、言语内容和音色均可调整,并实现随心所欲的组合编辑。
InstructAV2AV的核心技术洞察
- 源潜变量的融合拼接:通过将源视频与源音频的潜变量与噪声沿通道维度进行拼接,使得源内容成为整个去噪过程的结构性引导,从而严密约束模型保留背景、无关对象及环境声,有效避免“牵一发而动全身”的过度编辑问题。
- SIGA 门控注意力机制:Source-Instruction Gated Attention(SIGA)机制使每个 token 能够同时与源特征和指令特征进行交互。通过可学习的软门控,模型能够逐位置精确控制编辑的程度,实现内容保留与指令执行之间的动态平衡。
- 双流交互式架构设计:基于 Ovi 对称双流扩散 Transformer 架构,视频与音频分支各自进行自注意力建模后,通过双向跨模态注意力机制进行特征交换。这一设计确保了视觉与声音之间的相互制约与同步性。
- 分阶段的训练策略:首先关闭跨模态注意力,分别训练单模态的编辑能力;随后恢复完整架构,进行联合微调,从而精细学习声画之间的对应关系。
- 自动化数据构建流水线:通过素材筛选、编辑目标合成、五维自动评估及人工复核等三阶段流程,构建了 InsAVE-80K 数据集,有效解决了成对训练数据稀缺的难题。
关注微信公众号并回复“开源”,即可加入AI开源项目交流群。
InstructAV2AV的使用指南
- 代码获取:首先,将 InstructAV2AV 的代码仓库从 GitHub 克隆至本地。
- 环境配置:依据仓库内的说明,配置好 Python 环境并安装所有必要的依赖项。
- 模型权重下载:从 Hugging Face 下载 InstructAV2AV 的预训练模型权重。
- 素材准备:准备一段包含声音的视频作为输入素材。
- 指令输入:提供一句清晰的自然语言指令,准确描述您希望进行的修改内容。
- 执行推理:运行推理脚本,耐心等待模型生成编辑后的视频与音频。
- 结果保存:检查输出结果,并将编辑完成的音视频文件保存下来。
InstructAV2AV的项目资源链接
- 官方项目网站:https://hjzheng.net/projects/InstructAV2AV/
- GitHub代码库:https://github.com/suimuc/InstructAV2AV
- HuggingFace模型仓库:https://huggingface.co/suimu/InstructAV2AV
- 技术论文(arXiv):https://arxiv.org/pdf/2605.18467
InstructAV2AV与同类竞品的比较分析
| 对比维度 | InstructAV2AV | Ovi |
|---|---|---|
| 产品定位 | 指令驱动的音视频联合编辑模型 | 音视频联合生成模型 |
| 核心能力 | 在源视频基础上进行画面与声音的修改 | 从零开始生成视频与音频 |
| 输入方式 | 源视频+源音频+自然语言指令 | 文本提示词(用于从零生成) |
| 背景保留 | 能够精准保留无关背景与环境声 | 不涉及源内容保留 |
| 声画同步 | 通过双向跨模态注意力确保编辑后的同步性 | 生成时同步,不支持编辑场景的同步处理 |
| 技术架构 | 基于 Ovi 双流扩散 Transformer 改进,集成源潜变量拼接与 SIGA 门控机制 | 对称双流扩散 Transformer |
| 适用场景 | 台词修改、人物替换、对象插入与移除等 | 文本到音视频的创意性生成 |
InstructAV2AV的多元化应用场景
- 影视后期制作:影视后期专业人士可利用此模型替换演员的台词并同步口型,显著降低补拍带来的成本。
- 短视频内容创作:短视频创作者能够通过一句指令,轻松修改素材中的人物与声音,大幅提升创作效率。
- 虚拟人技术应用:虚拟人运营团队可以借此模型调整数字人的外观、音色及言语内容,实现更精细化的管理。
- 广告创意生成:广告行业从业者能够批量生成包含不同人物和台词的宣传视频版本,拓展创意边界。
- 交互式内容生产:游戏与教育领域的开发者可利用该模型动态生成音画一致的多媒体素材,丰富用户体验。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


