JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型
JoyAI-Video-Edit,京东倾力打造并开源的创新性实时流式视频编辑模型,以其160亿参数的自回归扩散架构为基石,在720P分辨率下实现了高达30帧每秒的流畅推理,并能应对任意时长的视频进行稳定编辑。
JoyAI-Video-Edit的独特之处
JoyAI-Video-Edit是一款由京东自主研发并开源的实时流式视频编辑模型。其核心技术源自一个拥有160亿参数的自回归扩散架构,能够在720P分辨率下达到每秒30帧的推理速度,并且支持对任意长度的视频进行稳定流畅的编辑。用户只需通过自然语言指令,即可在视频播放的实时过程中,随心所欲地修改人物、场景、风格乃至物体,无需漫长等待视频生成。在OpenVE-Bench的评测中,JoyAI-Video-Edit的表现力压所有现有的流式编辑方法,各项指标均遥遥领先。此外,该模型还为具身智能领域提供了大规模数据合成的全新路径。
JoyAI-Video-Edit的核心能力概览
- 即时流式编辑:模型可在视频帧抵达的瞬间进行编辑处理,无需预知视频的完整内容。
- 灵活的指令控制:支持全局风格迁移、局部对象的增删改动、背景替换、动作调整以及基于参考图的引导式编辑。
- 无时长限制处理:打破了传统模型对秒级或分钟级片段的限制,能够持续稳定地随着视频播放进行编辑。
- 720P高清高吞吐部署:整个端到端流水线在720×1280分辨率下,可实现高达30.19帧每秒的流畅运行。
- 全方位的编辑能力:涵盖了人物换装、场景变换、风格转换、物体替换以及字幕编辑等多种编辑任务。
JoyAI-Video-Edit的技术支撑解析
- 多模态大语言模型(MLLM)驱动的条件编码器:运用MLLM将用户输入的自然语言指令转化为精确的编辑条件,从而实现开放式的语义控制。
- 因果视频变分自编码器(VAE):采用具有因果时序结构的VAE来压缩和重建视频帧,确保在流式处理场景下的时序连贯性。
- 160亿参数的多模态扩散Transformer(MMDiT)骨干网络:以160亿参数的MMDiT作为核心,融合文本与视觉特征,进行自回归扩散生成。
- 自回归分布匹配蒸馏技术:通过对齐自回归分布的蒸馏策略加速推理过程,显著减小训练与推理之间的分布差异。
- 长时域优化与有界KV推理机制:引入长时域稳定性优化和有界KV缓存机制,有效抑制累积时序漂移,同时保持高吞吐量。
如需加入AI开源项目交流群,请关注微信并回复“开源”。
JoyAI-Video-Edit的使用指南
- 环境搭建:创建一个Python版本为3.10的Conda环境,并安装
requirements.txt文件中的所有依赖项。 - 模型权重下载:从Hugging Face下载模型文件,并按照指定的目录结构放置检查点文件。
- 服务启动:切换到
deploy目录,执行bash run_server.sh脚本来启动本地服务器。 - 访问界面:通过浏览器访问
http://localhost:8080,即可进入交互式编辑界面。 - 实时编辑操作:上传您想要编辑的视频或连接摄像头流,然后输入您的自然语言指令,即可实现边播放边编辑。
JoyAI-Video-Edit的核心亮点
- 真正的实时流式编辑:视频帧一经到达即可进行处理,无需等待整个视频完成,提供无缝的“边播边改”体验。
- 速度与质量的完美平衡:在720P分辨率下,端到端推理速度可达30.19 FPS,并在OpenVE-Bench评测中超越所有流式及离线编辑方法。
- 任意时长稳定输出:克服了传统模型仅支持短片段的局限,能够针对任意长度的视频进行稳定无漂移的编辑。
- 高度开放的语义控制:借助MLLM条件编码器,支持通过自然语言指令实现全局风格、局部对象、背景替换以及参考图引导等多种维度的编辑。
- 高效的推理架构设计:160亿参数的自回归扩散Transformer,结合分布匹配蒸馏和有界KV缓存技术,有效降低了训练与推理的差异,并抑制了时序累积误差。
JoyAI-Video-Edit的项目资源链接
- GitHub代码库:https://github.com/jd-opensource/JoyAI-Video-Edit
- HuggingFace模型库:https://huggingface.co/jdopensource/JoyAI-Video-Edit
- arXiv技术论文:https://arxiv.org/pdf/2608.03974
JoyAI-Video-Edit与同类竞品的比较
| 维度 | JoyAI-Video-Edit | SANA-Streaming |
|---|---|---|
| 模型规模 | 160亿参数 | 20亿参数 |
| 推理速度 | 37.21 FPS (DiT) | 约54 FPS (DiT) |
| 编辑质量 | 3.60 (OpenVE-Bench) | 约2.6 |
| 编辑类型 | 开放式多维度编辑 | 流式编辑 |
| 分辨率支持 | 720P稳定输出 | 以较低分辨率为主 |
| 时序稳定性 | 任意时长,通过有界KV优化 | 以短片段为主 |
JoyAI-Video-Edit的应用场景展望
- 短视频内容创作:创作者可以在视频播放过程中实时更换人物着装、调整场景氛围,大幅提升内容生产效率。
- 直播互动特效:主播能够实时改变直播背景或添加动态虚拟元素,实现更具吸引力的互动式直播体验。
- 家居与室内设计预览:用户在浏览房间视频时,可以即时更换家具、墙面材质和灯光效果,辅助装修决策。
- 影视后期快速预演:导演在剪辑阶段能够迅速尝试不同的视觉风格和场景替换效果,显著降低试错成本。
- 具身智能数据生成:将人类操作视频转化为适用于机器人训练的数据集,低成本地扩展机器人训练数据规模。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...
