JoyAI-Video-Edit官网
JoyAI-Video-Edit 是京东开源自研的实时流式视频编辑模型,基于 16B 参数的自回归扩散架构,在 720P 分辨率下能做到 30FPS 的推理速度,支持任意时长的稳定流式编辑。用户只需用自然语言指令,就能在视频播放过程中实时修改人物、场景、风格和物体,不用等整段视频生成完。它在 OpenVE-Bench 评测里超过了所有流式编辑方法,各项指标全面领先,同时还能为具身智能提供大规模数据合成的路径。
和”从零生成一段视频”的生成模型不同,JoyAI-Video-Edit 卡的位置是”改”——视频帧一边到、它一边改,前面改过的特征靠有界 KV 缓存维持住,不随时间漂走。这让它在直播、长视频这类不能中断的场景里有真实用武之地,而不只是离线玩具。

主要功能
- 实时流式编辑:视频帧到达时即时编辑,不需要预先知道完整序列,真正”边播边改”。
- 开放式指令控制:支持全局风格迁移、局部对象增删改、背景替换、动作调整以及参考图引导编辑。
- 任意时长处理:突破秒级或分钟级片段限制,可以随视频播放持续稳定地编辑下去。
- 720P 高吞吐部署:端到端 pipeline 在 720×1280 分辨率下达到 30.19 FPS。
- 多维度编辑能力:覆盖人物换装、场景变换、风格转换、物体替换和字幕编辑等任务。
技术上,JoyAI-Video-Edit 用多模态大语言模型(MLLM)把自然语言指令编码成编辑条件,实现开放式语义控制;再用因果时序结构的视频 VAE 对帧做压缩与重建,保证流式场景下的时序一致性;核心是一个 16B 参数的多模态扩散 Transformer(MMDiT),融合文本与视觉特征做自回归扩散生成。团队还用自回归分布匹配蒸馏去对齐训练与推理的分布、降低差异,并引入长时域稳定性优化和有界 KV 缓存机制,抑制累积的时序漂移、维持高吞吐。
如何使用JoyAI-Video-Edit
- 环境准备:创建 Python 3.10 的 Conda 环境,按 requirements.txt 安装依赖。
- 下载权重:从 Hugging Face 获取模型文件,按指定目录结构放置检查点。
- 启动服务:进入 deploy 目录执行 bash run_server.sh 启动本地服务器。
- 访问界面:浏览器打开 http://localhost:8080 进入交互式编辑界面。
- 实时编辑:上传视频或接入摄像头流,输入自然语言指令即可边播边改。
使用场景
- 短视频创作:创作者可在视频播放过程中实时替换人物服装、调整场景风格,提升内容生产效率。
- 直播实时特效:主播边播边改背景或添加虚拟元素,实现互动式直播视觉增强。
- 家装与室内设计:用户浏览房间视频时实时更换家具、墙面材质与灯光效果,辅助装修决策。
- 影视后期预演:导演在剪辑阶段快速尝试不同视觉风格与场景替换,降低试错成本。
- 具身智能数据合成:把人手操作视频转化为机械臂操作素材,低成本扩展机器人训练数据规模。
产品价格与版本
JoyAI-Video-Edit 由京东开源,代码与模型权重已在 GitHub 和 HuggingFace 放出,方便研究者和工程团队复现、二次开发。和同走流式路线的 SANA-Streaming 相比,后者是 2B 参数、编辑质量约 2.6,而 JoyAI-Video-Edit 是 16B 参数、OpenVE-Bench 编辑质量 3.60,在质量上拉开明显差距;SANA-Streaming 的 DiT 推理速度约 54 FPS 略快,但主要在较低分辨率运行,时序稳定性也以短片段为主。JoyAI-Video-Edit 的取舍很明确:用更大参数换质量和长时域稳定,把实时编辑真正推到 720P 可商用区间。具体商用授权条款以仓库 LICENSE 为准。
常见问题解答
- 实时流式编辑和普通的视频生成模型有什么不同?
- 普通生成模型是”先出完整视频”,编辑类模型是”在播放中改”。JoyAI-Video-Edit 的帧一到达就处理,不需要等完整序列,所以能边播边改;关键是靠有界 KV 缓存压住时序漂移,保证改到第几分钟时前面的人物特征不跑偏。
- 我需要多强的显卡才能跑?
- 官方给出的部署指标是 720×1280 分辨率下端到端 30.19 FPS,权重通过 HuggingFace 获取。具体单卡显存要求以仓库 README 的硬件建议为准,但”流式 + 有界 KV”的设计本身就是在为长序列下的显存和吞吐松绑。
- 可以商用吗?
- 代码与权重已开源在 GitHub 和 HuggingFace,便于研究和二次开发。具体商用授权请查看仓库内的 LICENSE 文件,确认条款后再用于生产。
官网网址
GitHub 仓库:https://github.com/jd-opensource/JoyAI-Video-Edit
HuggingFace 模型库:https://huggingface.co/jdopensource/JoyAI-Video-Edit
arXiv 技术论文:https://arxiv.org/pdf/2608.03974
OpenI AI时代点评
视频编辑和视频生成是两条赛道,但 JoyAI-Video-Edit 卡的位置很巧——它要的不是”生成一段新视频”,而是”在播放过程中按指令改”。流式处理的难点在于时序漂移:改到第 30 秒,前面的人物特征可能已经漂走了。它用有界 KV 缓存去压这个累积误差,思路上是对准了真问题,而不是堆参数把单帧质量刷高。
720P 下 30FPS 这个指标意味着它真有可能跑在直播场景里,而不只是离线玩具。京东把它开源也挺务实——视频编辑这块闭源方案贵,开源权重给中小团队留了入口。想做视频类应用、但又想要更偏”生成”能力的,可以对比 AstraFlow星图 这类文生视频方案,看自己到底是要”改”还是要从零”造”。
数据评估
本站OpenI提供的JoyAI-Video-Edit都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由OpenI实际控制,在2026年 8月 6日 上午11:08收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,OpenI不承担任何责任。

