AI文生视频

JoyAI-Video-Edit

京东开源自研的实时流式视频编辑模型,16B参数自回归扩散架构支持任意时长边播边改

标签: OpenIAPI,一站式大模型API聚合平台
一站式AI创作平台

JoyAI-Video-Edit官网

JoyAI-Video-Edit 是京东开源自研的实时流式视频编辑模型,基于 16B 参数的自回归扩散架构,在 720P 分辨率下能做到 30FPS 的推理速度,支持任意时长的稳定流式编辑。用户只需用自然语言指令,就能在视频播放过程中实时修改人物、场景、风格和物体,不用等整段视频生成完。它在 OpenVE-Bench 评测里超过了所有流式编辑方法,各项指标全面领先,同时还能为具身智能提供大规模数据合成的路径。

和”从零生成一段视频”的生成模型不同,JoyAI-Video-Edit 卡的位置是”改”——视频帧一边到、它一边改,前面改过的特征靠有界 KV 缓存维持住,不随时间漂走。这让它在直播、长视频这类不能中断的场景里有真实用武之地,而不只是离线玩具。

JoyAI-Video-Edit

主要功能

  • 实时流式编辑:视频帧到达时即时编辑,不需要预先知道完整序列,真正”边播边改”。
  • 开放式指令控制:支持全局风格迁移、局部对象增删改、背景替换、动作调整以及参考图引导编辑。
  • 任意时长处理:突破秒级或分钟级片段限制,可以随视频播放持续稳定地编辑下去。
  • 720P 高吞吐部署:端到端 pipeline 在 720×1280 分辨率下达到 30.19 FPS。
  • 多维度编辑能力:覆盖人物换装、场景变换、风格转换、物体替换和字幕编辑等任务。

技术上,JoyAI-Video-Edit 用多模态大语言模型(MLLM)把自然语言指令编码成编辑条件,实现开放式语义控制;再用因果时序结构的视频 VAE 对帧做压缩与重建,保证流式场景下的时序一致性;核心是一个 16B 参数的多模态扩散 Transformer(MMDiT),融合文本与视觉特征做自回归扩散生成。团队还用自回归分布匹配蒸馏去对齐训练与推理的分布、降低差异,并引入长时域稳定性优化和有界 KV 缓存机制,抑制累积的时序漂移、维持高吞吐。

如何使用JoyAI-Video-Edit

  • 环境准备:创建 Python 3.10 的 Conda 环境,按 requirements.txt 安装依赖。
  • 下载权重:从 Hugging Face 获取模型文件,按指定目录结构放置检查点。
  • 启动服务:进入 deploy 目录执行 bash run_server.sh 启动本地服务器。
  • 访问界面:浏览器打开 http://localhost:8080 进入交互式编辑界面。
  • 实时编辑:上传视频或接入摄像头流,输入自然语言指令即可边播边改。

使用场景

  • 短视频创作:创作者可在视频播放过程中实时替换人物服装、调整场景风格,提升内容生产效率。
  • 直播实时特效:主播边播边改背景或添加虚拟元素,实现互动式直播视觉增强。
  • 家装与室内设计:用户浏览房间视频时实时更换家具、墙面材质与灯光效果,辅助装修决策。
  • 影视后期预演:导演在剪辑阶段快速尝试不同视觉风格与场景替换,降低试错成本。
  • 具身智能数据合成:把人手操作视频转化为机械臂操作素材,低成本扩展机器人训练数据规模。

产品价格与版本

JoyAI-Video-Edit 由京东开源,代码与模型权重已在 GitHub 和 HuggingFace 放出,方便研究者和工程团队复现、二次开发。和同走流式路线的 SANA-Streaming 相比,后者是 2B 参数、编辑质量约 2.6,而 JoyAI-Video-Edit 是 16B 参数、OpenVE-Bench 编辑质量 3.60,在质量上拉开明显差距;SANA-Streaming 的 DiT 推理速度约 54 FPS 略快,但主要在较低分辨率运行,时序稳定性也以短片段为主。JoyAI-Video-Edit 的取舍很明确:用更大参数换质量和长时域稳定,把实时编辑真正推到 720P 可商用区间。具体商用授权条款以仓库 LICENSE 为准。

常见问题解答

实时流式编辑和普通的视频生成模型有什么不同?
普通生成模型是”先出完整视频”,编辑类模型是”在播放中改”。JoyAI-Video-Edit 的帧一到达就处理,不需要等完整序列,所以能边播边改;关键是靠有界 KV 缓存压住时序漂移,保证改到第几分钟时前面的人物特征不跑偏。
我需要多强的显卡才能跑?
官方给出的部署指标是 720×1280 分辨率下端到端 30.19 FPS,权重通过 HuggingFace 获取。具体单卡显存要求以仓库 README 的硬件建议为准,但”流式 + 有界 KV”的设计本身就是在为长序列下的显存和吞吐松绑。
可以商用吗?
代码与权重已开源在 GitHub 和 HuggingFace,便于研究和二次开发。具体商用授权请查看仓库内的 LICENSE 文件,确认条款后再用于生产。

官网网址

GitHub 仓库:https://github.com/jd-opensource/JoyAI-Video-Edit

HuggingFace 模型库:https://huggingface.co/jdopensource/JoyAI-Video-Edit

arXiv 技术论文:https://arxiv.org/pdf/2608.03974

OpenI AI时代点评

视频编辑和视频生成是两条赛道,但 JoyAI-Video-Edit 卡的位置很巧——它要的不是”生成一段新视频”,而是”在播放过程中按指令改”。流式处理的难点在于时序漂移:改到第 30 秒,前面的人物特征可能已经漂走了。它用有界 KV 缓存去压这个累积误差,思路上是对准了真问题,而不是堆参数把单帧质量刷高。

720P 下 30FPS 这个指标意味着它真有可能跑在直播场景里,而不只是离线玩具。京东把它开源也挺务实——视频编辑这块闭源方案贵,开源权重给中小团队留了入口。想做视频类应用、但又想要更偏”生成”能力的,可以对比 AstraFlow星图 这类文生视频方案,看自己到底是要”改”还是要从零”造”。

数据评估

JoyAI-Video-Edit浏览人数已经达到1,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:JoyAI-Video-Edit的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找JoyAI-Video-Edit的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于JoyAI-Video-Edit特别声明

本站OpenI提供的JoyAI-Video-Edit都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由OpenI实际控制,在2026年 8月 6日 上午11:08收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,OpenI不承担任何责任。

相关导航