LiveWorld

LiveWorld – 阿德莱德大学等推出的生成式视频世界模型

LiveWorld:突破视野局限的生成式视频世界模型

LiveWorld,一项由阿德莱德大学、澳大利亚国立大学等顶尖科研机构联合孕育的创新成果,它并非仅仅是一个视频生成模型,而是一个性的生成式视频世界模型。其核心突破在于解决了困扰传统模型的“视野外动态”难题。以往的模型,当物体或场景从相机视野中消失时,其状态便被“冻结”,仿佛时间停止。LiveWorld则通过巧妙地将世界的演化过程与观察渲染过程进行显式解耦,赋予了动态实体在不可见时也能持续发展演进的能力,从而实现了真正意义上的四维(4D)世界模拟。

LiveWorld 的核心能力解析

  • 精准识别动态实体:借助 Qwen3-VL 和 SAM3 等先进模型,LiveWorld 能够自动辨识视频中的活动人物、动物、车辆等各类动态对象。
  • 智能注册虚拟:每当发现一个新的动态实体,LiveWorld 会在其所在位置注册一个固定视角的“虚拟”,该将不间断地追踪实体的状态变化。
  • 无缝处理视野外演化:即使相机移开,LiveWorld 的虚拟也能在后台持续推进实体动作的演进(例如,一只狗在主人离开后继续完成进食动作),而非像传统模型那样陷入静止。
  • 稳健构建静态环境:通过 Stream3R SLAM 框架,LiveWorld 能够将静态的背景环境增量式地融合为全局三维点云,为动态实体提供坚实的空间基础。
  • 感知驱动的渲染生成:LiveWorld 将经过演化更新的动态四维点云与静态三维点云相结合,并将其投影到目标相机轨迹上,最终生成连贯且逼真的观察帧。
  • 维持外观一致性:利用 Appearance LoRA 技术,LiveWorld 能够检索历史参考帧,确保在长序列视频生成中,实体的身份和纹理信息保持高度一致,避免漂移。

LiveWorld 的技术基石

  • 世界状态的结构化解耦:LiveWorld 将世界表示为静态三维背景与动态四维实体相结合的结构化近似,而非直接生成二维帧。
  • 演化与渲染的运作:世界状态首先通过演化算子进行全局更新,随后通过渲染算子结合相机姿态生成观察,这两大过程实现了清晰的分离。
  • 创新的“”机制:在固定的锚点位置部署虚拟,由“演化引擎”(Evolution Engine)自主驱动局部的连续发展。
  • SLAM 驱动的空间记忆:采用前馈式 SLAM 框架 Stream3R,实时融合静态背景信息,支持长期场景重访和视角变换。
  • 注入状态的生成过程:通过 State Adapter 将投影后的几何条件注入视频扩散模型,精确约束物体的空间位置、结构和轨迹。
  • 闭环的智能流水线:系统通过观察新区域、注册动态、后台推进状态、渲染最新状态的持续循环,实现智能世界的动态构建。

想要深入了解并参与 AI 开源项目,请关注我们的微信公众号并回复“开源”。

如何驾驭 LiveWorld

  • 环境准备:首先,从 GitHub 克隆 LiveWorld 的代码库,并按需安装 PyTorch、Stream3R、Qwen3-VL、SAM3 和 Wan2.1-14B-T2V 等必需的软件依赖。
  • 输入配置:为 LiveWorld 提供一段作为初始观察的前置视频帧,同时定义目标相机轨迹,并辅以描述动态实体未来行为的文本提示。
  • 动态实体识别:LiveWorld 将自动调用 Qwen3-VL 和 SAM3 模型,扫描输入帧,精准识别其中的人物、动物或车辆等活动实体。
  • 虚拟部署:对于每一个新识别出的动态实体,LiveWorld 会在其当前位置部署一个固定视角的虚拟,作为后续视野外动态演化的关键锚点。
  • 视野外动态的持续推进:当相机沿着预设轨迹移动时,虚拟将继续在后台利用演化引擎生成该区域的后续视频,确保实体动作的连贯性,而非停滞不前。
  • 静态场景的记忆构建:LiveWorld 会并行运行 Stream3R SLAM 框架,将历史观察中的静态背景区域逐步融合,构建成全局的静态三维点云。
  • 状态驱动的渲染生成:当相机到达目标位置时,LiveWorld 会将已经演化更新的动态四维点云与静态三维点云投影到目标视角,并通过 State Adapter 和 Appearance LoRA 技术生成最终的观察帧。

LiveWorld 的核心竞争力

  • 颠覆静态世界假设:LiveWorld 首次在理论上形式化并成功解决了“视野外动态”这一难题,彻底打破了传统模型仅在视野范围内进行演化的局限。
  • 实现长时序的连贯性:在 LiveBench 基准测试的第二次重访场景中,LiveWorld 的 VQA-Acc(视觉问答准确率)达到了令人瞩目的 54.620%,远超 Spatia 等同类竞品。
  • 支持多的并行演化:LiveWorld 能够同时驱动多个虚拟在视野外演化不同的,其 Full Succ.(完全成功率)指标高达 26%。
  • 确保新视角下的几何一致性:动态点云的 Chamfer Distance(倒角距离)低至 0.135,意味着在新的视角重访时,实体仍能保持准确的空间位置。
  • 卓越的模块化与可扩展性:LiveWorld 由静态记忆、动态演化、状态渲染三大核心模块协同工作,这些模块可以进行优化和替换,为未来的发展提供了广阔的空间。

LiveWorld 的项目资源

LiveWorld 与同类竞品对比分析

对比维度LiveWorldMatrix-Game-2.0
视野外动态处理能力✅ 支持持续演进,实体离开视野后仍能在后台发展❌ 无法处理,实体状态在最后一次被观察时冻结
世界表示方式显式构建三维静态点云与四维动态实体点云隐式三维表示,直接从二维历史帧预测
Same-Pose 第二次重访 VQA-Acc54.6205.012
Different-Pose 第二次重访 VQA-Acc49.4784.132
动态实体一致性 (DINO₂ₙᵈ)0.7210.122
动态点云空间一致性 (CD₂ₙᵈ)0.1356.236
技术架构特点演化与渲染过程显式解耦,采用闭环流水线演化与渲染耦合,单一视频生成器直接预测
多并行处理能力✅ 支持多个虚拟同时推进❌ 缺乏演化机制,无法实现并行处理
静态背景一致性表现优秀(通过 SLAM 增量积累)一般(依赖隐式记忆,易出现漂移)

LiveWorld 的广阔应用前景

  • 智能体训练的虚拟环境:为具身智能体提供一个能够持续演化、高度可交互的虚拟世界,支持其进行复杂的视野外推理训练。
  • 自动驾驶仿真中的安全保障:能够模拟交通场景中不可见区域(如盲区)的动态变化,从而显著提升自动驾驶系统的决策安全性。
  • 开放世界交互式游戏:构建能够让玩家离开后,游戏内的 NPC 和仍能按照逻辑持续发展的开放世界游戏。
  • 大规模合成数据生成:生成具有长期时序一致性和复杂逻辑的大规模训练数据集,以满足人工智能模型训练的需求。
  • 机器人导航与规划的智能助手:支持机器人在探索未知环境时,能够始终对未观察区域的动态状态保持准确的信念,从而优化导航与规划策略。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...