UniWorld-View – 兔展智能联合北大等开源的世界模型
UniWorld-View:颠覆性开源世界模型,重塑三维内容生成范式
由兔展智能携手北京大学、鹏城实验室共同打造的UniWorld-View,正以其卓越的性能和开放的姿态,在人工智能领域掀起一股新的浪潮。这款开源的世界模型不仅在李飞飞团队的WorldScore评测中拔得头筹,更以其创新的技术架构,实现了从单张图像到动态视频的无缝衔接,将三维内容的生成推向了前所未有的高度。
UniWorld-View:不止于视角,更在于统一
UniWorld-View的核心价值在于其统一的生成框架。不同于以往的模型需要针对静态图像和动态视频采用不同的解决方案,UniWorld-View仅凭一套模型和代码,便能轻松驾驭两种任务。无论是从一张静态图片出发,还是从一段动态视频入手,它都能根据预设的相机轨迹,生成全新的观察视角画面。这意味着,用户只需提供最基础的素材,即可实现从单图 3D 生成到视频 4D 生成的全面覆盖。值得一提的是,该模型已成功适配国产昇腾算力,并且代码与权重均已开源,为全球开发者提供了极大的便利和广阔的创新空间。
UniWorld-View的核心能力:解锁无限视角
- 静态图像的动态新生:输入一张普通照片,UniWorld-View便能模拟出各种相机,如推、拉、摇、移,甚至实现360°的环绕视角,生成一系列全新的多视角画面,让静态图像“动”起来。
- 视频的时空延展:面对一段单目视频,UniWorld-View能够智能推断出未被拍摄到的空间信息,并生成保持时间连贯性的新视角动态视频,让视频内容得以在时空中穿梭。
- 跨越静态与动态的鸿沟:其最大的亮点之一在于,一套模型即可同时处理静态图像的3D生成和动态视频的4D生成,实现了任务的真正统一。
- 精准的相机控制:UniWorld-View支持对相机位姿进行精密的控制,即使用户需要进行大基线的视角切换,也能保证生成画面的准确性和连贯性。
UniWorld-View的技术基石:精巧的渲染与生成融合
UniWorld-View的强大能力源于其独特的技术路径,特别是其在点云渲染和生成模型融合方面的创新。
- 破局点云渲染的“遮挡难题”:在传统的点云渲染中,前景背景的撕裂以及背面漏光是普遍存在的难题。UniWorld-View通过引入双重投影与法向过滤机制,巧妙地解决了这些问题。
- “双重投影”:捕捉遮挡的智慧:该技术将源画面先投影到目标视角,再将目标视角回投至源画面。那些无法成功回返的像素,便被识别为被遮挡区域,并逐帧累积形成遮挡掩码。这一过程有效避免了错误纹理对生成模型的干扰。
- “法向过滤”:守护视角的清晰边界:利用法向信息,该技术能够精确剔除物体背面的点云。这意味着,即使相机绕至物体后方,正面像素也不会出现穿透泄漏的情况,保证了画面的真实感。
- 几何与生成,协同共舞:UniWorld-View先利用几何模型构建三维点云,并渲染出目标视角下的条件图,随后将这些信息输入视频扩散模型进行精细化生成。这种几何与生成相结合的方式,既保证了相机控制的精度,又显著提升了画面的整体质量。
想要第一时间了解AI前沿动态,加入技术交流?微信搜索并关注“AI开源项目交流群”,回复“开源”即可获得入群邀请。
UniWorld-View:轻松上手,即刻体验
想要体验UniWorld-View的强大功能?以下是简便的使用步骤:
- 环境搭建:首先,您需要克隆GitHub上的仓库,并按照指引配置好Python环境及安装所需的依赖库。
- 模型获取:接着,从Hugging Face或GitHub Release下载预训练好的模型权重。
- 素材准备:准备好您想要处理的单张图片或一段视频,并清晰地定义您期望的目标相机轨迹。
- 执行推理:运行相应的推理脚本,模型将自动为您生成指定视角下的全新画面或视频。
- 国产算力赋能:如果您希望在国产昇腾算力平台上运行,请参照官方文档完成相关的适配与加速配置。
UniWorld-View的项目入口:探索更多可能
- GitHub代码库:https://github.com/PKU-YuanGroup/UniWorld-View
- HuggingFace模型中心:https://huggingface.co/Drexubery/UniView
UniWorld-View:性能卓越,优势尽显
在与同类竞品(以WorldScape-0.2(MoE)为例)的对比中,UniWorld-View展现出了多方面的领先优势:
| 评测维度 | UniWorld-View | WorldScape-0.2(MoE) |
|---|---|---|
| WorldScore综合表现 | 多项指标位居榜首(静态图像得分85.53,相机控制得分97.72,3D一致性得分91.63) | 动态视频得分76.23略高,其余维度表现逊色 |
| 技术路线选择 | 以遮挡感知点云渲染为基础,结合视频扩散模型 | 采用MoE(Mixture of Experts)架构进行生成 |
| 开放性 | 代码与模型权重完全开源 | 开源状态不明确 |
| 国产算力支持 | 已完成昇腾NPU适配 | 未提及相关支持 |
| 任务兼容性 | 单一模型支持静态3D与动态4D生成 | 主要聚焦于世界生成任务 |
UniWorld-View:赋能多元化应用场景
- 影视与广告业的效率革新:能够快速生成多机位镜头预览,有效降低实拍和三维重建的成本,为创意制作注入新活力。
- VR/AR与游戏开发的新纪元:基于一张概念图或一段视频,即可构建沉浸式的360°环绕场景,为虚拟世界增添无限可能。
- 机器人与自动驾驶的仿真基石:通过生成逼真的新视角数据,为训练视觉感知和路径规划模型提供坚实的基础。
- 文化遗产的数字化新生:对珍贵的文物或古建筑进行单图/单视频采集后,生成多角度的数字化展示,让历史文化焕发新生。
- 电商与房地产的沉浸式体验:利用单张商品图或房间视频,生成全方位的展示内容,极大地提升用户的互动感和购买欲望。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


