HiDream-O1-World

HiDream-O1-World – 智象未来推出的全模态交互式世界模型

在人工智能领域,构建一个既具备高度视觉真实感,又能实时响应物理法则的交互式世界,一直是前沿科技追求的“圣杯”。近日,智象未来(HiDream.ai)正式发布了其原生全模态交互式世界模型——HiDream-O1-World。该模型通过独创的UiT架构,打破了传统生成式AI在长时交互中面临的场景崩塌与物理失真瓶颈,为数字世界的构建树立了全新标杆。

HiDream-O1-World的核心逻辑在于其“3D先验注入Memory上下文”与“Test-Time Training(测试时训练)在线适应”的深度协同。这一创新机制赋予了模型对空间结构的长期记忆能力,使得在漫长的探索与交互过程中,环境中的物体不仅不会出现位置漂移,更不会发生“失忆”现象,确保了整个世界在视觉与物理层面的全局统一性。

该模型支持多种模态的输入,无论是文字描述、图片上传,还是即时的交互指令,系统均能迅速解析并转化为细腻的交互场景。用户既可以上传一张室内照片,让AI自动补全并构建出一个高精度的数字孪生空间,也可以在漫游过程中驱动角色执行抓取、跳跃等动作,甚至能够通过指令改变环境参数,如触发降雨或模拟物体坠落。值得一提的是,其物理表现力极佳,碰撞、重力与流体反馈均严格遵循因果逻辑,视觉物理合理性指标较业界平均水平提升了13.6%。

作为目前WBench评测榜单的领跑者,HiDream-O1-World以80.9分的综合成绩登顶Navi分榜,尤其在物理维度(73.3分)与一致性维度(88.0分)均展现出了统治级的领先优势。这种卓越表现使其在多个领域展现出巨大的应用潜力:

在AI互动影游领域,它将观影体验从“被动接收”转化为“主动叙事”,用户的一举一动都能驱动情节的实时演进;在具身智能训练中,它能为机器人打造低成本、高安全的仿真试验场,有效替代高风险的实景测试;对于自动驾驶研发,它能够模拟极端天气与复杂交通路况,加速算法的验证过程;此外,在3D数字内容创作及微观生命科学模拟等领域,它同样提供了前所未有的高效解决方案。

相较于目前开源阵营中的同类产品,虽然HiDream-O1-World尚未开源,但凭借其在复杂场景设定、物理真实性以及长时程一致性上的深度技术积累,它已成为当前高精度仿真与高端产业应用的首选方案。随着该模型在数字孪生、影视互动及机器人仿真等领域的深入渗透,交互式世界模型将加速从“概念实验室”走向“产业应用场”。

如需进一步深入了解该项技术,可访问项目官网(https://yanghb22-fdu.github.io/DreamWorld/)或研读相关技术论文。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...