刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位
大模型理解文字,李飞飞想让 Atlas 理解空间
背景
前脚友商还在为你追我赶生成几秒钟的「电子榨菜」视频卷到头秃;后脚李飞飞创办的 World Labs 微微一笑,把桌子掀了——
▲官方博客🔗 https://www.worldlabs.ai/blog/atlas
按照官方定义,Atlas 是一款面向空间智能的 omni world model,从零开始完成预训练,可以原生处理文本、图像、视频、相机位姿与 3D 深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。
以前大家玩视频生成模型,多少有点玄学抽奖。我们在 Prompt 框里卑微敲下:「镜头缓慢向左拉升、绕着人物微仰角旋转」,回车之后全凭老天保佑。
核心内容
只要丢进去 1 到 6 张普通照片,定好运镜轨迹,Atlas 就能生成最长达 1 分钟、1440p 分辨率 的大片。
原文来源
本文整理自 爱范儿:https://www.ifanr.com/1678079,版权归原作者所有,了解详情请查看原文。
© 版权声明
文章版权归作者所有,未经允许请勿转载。

