李飞飞World Labs发布全球首个多模态世界模型Atlas,空间智能突破

2026-09-03 03:11 4 次浏览 前沿资讯

李飞飞创办的World Labs发布全球首个多模态世界模型Atlas,可原生处理文本、图像、视频、相机位姿与3D深度。只需1-6张照片即可生成长达1分钟1440p视频,支持精准相机控制、空间重建和时空模拟,为机器人训练和具身智能提供Real to Sim新路径。

大模型理解文字,李飞飞想让Atlas理解空间。就在前脚友商还在为生成几秒钟的“电子榨菜”视频卷到头秃时,后脚李飞飞创办的World Labs微微一笑,将桌子掀了——全球首个多模态世界模型Atlas正式登场。

事件概览

按照官方定义,Atlas是一款面向空间智能的omni world model,从零开始完成预训练,可以原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。World Labs在官方博客中公布了这一消息,并展示了多项令人惊叹的Demo。

核心信息

相机控制生成:运镜不再玄学

最直观的炸场操作是Camera Controlled Generation(相机控制生成)。以往视频生成模型依赖Prompt,用户输入“镜头缓慢向左拉升、绕着人物微仰角旋转”后,结果全凭运气。Atlas直接将“相机位姿参数”作为底层原生输入,用户只需给定坐标,丢进去1到6张普通照片,定好运镜轨迹,就能生成最长达1分钟、1440p分辨率的大片,画面不崩,空间几何丝滑一致。

更夸张的是它的空间“脑补力”。输入一张只拍到机器人正面的照片,Atlas能完整补出背影;给一张泳池边角照,它能靠模型先验补出隔壁没拍到的草坪和远山。不过,镜头一旦进入原图没有拍到的区域,Atlas仍然需要依赖模型先验去猜,视角跨度越大、生成路径越长,局部几何漂移、物体形状变化和纹理闪烁也越容易暴露。它生成的更像是一个视觉上合理的三维世界,未必是原来那个世界的精确数字复刻。

空间重建:稀疏视角重建3D场景

Atlas的第二张王牌是Spatial Reconstruction(空间重建)。传统3D高斯泼溅或点云扫描需要专业设备围着目标转几十圈,拍几百上千张照片。Atlas只需2到25张游客视角的地面平拍照片,就能还原斯坦福大学Main Quad的草坪、拱廊以及纪念教堂外墙的全部细节,并生成上帝视角航拍漫游。在DTU、ETH3D、ScanNet等公开数据集上,专门测稀疏视角重建误差(AbsRel ×10⁻³):Atlas拿下25.3的分数(分数越低越好),对比Pi3X的28.7、Depth Anything 3的39.3、MapAnything的47.7,优势明显。输出直接对接点云和3D Gaussian Splatting,能无缝接入World Labs的Marble平台,实现高帧率即时渲染。

子弹时间式Reframing Video

无需好莱坞几百台相机的环形阵列,研究员用三五个普通手机、运动相机随手一架,拍一段日常打闹,Atlas就能在虚拟空间里随意切换视角,原地复刻《黑客帝国》中的子弹时间效果。

技术架构:多模态自回归扩散Transformer

Atlas的技术底座是一套极其硬核的组合拳:Multimodal Autoregressive Diffusion Transformer,即多模态自回归扩散Transformer。它兼采两大主流范式的长处:Multimodal原生融通文本、二维图像、相机位姿与3D深度;Autoregressive像语言模型预测下一个词一样,在时空序列中逐级预测新的空间状态;Diffusion基于Rectified Flow逐步去噪,确保连续高维信号的画质与几何精度;Transformer以最成熟的矩阵乘法结构为底座,无缝适配现有大规模算力集群。这套架构让Atlas能够同时享受到LLM领域的KV Cache、分布式推理优化,以及扩散模型的采样蒸馏与先验引导。

盲测表现:单方面骑脸输出

在针对镜头运动控制的真人Blind Test(盲测)里,Atlas面对MiniMax H3胜率75%,面对Gemini Omni Flash胜率81%,面对FLUX 3胜率冲上93%,面对Seedance 2.5胜率达到凶残的94%。

图像生成与360°全景图

除了世界生成和空间重建,Atlas还具备不错的图像生成能力,能处理复杂Prompt、文字渲染以及写实、电影感、油画、漫画等多种风格。更值得关注的是,Atlas能直接根据文字或图片生成360°全景图,相比普通文生图需要处理前后左右的空间连续性,对模型的空间理解要求更高。

影响与观察

李飞飞和World Labs的终极目标不是与好莱坞抢特效饭碗,而是解决具身智能与机器人训练的最大痛点。目前机器人训练依赖真实场景反复试错,数据采集速度慢、成本高;换到仿真环境又需大量人力搭建3D场景、材质、光照和物体。业内估算,完全依靠传统方式收集足够规模的机器人训练数据,最终成本可能达到100万亿美元量级。

Atlas给出的Real to Sim路线,直接省掉了中间大量人工搭建仿真世界的工作。拿手机拍两段24帧的工厂或房间视频,喂给模型,Atlas就能原地吐出一个高精度的3D物理空间,机器人可以钻进这个孪生空间里疯狂“跑图”试错。机器人走到哪,Atlas就当场渲染出机载摄像头应该看到的RGB图和深度图。机械臂碰一下刚性箱子、拉一下铰链柜门、捏一下软体海绵,Atlas统统能模拟出受力反馈。只需录一段真实现场,就能衍生出千万种光照、摆放和障碍物条件。

World Labs还强调了Scaling的重要性。官方博客提到,随着参数量和计算力成倍上翻,模型展现出了类似大语言模型那种“突然开窍”的涌现能力,暴力Scaling依然是版本答案。目前Atlas已经向部分合作伙伴开放Early Access,并将在未来成为Marble和World Labs其他产品的底层模型。

结语

从二十年前奠基计算机视觉的ImageNet,到斯坦福实验室十年来深耕“视觉+机器人学习”,再到创办World Labs,李飞飞本质上是死磕同一条轨道。ImageNet解决的是“让机器在像素中识别世界”,而她越来越关心的是:机器看见一张图之后,究竟有没有理解背后的三维空间,以及下一秒会发生什么?李飞飞曾把今天的大语言模型形容为“黑暗里的文字高手”,能谈论现实,却缺少真正生活在现实中的经验。一个模型可以解释杯子为什么会从桌上掉下来,但机器人真要伸手拿杯子,还得知道杯子离桌边多远、手从哪个方向过去,以及碰到它以后整个场景会发生什么变化。Atlas所代表的空间智能,某种程度上就是给已经十分发达的语言智能加上一层关于几何、物理、时间和行动的世界经验。LLM把互联网里的知识交给了机器,世界模型接下来争夺的,可能是机器从数字世界走向现实世界的那张最真实的入场券。


信息来源:爱范儿,查看原始信息。本文由 AI ONLINE 基于公开资料整理,信息可能随时间变化,请以官方发布为准。