World Labs发布Atlas模型:3到5台相机即可实现子弹时间与三维重建

2026-09-03 03:10 4 次浏览 前沿资讯

李飞飞创立的World Labs推出3D世界模型Atlas,仅需3到5台普通相机即可生成流畅的子弹时间效果,并同步输出深度图、点云和3D Gaussian Splat。该模型将相机位姿作为原生输入,实现精确的虚拟摄影机轨迹控制,标志着从二维理解到三维空间智能的跃迁,也为机器人训练和数字孪生提供了低成本方案。

导语

1999年《黑客帝国》中基努·里维斯仰身躲子弹的经典镜头,让“子弹时间”成为影史视觉奇观。当年剧组在绿幕棚里沿弧线布置了120台静态相机,才拍出那令人屏息的慢动作环绕效果。二十多年后,即便技术飞速进步,2025年VOGUE时尚盛典上仍需要60台iPhone 17 Pro配合专业同步设备,才能重现类似的大片效果。然而,李飞飞创立的World Labs刚刚发布的3D世界模型Atlas,彻底打破了这一物理定律——仅凭3到5台普通手机或运动相机,就能生成同样流畅、甚至更自由的子弹时间画面。

事件概览

World Labs近期发布了名为Atlas的3D世界模型,其核心能力是:从稀疏的多视角视频输入中,重建出具有空间一致性的三维场景,并允许用户在事后任意调整虚拟摄影机的位置和轨迹。在官方演示中,操作人员只架设了3到5台不同角度的手机和运动相机,采集素材后,通过Atlas即可生成视角在凝固的时空中平滑移动的子弹时间视频。更关键的是,模型不仅能输出最终渲染的视频,还能同步导出稠密深度图、三维点云以及3D Gaussian Splat,为后续的实时渲染和自由穿梭提供了完整的数据基础。

核心信息

技术原理:多模态自回归扩散Transformer

Atlas的技术架构名为“多模态自回归扩散Transformer”,它将文字、图像、深度以及相机位姿(Camera Pose)全部融合进同一个空间上下文。当多台手机从不同角度拍摄的视频输入模型时,每一帧画面都携带明确的三维空间坐标。凭借这些稀疏视角,模型在统一的空间上下文里维持视角之间的几何一致性,并推断出未被摄影机覆盖的区域。正如World Labs技术博客所言:“它看见的越多,需要‘想象’的就越少。”静态场景通常只需2到3张照片即可完成基础重建,而为了更精细的细节,模型也能处理上百张图片。输入的真实视角越多,模型对空间的理解就越扎实。

与传统视频生成模型的本质区别

目前主流的视频生成模型(如可灵AI等)可以通过单张图片和提示词生成环绕运镜效果,但本质上是在二维像素层面根据文本语义推演“看起来像是在旋转拍摄的视频”。镜头运动轨迹、转速和景深关系更多依赖模型自主发挥,缺乏精确控制。而Atlas的最大质变在于,它将相机位姿作为模型的原生几何输入参数。用户不再需要靠提示词碰运气,而是可以像在3D软件里排布机位一样,直接给虚拟摄影机设定精确的运动轨迹。这些轨迹坐标与现实空间严格对应——现场相机在哪个位置,虚拟镜头移到什么距离,Atlas都能明确对齐。简言之,普通AI视频是在2D画布上“画出运镜的感觉”,而Atlas先在神经网络内部构建起一个具有空间与时间连续性的三维世界,再派一台受用户完全操控的虚拟摄影机进入这个世界去重新取景。

后期自由度:从胶片到机位的革命

影像技术的发展史,本质上就是“现场拍摄决策不断向后期推迟”的历史。胶片时代,对焦、机位、快门时机几乎无法后期挽回;数码时代,RAW格式允许后期调整白平衡和曝光,计算摄影则让虚化与景深可事后模拟。而Atlas将这种“后期自由度”推向了最核心的机位:拍摄结束后,摄影师不仅能自由切换角度,甚至可以在电脑里凭空调出一个现场根本不存在的“上帝视角”——俯瞰整个场景,或拉近重构一个细节特写。这种体验让人联想到《赛博朋克2077》中的“超梦”编辑模式:玩家在凝固的时空里自由移动镜头,重新审视整个现场。Atlas相当于将科幻设定带进现实,未来普通人或许也能用手机随手记录片刻,事后真正“走入”那段三维记忆,从任意角度回味生活。

影响与观察

空间智能的基石

子弹时间只是Atlas展现在大众面前最直观的切面。在World Labs的蓝图中,这套能力最终要通向的是“空间智能”(Spatial Intelligence)。Atlas在推断时不仅能输出视频像素,还能同步导出稠密深度图、三维点云以及3D Gaussian Splat。它会先预测每一帧的深度,拼出场景的三维骨架,补全未被摄影机覆盖的区域,并转换成完整的3D Gaussian Splat场景,最终生成可在设备上实时渲染、自由穿梭的数字空间。这为“Real-to-Sim-to-Real”(真实→仿真→真实)的闭环提供了关键支撑。

对机器人训练的低成本赋能

2025年2月,World Labs宣布完成10亿美元融资;7月,公司收购了机器人与仿真公司SceniX。对于具身智能和人形机器人领域,一个关键瓶颈是如何低成本、规模化地获得丰富的训练经验和评测环境。真实机器人每次试错都会占用硬件、人工和场地,且很多罕见情况难以在现实中复现。有了Atlas,模型仅凭几条现场视频就能重建出逼真的数字孪生世界,算法可以在其中随意规划导航路线、推演机械臂抓取,甚至更改物体摆放、光照和背景,以极低成本生成近乎无限的训练数据。

结语

从当年创建ImageNet开启深度学习图像识别浪潮,到如今创立World Labs探索空间智能,李飞飞的研究主线始终清晰:从前是教电脑看懂一张二维照片里有什么,现在是教电脑理解一个三维空间里的物理规律、几何关系以及下一秒会发生什么。《黑客帝国》靠上百台相机硬生生围出子弹时间,如今几台手机配合一个世界模型就能重建出鲜活的三维时空。技术的每一次跃升,都在把创作从沉重的设备中解救出来。当物理机位不再成为灵感的阻碍,决定镜头方向的,永远是创作者想要讲述的故事。


信息来源:爱范儿,查看原始信息。本文由 AI ONLINE 基于公开资料整理,信息可能随时间变化,请以官方发布为准。