Atlas:让 AI 预测世界的下一个视角

Justin Johnson · World Labs 联合创始人 · 2026-09-04
听中文精华AI 合成朗读00:00
我们说的是大约 50 倍、100 倍的削减。
— 嘉宾

关联

一家公司发布了新模型,只靠三台普通手机拍的视频,就能复现《黑客帝国》里需要数百台相机、绿幕和昂贵标定才能拍出的「子弹时间」镜头——时间冻结、相机绕着飞。这一集是 a16z 的 Martin CasadoWorld Labs 的三位联合创始人对谈:李飞飞(空间智能概念的提出者)、Justin Johnson 和 Ben Mildenhall(Nerf 的创造者,从图像做 3D 重建的顶尖学者),聊他们刚发布的下一代世界模型 Atlas,以及一个更大的假设:下一个 token 预测造就了语言模型,那「新视角预测」能不能成为空间智能的等价物?

Atlas 是什么:输入几个视角,预测任意新视角

Atlas 是他们的新世界模型,有三个基本能力:生成、重建、模拟。最核心的设计是一条:它做的是「新视角预测」——给定一个场景的若干视角或文字描述,这些输入进入一个「空间上下文」,隐式地描述出你想谈论的那个世界;然后你可以把一台虚拟相机指向空间和时间中的任意一点,Atlas 会理解那个世界从这个位置看起来应该是什么样。

与外面众多自称「世界模型」的视频模型的关键区别在于:Atlas 里放入的每一帧都带有空间锚定的含义——每张图都关联一个三维相机位姿(相机在 3D 空间中的位置与朝向)。这意味着重建可以达到极高精度:给它房间四个角落的视角,它会精确复刻房间里的一切,而不是去猜另一个角落里有什么、事物之间是什么关系。反过来,你也可以拿两张来自不同 AI 生成或真实地点的照片,精确定位布景,执导出完全受控的穿越镜头——这和视频模型那种「老虎机式」反复重碰的文本控制完全不同。

第一次把生成与重建放进同一个模型

历史上,重建和生成是计算机视觉里两个独立的子领域,各有专门的任务和模型。李飞飞强调,这是第一次实现「像素生成与像素重建的统一」——计算机视觉领域存在超过半个世纪,博士论文 countless 篇写在重建或新视角合成上,学术会议也分成生成、识别、重建几条赛道;Atlas 通过锚定在视点与视点估计上,把这两件事优雅地统一了。

为了做到这一点,架构上有几个关键改动:模型从预训练起就是原生多模态的——文本、图像、视频,而且把相机位姿当作模型的原生输入,还把 3D(以深度图的形式,即记录每个位置空间结构的图)作为原生模态,这在预训练阶段之前没人做过。

稀疏重建:从 300 张照片降到 3 张

Ben 解释了为什么这是一次量级飞跃。传统「稠密重建」更接近科学或医学成像:想出现在重建里的每一样东西,都至少要有它的三四个视角。

哪怕是麦克风底下、桌底、植物叶子之间这种位置也得覆盖——训练有素的人扫一个房间要几分钟,普通消费者第一次可能要一小时,扫多房间环境有人花过两小时;一个房间通常要拍两三百张照片。而 Atlas 要做的是把它降到大概三张——50 到 100 倍的缩减。

到了这个规模,整个权衡被颠覆:你可以回头用已有的图像、网上找的素材、随手拍的旧视频,让那些原本绝不会被视为「可重建」的素材以 3D 活过来。Ben 把自己以前从没成功过的旧采集扔进系统,第一次看到了重建;或者把 2000 张图的多房间采集砍到三四十个输入,飞越效果看起来基本一样。

为什么少了视角也能补上?李飞飞举了个被低估的演示:斯坦福四方院,只用 3 到 25 张全部站在地面拍摄的照片重建,但展示时是从空中视角飞越——你看到的一切都是生成的,却遵循重建的法则。

逻辑在于:经典重建需要多视角做三角测量,而任何输入视角里没拍到的像素,在重建里就是一个洞;填补这些洞本质上是一个生成式过程。哪怕是让 Ben 这个世界专家拿 DSLR 拍几百张,也总会漏掉东西,所以模型必须有生成能力去想象、填缝。

Justin 用 LLM 的「上下文窗口」类比这件事:当年大家从 128k 卷到百万 token 上下文,人人都懂把上下文拉长的价值;但图像和视频模型这一侧,从来没有人以同样的原则推进过——没人把一小时的视频放进去、做大海捞针式的帧检索。而重建其实就等于「用超长上下文做生成」:往里倾倒大量视角,模型据此构建这个世界的连续体。上一代产品 Marble 有根本性阻碍——塞不进几张图;Atlas 可以拿 64 张图的采集对整栋房子做穿行飞览,一切都是被看到、几乎被看到、或从未见到之处略微外推所锚定的。

「它太神奇了」:缩放定律与那个 Slack 消息

主持人问:着手做的时候,你们知道会成功吗?三位都表达了对缩放定律的完全信念——每次把模型做大、训练更久、放上更多芯片,它都显著变好。

但李飞飞说,具体的架构选择和数据配比才是魔鬼所在;她看着 Justin 的团队从「不知道要多久」到「有生命迹象」再到「哇,这会成功」。「我不确定它会这么好、这么快地奏效」——用新架构、新范式预训练一个新模型,第一个周期就成功,这件事本身是疯狂的。

内幕故事:初夏的某一天,一个比最终 Atlas 还小的模型,被喂进视点生成——就是 Nerf 论文里那张著名的花园桌子,一夜之间 Ben 发了一条 Slack:相机从桌子底下、带着足球飞穿过去。那天早上三个人对视一眼:「就是它了。」五秒之内做了决定——从来没有人见过这样的结果。

至于扩展是不是到头了:不,基本还在起点,不改架构也还有很大空间;当前的瓶颈主要是训练算力——博客里展示的模型是被发布截止日期倒推出来的,不是被规模或数据限制的。

用例:创意管线与「可编辑的 3D 状态」

创意工作者是既有用户群。有趣的是,用户已经在用 Marble「曲线」实现新视角预测:放一张图进去得到 3D 场景,再从不同视点截图——Atlas 直接把这条链路生成式地做了。Justin 指出,没有人用单体模型完成整个创作任务,大家的流程是多阶段的:故事板、情绪板、关键帧、剪辑;而真正的价值在于提供「持久的 3D 状态」——几十年来人们习惯了舞台、道具、场景元素这种持久的状态性,而不是「生成一个、扔掉一个、只留提示词」的短暂模式。

再往工业和设计延伸:为会议搭展位、建筑、施工——世上太多东西需要先经过费力的虚拟设计,而其中最艰巨、劳动密集的部分就是把口头反馈、草图映射回 3D 表示。「开个会拿反馈,然后回去改一周」,只因软件是几十年前的产物,从来没变得像玩乐高、做陶艺那样直观。这正是 AI 能真正解锁价值的地方。

机器人:真实到仿真的数据瓶颈

李飞飞解释了对机器人的意义。他们收购了原名为 Cinex 的公司,其关键技术是「真实到仿真、仿真到真实」的系统:训练机械臂做工业布线,需要大量数据训练机器人策略,再评估、再部署;过去靠稠密重建来还原环境——极其痛苦、耗时、费人,严重拖慢仿真到真实的速度,Atlas 就是这条路的下一代技术。

她把视野拉远:当下机器人领域最大的问题是数据,总有一天会变成芯片,但现在就是数据——因为收集机器人运行其中的真实世界数据太难,而且还要做「随机化」:同一个环境,线缆要能朝不同方向弯、盒子要有不同大小颜色位置,这必须经过真实到仿真的流程才能凑够数据。

Ben 补充了一个根本差异:生成代码、图像、视频,模型产出的是静态工件,网上有的是样本;而机器人策略是一个要走进真实世界、做出动作、追求目标的东西,世界不会总按你期望的方式回应。所以训练时策略必须暴露于部署中一切可能出错的情况——这正是仿真的关键。

经典路线是人类设计师在物理引擎里写显式代码穷举场景;另一条更数据驱动的路线,是训练「神经仿真器」——一个学出来的、理解世界将如何回应动作的模型,用它当仿真床来训练机器人策略。这是 Atlas 非常有趣的未来方向。

动态:架构已支持,雏形已在模型里

领域专家给的一条反馈是:很棒,但需要更多动态——世界得会动。回应是:动态显然会来,而且雏形已经有了。上一代 Marble 从根本上就是静态的,动态能力都没法处理,这写死在架构和训练里;Atlas 的架构从一开始就支持动态,训练数据也包含动态——仔细看发布的视频,水里有波浪、航拍里有小车在动。

有意思的是,从多视角重建 3D 时动态本是麻烦事,两者看似矛盾。他们的论点恰恰相反:即使在最终想要静态输出的情况下,最好的做法也是让模型在预训练中接触尽可能多的动态与静态内容,让模型自己学会把动态分解出去;之后再在后训练中聚焦静态。预训练检查点里已经有大量潜在动态。

AI 完备:下一视角预测是下一 token 预测的等价物

收尾回到最大的假设。Justin 引入「AI 完备性」的概念(与图灵完备性类比):如果一个 AI 任务在其最普遍的意义上被解决,就能解决任何智能问题,它就是 AI 完备的。

下一个 token 预测被普遍认为是 AI 完备的——经典例子来自 Ilya:一本悬疑小说读到最后一句「而凶手是——」,预测下一个 token,就逼着模型具备全部推理能力。而新视角预测同样如此:你可以有一部电影的所有帧,然后凶手走出来那一刻,准确预测走出来的是谁。

李飞飞给了演化视角的收束:新视角预测正是演化必须解决的问题——自然给了动物眼睛,却没给树眼睛。为什么?

因为当你移动时,你才会看到新的视点。所以三位非常坚定地相信:下一个视点预测,就是下一个 token 预测在空间智能中的等价物。

本集带走

  • Atlas 的底层原语是「新视角预测」:输入若干带相机位姿的视角(最少可到一张),模型构建隐式的空间上下文,然后从任意空间时间点渲染出该世界的样子——这与 LLM 的下一 token 预测、视频模型的下一帧预测并列。
  • 生成与重建第一次统一进一个模型:经典重建需要多视角三角测量、拍不到就是洞;Atlas 用生成能力填缝,把房间重建所需照片从两三百张降到约三张(50-100 倍缩减),旧照片、旧视频、网图都能变 3D。
  • 架构层面的关键创新:预训练起就原生处理文本、图像、视频、相机位姿和深度图多模态;每次放大模型、延长训练、增加芯片都显著变好,且当前瓶颈是算力而非数据,扩展远未到头。
  • 对机器人,核心价值在「真实到仿真」的数据瓶颈:机器人策略训练需要覆盖一切出错场景的数据加条件随机化,神经仿真器(用 Atlas 这类模型充当可学习的仿真床)是通往这条路的下一站。
  • 终极假设:如果下一 token 预测是语言智能的 AI 完备任务,那么生成式的下一视角预测就是空间智能的等价物——移动者才需要预测新视角,这正是演化给动物眼睛而不给树眼睛的原因。
全部金句 5 条

我们说的是大约 50 倍、100 倍的削减。
We’re saying like 50, 100x reduction.
—— 嘉宾 · [00:21]

并不清楚的是,用新架构和新范式预训练一个新模型的第一个周期,第一个周期就奏效是疯狂的。
It’s not clear that the first cycle of pre-training a new model with a new architecture and a new paradigm, the first cycle of that working is insane.
—— Justin Johnson · [22:32]

但一切都有瓶颈,我认为持续扩展这个东西的主要瓶颈实际上是训练算力。
But everything has a bottleneck, and I think the main bottleneck on continuing to scale this thing is actually training compute.
—— Justin Johnson · [23:04]

总有一天会变成芯片,但目前是数据。
One day it’ll be chips, but for now it’s data.
—— 嘉宾 · [31:00]

所以我们非常坚定地相信,下一个视点预测就是下一个 token 预测的等价物。
So we do believe very strongly that next viewpoint prediction is the equivalent of next token prediction.
—— 嘉宾 · [43:15]

接着看

顺着「创业与行业」挖下去

换个口味