李飞飞谈空间智能:机器人不需要完美,需要的是反事实推理

Fei-Fei Li · World Labs 创始人 · 2026-07-28
听中文精华AI 合成朗读00:00
下一个前沿领域是教会 AI 理解物理世界并在其中行动。
— 嘉宾

关联

训练一个机器人,为什么不能像训练语言模型那样疯狂喂数据?因为互联网上有无穷无尽的文本,却没有无穷无尽的物理世界交互数据。

现实里让机器人试错一个任务,比人亲手去做还要慢。这一集里,World Labs 的李飞飞和被收购的 Cynic 创始人 Yunzhu 讲了他们怎么用「空间智能」和「数字仿真」来破解这个死结。

在这集 A16Z 播客里,主持人 Martin 和两位嘉宾聊了几个核心问题:World Labs 为什么要收购一家做机器人的公司;他们怎么用「仿真」(在数字世界里建一个有物理规律的环境,让机器人在里面练)来替代昂贵危险的现实试错;为什么他们认为现在很多人形机器人的预测太激进了;以及如果机器人的能效真要追上人脑的 30 瓦,还要走多远的路。最后他们还说了,如果你在做机器人,什么时候该去找 World Labs。

说完了这集大概在讲什么,先得搞清楚一个前提:World Labs 是什么,为什么要买一家机器人公司。李飞飞开门见山地定位:World Labs 是一家做前沿模型的公司,他们押注的下一个方向叫「空间智能」(让 AI 能生成、理解、推理并与三维空间交互的能力)。

她强调,他们一直相信「我们生活的世界可以是多维度的世界」,人可以在物理空间里行动,也可以在虚拟空间(比如游戏、视觉特效、设计)里创造。而机器人,正是在物理空间行动中最让人兴奋、也最重要的应用场景。所以收购 Cynic,对他们来说是走向物理世界的自然延伸。

那 Cynic 到底是做什么的,为什么对 World Labs 这么关键?这就得说回机器学习里最让人头疼的瓶颈——数据。

Yunzhu 介绍说,语言模型有整个互联网的文本可以吃,但机器人没有这种待遇。现实里采集一次机器人操作的数据,速度比人类亲手干一遍还要慢;而机器人的任务又极其多样,受物理定律约束。

为了解开这个死结,Cynic 的做法是建一条「现实到模拟再到现实」的流水线:先把真实环境高保真地映射到数字世界,确保数字世界里发生的事在现实里也会发生。这样一来,就可以用数字世界里批量、快速生成的数据,去替代现实里昂贵又危险的试错。

技术路线聊完了,接下来就要直面行业内最流行的另一种解法:既然缺数据,直接用视频生成模型(像教 AI 看视频那样学物理规律)不行吗?Yunzhu 的回答直指视频模型的软肋——一致性。

他说,他们要构建的数字世界,必须在空间上、时间上、不同视角下都保持一致。他举了个特别生动的例子:想象一个机器人在往前推一个物体,如果是在现有的视频预测模型里,那个被推的物体很可能会莫名其妙地消失。

这样的「幻觉」没法给机器人提供正确的学习信号。他们要做的仿真,能保证物体被推了就会按规律移动。

说完了为什么要坚持做仿真,那仿真的哲学到底是什么?它和现实世界数据冲突吗?

李飞飞在这里抛出了全集最有信息量的一段洞见。她说,仿真和真实数据不是二选一,人类智能本身就在做大量的仿真——大脑在推演那些没发生、不可能发生、或者现实里数据不够的事件,这叫「反事实推理」(counterfactual reasoning)。

她举了个直观的例子:世界杯的每一场比赛,教练团队都会做沙盘推演或数字仿真,这就是在反事实推理。这是真实数据永远无法替代的功能。她还提到一个实证:自动驾驶公司 Waymo 比起依赖真实路测,其实更重度依赖仿真,而且汽车已经是目前最简单的机器人了

有了仿真的底座,接下来要看它怎么具体帮到工业界里的机器人公司。Yunzhu 把仿真提供的价值拆成了两个词:可靠性和效率。

讲可靠性时,他说仿真可以让你系统性地去改变光照、摩擦力、几何形状、物体类型这些参数,确保机器人在各种极端情况下的状态空间都被覆盖到。讲到效率时,他提到了一个很反直觉的痛点:现在很多机器人公司在做「遥操作」(人戴着设备远程操控机器人来采集数据),这个采集速度比人亲手干活还要慢。

但客户要的是比人更快的速度。在现实里你没法简单地把机器人开快,因为重力不会变;但在仿真里,你可以系统性地对机器人行为进行加速,同时让它兼顾环境的动力学变化,这就给了客户效率上的突破

仿真在训练和评估上这么厉害,那它适合解决所有机器人的问题吗?话题到这里自然就转到了机器人形态的争论上。

李飞飞直说,现在外界对「人形机器人」的很多预测有点太激进了。她按环境的「结构化程度」理了一条线:工厂里的汽车生产线是完全结构化(自动化了几十年);亚马逊仓库、酒店后厨算半结构化(你能控制一部分环境);而真正非结构化的环境,就是你和我这样的普通人家里。

人形机器人的形态是为了适应非结构化环境才进化出来的——为了在哪儿都能活下去,所以什么都能干一点,但什么都不一定最好。但从商业和技术的务实角度看,最难的恰恰就是这种通用和非结构化。所以她的判断是:先把力气花在半结构化环境上,这才是可持续的现实路径

从现实路径的克制说开去,主持人最后抛出了一个扎心的问题:我们离造出拥有「人类能效」的机器人还有多远?人脑运行只要 30 瓦,而现在的 AI 连生成一张图都远没这么高效,更别提在物理世界里干体力活了。

Yunzhu 坦言,这需要很长时间,因为机器人最终是个系统工程,从硬件、软件、大脑到手指的摩擦系数都得严丝合缝。李飞飞在旁边补了一句很有分量的总结:「当今 AI 中最难的事情,是拥有正确的适度乐观。」 我们会看到很多进步,但要在物理世界里达到人类的能效,路还很长。

本集带走

最后收个尾,这一集值得带走的是这么几层意思。第一,李飞飞做空间智能的野心,不只是生成好看的 3D 场景,而是要为 AI 搭建一个能去物理世界行动的底座,收购 Cynic 正是为此补上了机器人这块拼图。

第二,机器人的死穴是缺数据,光靠看视频模型学不通,因为物理世界需要绝对的一致性;真正的解法是用高保真的数字仿真来跑反事实推理,像 Waymo 那样用海量虚拟试错来替代既慢又贵的现实测试。第三,他们特别务实,不被「人形机器人进万家」的泡沫带着走,而是盯着仓库、电子组装这些半结构化环境,先帮客户立刻把脏活累活自动化掉。

第四,也是最让人清醒的一点:当今 AI 最缺的是「适度乐观」,技术的进步比想象中快,但要在耗能和能效上真的追上只有 30 瓦的人脑并在现实中干活,我们还得耐心等上很久。如果你在做接近部署的机器人项目,他们现在就敞开大门等你打电话。

全部金句 6 条

下一个前沿领域是教会 AI 理解物理世界并在其中行动。
The next frontier is teaching AI to understand and act within the physical world.
—— 嘉宾 · [01:12]

仿真扮演了一个非常重要的角色,这是现实世界的数据所没有的,那就是反事实推理,就是你在推演那些尚未发生或不可能发生的事件,或者你在现实世界中没有足够的数据让它发生。
There’s a very important role simulation plays that real world data doesn’t play, which is counterfactual reasoning, is that you play out events that hasn’t happened or cannot happen, or you don’t have enough data to make it happen in real world.
—— Fei-Fei Li · [20:06]

事实上,Waymo 比重视现实世界数据更重视仿真。
And actually, Waymo is more simulation-heavy than just real-world data-heavy.
—— Fei-Fei Li · [21:11]

这种非结构化环境和通用化身体实际上是最难解决的问题。
This unstructured environment and a generalized body is actually the hardest problem to solve.
—— Fei-Fei Li · [32:03]

Martin,当今 AI 中最难的事情是拥有正确的适度乐观。
Martin, the hardest thing in today’s AI is to have the right measured optimism.
—— Fei-Fei Li · [34:34]

所以我们会整合,但我们不急于像混合沙拉碗一样混合团队。
So we will be integrating, but we’re not rushing to blend the team as like a full salad bowl.
—— Fei-Fei Li · [38:02]

接着看

顺着「创业与行业」挖下去