让机器人在真实世界干活:Physical Intelligence 的通用机器人之路
关联
人物 Chelsea Finn
训练一个通用机器人模型,最难的不是让它学会做某个特定任务,而是让它在真实物理世界里连续干几个小时的活还不犯错——在真实世界里,错误代价高昂,机器人必须能够「自己让自己变得更可靠」,而不是像现有的聊天机器人那样依赖人类盯着纠错。
过去机器学习在商业上的成功(从产品推荐到 ChatGPT),大多是把 AI 当顾问:模型给建议,人来拍板。错了也没关系,人能兜底。
但物理 AI 和机器人完全不同——它必须自己直接做出影响物理世界的决定,因此它必须比以往部署的机器学习系统少犯错得多。一年前 Waymo(自动驾驶公司)做到了每周超过二十五万次自主行程,这给整个物理 AI 领域带来了巨大的希望:机器学习系统确实能在物理世界里以可信赖的方式长期自主运行。
长期自主性:怎么让机器人「上可靠」
要让机器人有用,就得让它长时间自主运行,比如让一台机器人连续给你做咖啡。做咖啡听起来简单,但操作无底把手(用来装咖啡粉的部件)需要极其精准的受力控制,得平稳端着装满液体的杯子不洒,还必须对「时机」有精确感知。我们不仅要做这任务,还要把可靠度做到 90% 以上。
传统做法是收集数据、训练模型、评估,发现问题再加数据微调。但靠人工这样轮轴转,极难达到极高的可靠性。
真正的解法是:让 AI 系统自己去自动迭代和寻找弱点。这本质上是一种强化学习(让模型通过不断试错、从失败中自我改进的方法)。但语言模型的强化学习动辄跑数百万次乃至上千万次,因为每次尝试只是在数据中心跑纯计算;如果把这套搬进物理世界,哪怕只跑 100 万次一分钟的机器人任务,也得花 700 个机器人日,在现实里完全行不通。
为了把物理世界里的试错成本降下来,我们用了两招:
- 尽早干预,避免死胡同轨迹。比如机器人折纸箱时一把抓了两个粘在一起的箱子,如果让它继续硬折,对学习毫无帮助。
与其浪费时间,不如直接让人介入,远程操控机器人向它演示如何脱离困境,或干脆尽早结束这一回合,保证收集到的都是有用的经验数据。 2. 训练通用的价值函数(评估好坏的模型)来分摊成本。
与其针对每个单独任务去大量试错算平均值,不如在大量机器人视频上训练一个「能预测还要多久才能成功」的通用评估器。它能判断机器人是在取得进展,还是在越搞越砸,从而大幅减少学习所需的尝试次数。
靠这套方法,我们在制作拿铁的任务上实现了连续 13 小时的可靠自主运行;在隔壁 Dandelion 巧克力工厂里完成了纸箱折叠贴标,在完全陌生的家庭环境里折叠从没见过的衣服。相比纯监督微调,仅强化学习这一步就把吞吐量提升了约 2 倍。
要完成长任务,机器人需要「记忆」
大多数最先进的机器人基础模型是没有记忆的,只能根据当前的摄像头画面做即时反应。做单一重复动作没问题,但如果要执行连续多步的长任务,就必须有记忆来追踪进度。
为什么过去不给模型加记忆?因为太贵了。机器人一般以 50 赫兹(每秒 50 次)的频率采集 4 路摄像头画面,如果以 256 token(模型处理信息的基本单位)一张图来算,光 10 秒钟的视频记忆就是 50 万个 token,实时塞给模型根本算不过来;就算狠心降频到一秒一帧,仍是 1 万个 token,成本依然高得吓人。
我们的解法是多时间尺度记忆:
- 短期记忆:保留约 10 秒的视频记忆,但用远比硬塞给模型高效得多的方式来计算和压缩。
- 长期记忆:对于跨分钟、跨小时的历史,不再死磕视频,而是把发生过的事情在文本空间里总结成高度压缩的文字摘要,再喂给模型。
有了这种记忆机制,机器人就能去完成诸如清理厨房这种长达 10 到 15 分钟的多步骤非重复任务,比如先用海绵擦台面、再用纸巾擦干、扔掉纸巾、把芥末放回冰箱、再把盘子放进橱柜。
迈向单一通用大模型
仅仅三年前的 2023 年,做机器人研究的惯例还是为每个单独项目从零收集定制数据集来训练。这就像 AI 发展早期,每个任务都得从零手搓。我们想做的是从预训练微调,跨越到像 GPT 那样开箱即用、甚至具备组合泛化能力的通用模型。
所谓组合泛化,就是像 2021 年的 DALI 结果能把牛油果和椅子这两个概念拼在一起生成同时展示这两个概念的东西一样,说明模型对概念有了真正的理解。对应到机器人,这意味着它不需要把所有情况的组合都见一遍,就能举一反三。
我们用能拿到的所有数据(包括各种质量的机器人遥操作演示、机器人自己尝试的回放数据、人类视频和网络数据),去训练一个具有足够容量的大模型。要把如此异构(成分混杂且差异大)的数据喂进去,关键解锁点是提供极其丰富的上下文提示:除了记忆和任务指令,我们还向模型输入当下最该做的子任务指令、数据质量与长度等元数据,以及「几秒后该达到这种状态」的子目标图像作为提示。
这个单一 PIO7 模型,直接开箱就能做相当多的事情。更关键的是,如果我们测量它和微调过的 PIO6 模型的吞吐量和成功率,这个没经过针对性微调的单一预训练模型,已经追上甚至超过了那些专门为特定下游任务进行强化学习后训练的微调专家模型。
在组合泛化测试中,它表现出了惊人的举一反三能力。比如它能打开空气炸锅、放进红薯再关上——而训练集里几乎没有任何空气炸锅的数据;它还能在一个我们完全没采集过任何折衣服数据的大型工业机器人平台上,靠脑补子目标图像,第一次尝试就把衣服折好,性能甚至逼近人类远程操作。消融实验也证明了:越是多样化的数据,对泛化越关键;而有了元数据提示,模型甚至能从以前被认为是拖后腿的低质量数据里榨取出更多价值。
【背景】讲者提到机器人领域现在已经进入「GBT 和 DALI 时代」,结合前文提到的 2021 年组合泛化里程碑及语境,这里的 GBT/DALI 分别指代语言大模型 GPT 和图像生成模型 DALL·E。
本集带走
- 物理 AI 容错率极低:要在真实世界落地,机器人不能像聊天机器人那样依赖人纠错,必须做到极高的可靠性才能实现长时间自主。
- 应对死胡同轨迹:发现机器人陷入无效操作时,尽早让人介入带它脱困或直接终止回合,别让它在物理世界里白白浪费时间和硬件损耗。
- 价值函数降本:与其对单一任务暴力试错,不如训练一个通用的「好与坏」价值评估器,极大压缩从经验中学习所需的尝试次数。
- 给大模型加记忆的省钱法:短期视频记忆靠高效压缩计算,跨度长达几小时的历史则先提炼成文字摘要,用多时间尺度组合绕过算力瓶颈。
- 通用模型的上下文解锁法:训练具身大模型吃下高度混杂的数据时,子任务指令、元数据和子目标图像等详尽提示是榨取数据价值的关键。
- 用小成本冷启动转行机器人:买台便宜机器人,在卧室微调开源模型(如 π0),把调出来的成果作为简历去敲开公司的大门。
最近发生的一件真正令人兴奋的事情是,一年前 Waymo 达到了每周二十五万次自主行程,这表明确实有可能开发一种基于机器学习的系统,可以直接以值得信赖和自主的方式在物理世界中运行。
Now, one really exciting thing to kind of highlight that has happened recently is a year ago Waymo passed the quarter of a million weekly autonomous rides, suggesting that it is really possible to develop a machine learning based system that can operate in a trustworthy and autonomous way directly in the physical world.
—— Chelsea Finn · [05:10]
当我们第一次看到机器人这样做时,我们惊呆了,因为这个任务没有任何训练数据。
The first time we saw the robot do this, we were like floored because there was no training data for this task.
—— Chelsea Finn · [33:32]
而有了元数据提示,当你添加低质量数据时性能实际上增加了,这表明当你包含这种提示时,它实际上能够从即使是低质量数据中获得更多收益。
Whereas with the metadata prompting, the performance actually increases when you add that low quality data, suggesting that it’s actually able to get a lot more juice out of even low quality data when you include this kind of prompting.
—— Chelsea Finn · [36:35]
顺着「智能体」挖下去
- Jensen Huang 谈 NVIDIA 创业史、物理 AI 与创始人模式同公司:Waymo · 同概念:物理 AI (physical AI)、ChatGPT、强化学习 (reinforcement learning)
- Waymo 谈物理 AI 的七条实战教训同公司:Waymo · 同概念:物理 AI (physical AI)
- Chip Huyen:别追 AI 新闻了,真正提升 AI 产品的是这些事同概念:强化学习 (reinforcement learning)、ChatGPT
换个口味
- 估值150亿的隐形AI公司:我们最好的工作是独自安静地完成同公司:Waymo · 同概念:ChatGPT、物理 AI (physical AI)
- Brian Balfour:ChatGPT 即将打开新分发渠道,你怎么下注同概念:ChatGPT、记忆 (memory)
- AI 教母李飞飞:从 ImageNet 到空间智能同公司:Waymo · 同概念:ChatGPT、强化学习 (reinforcement learning)
