物理世界最大的 AI 部署:Samsara 如何用 AI 编排数百万车辆
关联
过去 125 年里建起来的电网容量,接下来五年要翻三倍,而且其中九成的需求增量来自数据中心——说这话的人是 Sanjit Biswas,他的公司 Samsara(一家年营收超 20 亿美元、年增速约 30% 的上市公司)每天用数百万辆车跑遍美国 99% 的道路,可能是目前现实世界中规模最大的 AI 部署。
这一集 Matt Turk 的播客对谈里,他围绕「物理 AI」(把 AI 应用到交通、建筑、工厂等物理世界)讲了这么几块:为什么这波 AI 潮流先从数字世界开始,物理世界的难点和机会在哪;Samsara 从传感器到云端再到智能体的完整产品架构是怎么搭起来的;他们怎么处理 AI 监控与司机隐私的张力;以及他对自动驾驶卡车、人形机器人和技术工人短缺的判断。你可以带着这张地图往下读。
聊完那组翻三倍的数字,先要回答的问题是:既然 AI 在数字世界已经那么成功,为什么迟迟没有铺到物理世界?Sanjit 的判断是,这完全合理:数字世界有几十年的数据沉淀,训练 AI 需要的数万亿个 token(语言模型处理文本的基本单位)唾手可得;物理世界则既混乱又涉及硬件,设备得在恶劣环境里扛得住、通过不靠谱的网络传数据、还要让数百万一线工人真正用起来 。门槛高,但回报也大——这些行业占了全球 GDP 的 40% 到 50% 。
更关键的是,物理世界错了代价极高。建筑工地里到处是多吨位的土方设备,能见度又低,操作员和现场人员都在承担真实风险 。
所以 Sanjit 他们的出发点是:风险本身不是拦路虎,而是机会——能不能用数据让它不那么危险?他给了一组直观的数字:光去年,他们的系统帮助避免了约 38 万起车祸 ,手段包括检测司机是否疲劳、是否在看手机,甚至提醒那大约 10% 不系安全带的美国司机系上安全带 。
说完了「为什么做」,接下来是他具体怎么做。主持人把 Samsara 的架构拆成了三层:传感器是耳朵和眼睛(硬件层),AI 是大脑,智能体(agentic layer,能自主规划并执行任务的 AI 层)是手臂。Sanjit 基本认同,但补了一句:每一层都有「连接组织」 。
硬件层里,他在镜头前举了两个例子。一个是资产标签(asset tag),贴在建筑设备上,里面有加速度计和工业级蓝牙,用电池能撑三年,「你用卡车从它上面碾过去,它会继续运行」 。
另一个是刚发布的一次性追踪贴纸,像贴纸一样薄,能持续约 45 天,够走完一趟单向运输,里面不用锂电池,用完即弃 。这些标签怎么联网?他的答案是「社区效应」:数百万辆跑着 Samsara 系统的车和数千万部手机,会互相中继信号——就像 Apple AirTag 的消费端逻辑,但做成了工业级 。
数据进来后要清洗、组织,才能喂给 AI;否则「给 AI 提供非常嘈杂的数据,信噪比就低了」 。这里他用了一个很生动的例子说明智能体层怎么「动手」:如果纽约下雨了,系统可以自动要求当地整个车队增加跟车距离,天晴再调回来;这种事以前需要人工盯几千辆车的设置,根本不现实,现在 AI 能大规模、一致地完成 。
硬件和 AI 之外,另一个绕不开的技术选择是:推理(运行 AI 模型得出结果)该放在边缘(设备端)还是云端?Samsara 的做法是,实时、低延迟的检测放在边缘:他们从云端把模型权重下发到设备,以每秒多帧的速度运行 。原因很实际:客户常在荒无人烟的地方作业,网络信号差;而且只有事情刚发生就立刻反馈,司机才更有可能改变行为 。
【背景】Sanjit 在 42:21 和 44:36 提到「Fable 5」「GPT-SOL」「Gemma 4」等模型名,均属语音识别对 Llama 5、GPT-o1、Gemma 2 等模型的误写。按规则,正文中不专门标注纠正,金句英文侧照转写稿原样保留。此处提示一次,帮读者对齐。
生成式 AI 的到来,让原本必须人工的环节被大规模替代。Sanjit 举例:司机猛踩刹车,想当然的判断是他分心了;但如果看视频片段,可能发现他其实是在躲避一头鹿——这就从批评变成了表扬 。
这类原本要靠海外低成本人工审核员逐条看的工作,现在用视频大模型(VLM)在云端就能更高吞吐地完成 。更进一步,他们还能用生成式 AI 生成教练视频,化身可以是那家公司真实的安全副总裁,用来给司机做每周辅导——因为「大多数客户受限于能进行的人际互动数量」 。
工具变了,人怎么办?这正是下一个话题。
主持人追问:装个时刻盯着司机的摄像头,不就是「老大哥在看着你」吗?Sanjit 的回答很反直觉:行车记录仪最主要、最大的用途,其实是帮司机洗脱嫌疑。
比如家得宝这种知名品牌,常被碰瓷说卡车撞了人;有了高清视频证据,谁对谁错一目了然。他强调,司机 90% 的时间都在好好开车却没人看见,这套系统反而是在放大正向行为 。关键在于透明:摄像头不是隐藏式的,要一开始就跟一线讲清楚它做什么、不做什么、数据怎么用——这是赢得整个组织信任的方式 。
最后,把视角拉远。Sanjit 对自动驾驶卡车的判断比 Robotaxi 谨慎得多:Robotaxi 区域化、场景相似,会更快普及;但路上跑的大多数商用车其实是 HVAC 技术员、水管工、建筑队这些「极其混乱的长尾」 ,水泥搅拌车、垃圾车这些特种设备的高度定制化,注定了自动驾驶向这些边缘渗透的扩散曲线会更长,「可能需要 10 年、20 年」 。
而回到那组翻三倍的电网数字:这背后是一个更紧迫的现实——数据中心热潮直接卡在了技术工人短缺上。「现在就是没有足够多的电工」 ,连 Meta 都在做项目重新培训电工。所以当人们开玩笑说「律师该去当水管工」时,Sanjit 提醒:这活儿又脏又难得多;但不可否认,这些技工行业需求巨大,而且随着 AI 帮他们减轻准备材料和判断的脑力负担,他们的工作本身也在变得更现代化 。
本集带走
最后收个尾,这一集值得带走的是三层认知。第一,物理 AI 是一片跟数字 AI 完全不同的战场:这里没有现成的海量文本可训练,设备要在恶劣环境里扛住,错误代价极高,但正因为苦,它锁住了全球 GDP 四到五成的价值,谁把数据采上来、洗干净、喂给模型,谁就拿到了别人抢不走的护城河——毕竟建筑工地上发生了什么,你没法从网上爬到。
第二,真正的杠杆不是单点自动化,而是硬件、云端和智能体拼成闭环:从能被卡车碾过的资产标签,到边缘实时提醒司机,再到云端自动调全城的跟车距离,最后由智能体把保修索赔这种原本一两个小时的人工活压到一分钟以内。第三,在物理世界部署 AI,最难的不是算法,而是信任:司机接受时刻盯着自己的摄像头,不是因为监控,而是因为这套系统 90% 的时间在帮他们证明「我做对了」,把正向行为放大,用透明换一线的买单。
我们相信我们在去年帮助防止了约 38 万起车祸、道路事故。
we believe we helped prevent about 380,000 car crashes, road accidents in the last year.
—— Sanjit Biswas · [09:15]
主要的用例实际上是开脱罪责。
the majority use case is actually exoneration.
—— Sanjit Biswas · [46:47]
司机们喜欢这样,因为我不得不说 90% 的时间他们做得很好,却没有人看到。
Drivers love that because I have to say 90% of the time they’re doing a great job and nobody’s seeing it.
—— Sanjit Biswas · [47:37]
他们的理赔减少了大约 65%,比如车险理赔。
They saw like a 65 percent reduction in their claims, like auto claims.
—— Sanjit Biswas · [49:58]
顺着「智能体」挖下去
- Jensen Huang 谈 NVIDIA 创业史、物理 AI 与创始人模式同公司:Tesla、Waymo · 同概念:智能体 (agents)、物理 AI (physical AI)
- 「最纯 AGI 押注」爆仓始末与 AI 时代财富大洗牌同公司:Meta · 同概念:智能体 (agents)
- Waymo 谈物理 AI 的七条实战教训同公司:Waymo · 同概念:物理 AI (physical AI)
换个口味
- Rackspace 首席 AI 官 Chetan Gupta:企业该停止纠结模型、开始思考架构同概念:物理 AI (physical AI)、生成式 AI (generative AI)、护栏 (guardrails)
- Netflix 产品负责人谈 AI 时代:每个人都能做一切,但卓越的专长不会消失同概念:护栏 (guardrails)、智能体 (agents)
- Gamma 联创复盘:押注空白页,赌出一亿用户同概念:护栏 (guardrails)、生成式 AI (generative AI)
