Jeff Dean 谈 AI 原生时代的创业经:找零个正确的甜点
关联
把一种编程语言写的一整套软件全部换成另一种语言,大多数顶尖工程师要干几个月——但今天的 AI 模型可以同时派出去几十个智能体,跑上几天甚至几周,自己改、自己测、自己修,最后把翻译好的新版本交到你手上。说这话的人是 Jeff Dean,Google 的大神级工程师,MapReduce、Bigtable、TensorFlow 和 TPU 全是他主导造的。
在这一集访谈里,他讲了三件事:为什么我们这代人正站在专用推理硬件爆发的前夜;为什么「上下文工程」是新手中最容易上手的杠杆;以及在一个通用模型什么都能干一点的时代,两三个人的小团队究竟该挑什么样的问题去赢。最后他还聊了聊怎么通过疯狂的思想实验构建「品味」,以及他对未来创业者的终极建议:挑一个最重要的、别人做不了的问题,然后用余生去解决它。
说完了开场钩子,接下来是 Jeff Dean 的来头和这一集的完整导览。Jeff 是 Google 的传奇工程师,主持人开场就列了一长串他参与造的东西:MapReduce、Bigtable、TensorFlow、TPU、Gemini。
这一集的对话主要分成几大块:首先是「算盘数学」——也就是快速估算——如何帮他预判了 TPU 的诞生,以及为什么 2026 年该做一次新的算盘数学。然后聊到他在 2025 年那个著名预测「AI 相当于初级工程师」的回看,以及他对 2027 年的新预测。
接着是上下文工程、多智能体系统、专用推理硬件这些当下最热的工程话题。最后是给创业者的实操建议:去哪里找那些大厂不愿意做、但又能做出巨大价值的小众问题。
先把时间轴拉回到 Jeff Dean 做出那些著名预测的时刻。2025 年 5 月,他在 AI Ascent 大会上说,在处理基于智能体的、长时间运行的编程任务方面,模型已经达到了「初级工程师」的水平。
回看这个预测,Jeff 承认他低估了一件事:做越来越复杂任务的能力,增长速度比他预想的还要快。更重要的是,在编码之外,这些基于智能体的系统正在其他领域大放异彩。主持人追问他 2027 年的新预测,Jeff 给出的答案听起来有点学术但极其大胆:你会看到 ML 系统本身被高度自动化——模型自己把大问题拆成子问题,在紧凑的自动化实验循环里不断试错,把结果拼起来,最后产出一个更好的自己。
那么,这种高度自动化的「自举」循环,到底什么时候能真正跑起来?这正是下一个话题的核心。
Jeff 指出,科学方法的基础其实就是一个「提出实验、运行实验、评估实验」的循环。现在的关键突破在于,我们能把这个循环的延迟压到极低,让它自动跑成千上万次。
他举了量子化学的例子:以前理解一个分子的属性,要跑一整晚昂贵的密度泛函理论模拟器;他的同事们用这些模拟器的输出去训练一个神经网络近似模型,结果造出了一个快了 300,000 倍、几乎一样准确的验证器。这意味着以前要花六个月凑计算资源才能做完的筛选,现在你可以吃完一顿午饭就做完。把这种超高速验证器接入多智能体的编排框架,就是他眼中最激动人心的未来。
但要把这个自动化循环真正跑起来,第一步得先把硬件搞定。这就要回到 Jeff Dean 最拿手的绝活:「算盘数学」(back of the envelope calculation),也就是在脑子里或餐巾纸上快速估算一个系统的瓶颈和成本。
主持人讲了个著名故事:2013 年 Google 的语音识别刚有起色,Jeff 一算发现,如果每个用户每天只用三分钟,现有 CPU 根本扛不住,得把服务器机群翻倍。他的解法不是买更多 CPU,而是造了一种极度专用的芯片——只做低精度线性代数,其他什么都干不了,但这正是机器学习的核心。
这块芯片就是 TPU 的起源,几年后,它的能效比当时的 CPU 和 GPU 高出 30 到 80 倍,延迟还低了 20 到 30 倍。Jeff 现在做的算盘数学换新内容了:在 AI 时代,真正重要的数字是内存和乘法单元之间的带宽、芯片间的互联带宽,以及一次乘法运算到底要花多少能量。
他特别强调了一个常被忽视的鸿沟:做一次计算只要一皮焦,但把数据搬进处理器,能耗是计算的 1000 倍。很多人以为模型训练必须做大批次是「模型问题」,其实这是个彻头彻尾的能量搬运问题。
既然数据搬运这么贵,那能不能把硬件做得更极端、更专门化?这引出了 Jeff 眼中当前最被低估的机会:专用推理硬件。
他算了一笔账:训练对延迟没那么敏感,但推理(也就是模型给出回答的过程)对延迟极其敏感。如果你想追求极低的延迟,大批次处理就不管用了,因为你要等凑齐一大批请求才能一起算。
Jeff 认为现在还有巨大的空间去为推理专门定制硬件,甚至极端到只支持某一种你确信有用的精度,别的统统砍掉。他抛出了一个极具冲击力的反问:想象一下,如果推理的延迟能比现在好 50 倍,你能做出什么新产品?
然而,光有更快的硬件还不够,怎么用好现有的模型,其实是个更大的杠杆。这正是「上下文工程」登场的地方。
Jeff 指出,很多人误以为 AI 进步仅仅是模型变大。但实际上,真正的系统是由模型、工具、检索和记忆共同组成的。
模型在训练时见过的数据,是被搅成一锅千亿参数的「汤」,模模糊糊;而你直接喂给它的上下文,对它来说是极其清晰的。所以,怎么编排工具调用、怎么检索信息,才是决定成败的关键。
他特别点出,这件事不需要你有多少 GPU,只要有 Gemini 的 API,谁都能做。他自己就是这么干的:他和搭档 Sanjay 写了一个「技能」,教模型像他们一样去做底层代码的性能优化——先跑微基准测试(一种测量小段代码耗时的工具),改代码,再测,再改。模型只要拿到这种包含人类专家经验的「技能」,就能自己闭环迭代。
闭环说起来容易,但很多人发现,智能体跑到第 30、40 步就「脱轨」了。这是为什么?
Jeff 的诊断很直接:因为模型走到了它训练数据没覆盖的「分布外」地带,性能会突然暴跌。怎么破?
他支了两招:第一,给模型清晰的「技能」和护栏,把它死死按在它擅长的那条光明大道上;第二,也是更重要的,用多智能体系统去「搜索」解法。派几个智能体分头试不同路径,再让另一个模型当裁判,只留有用的,扔掉脱轨的。
这种在推理时多算几条路、并行搜索的技巧,是他眼中让长流程智能体保持靠谱的最强武器。主持人好奇他内部怎么落地这套玩法。Jeff 说,在 Google 内部,他们给智能体装满了各种技能,从抓取专有日志到代码审查,让基础模型即便没见过这些内部系统,也能靠「技能说明书」熟练操作。
工具变了,人的活法也变了。如果智能体这么能干,人还能干什么?
这正是下一个话题。Jeff 和搭档还把这套优化经验写成了一份叫《Performance Hints》的 30 页文档。
主持人打趣说,只要把这文档喂给模型,人人都能像 Jeff Dean 一样优化代码。但话锋一转:如果未来所有代码都是成百上千个智能体写的,什么才是人的稀缺能力?
Jeff 的答案出人意料地简单——是「品味」,也就是挑选「做什么」的高层智慧。他打了个比方:研究员手里有再多工具,最大的战争永远是「该花时间解决哪个问题」。
干得漂亮但选了个无聊的问题,远不如选对问题然后解出它。他给了三个练「品味」的实操方法:第一,多攒经验,留意那些「差点就能拼出来」的开放问题;第二,记下你认为未来一年会火的事,一年后回过头来打分,看看自己的判断准不准;第三,也是最有趣的,多做疯狂的思想实验,去推翻那些大家习以为常的假设。
思想实验听着玄,但 Jeff 是真靠这个造出过改变世界的系统的。他抛了一个极其疯狂的实验:过去 60 年,芯片制造业都在拼命造「绝不犯错」的晶体管;但如果我们换个思路,接受「每天错 20 次」的晶体管,会怎样?
硬件设计会完全颠覆,可能要像人类大脑那样,靠发送多重冗余信号来保证重要信息送达。这听着像天方夜谭,但 TPU 和 MapReduce 都是这么来的。
当年做 TPU,就是在机器学习还没今天这么火的时候,赌了一个极度小众的硬件方向;做 MapReduce,是因为他和同事写够了各种为了容错和并行而臃肿不堪的代码,突然灵光一闪,想起了函数式编程,把容错这些脏活全抽离到底层库,让上层代码干净得只剩业务逻辑。这不仅是技术突破,更是对「理所当然」的叛逆。
那么,两三个人的小团队,到底该拿这些武器去打哪里?这是全场最实操的一段。
Google 这种大厂显然会继续造超通用的 Gemini 模型,但这恰恰是小团队的机会。Jeff 给了一个非常精准的测试尺子:拿当前最强的通用模型去试你想做的事,如果它干得有点起色但还不够好,那千万别做——因为半年后它就会变好,把你碾平。
如果它彻底失败,成功率只有 0% 或 1%,那才是好机会。怎么找这种机会?
Jeff 指了两条路:一是通用模型摸不到的数据,比如帮你整理极私人的信息;二是像 AlphaFold 那样,为某个硬核领域(比如材料科学或芯片设计)训练一个极度精准的小众模型。除了选对问题,怎么管理成百上千个虚拟员工也是一门必修课。
Jeff 说,秘诀就是写清晰到极致的规格说明。有意思的是,现在代码是智能体写了,但「写清楚需求」这件事的重要性反而比以前更高了——因为你面对的不再是会追问我意图的聪明同事,而是一个只会照着字面意思去推断的机器。
他举了个绝佳的例子:为什么现在的模型特别擅长把 Python 代码翻译成 Go?因为整个 Python 程序本身就是一份完美、详尽的「规格说明书」,模型只需照着测、照着改,直到两个版本行为完全一致。
说完了怎么带兵打仗,最后聊聊心态和选人。搞创新的人免不了被拒。
Jeff 讲了个黑色幽默的故事:2014 年他和图灵奖得主 Hinton 写了篇关于「蒸馏」(用大模型教小模型,让小模型又快又便宜)的论文,结果被 NeurIPS 拒了,理由是「不太可能有重大影响」。这篇如今被业界奉为圭臬的论文,正是 Gemini 的 Flash 版本(又快又轻量)能这么强的技术基础。
Jeff 的教训很简单:被拒了就发到网上,继续干,真有影响大家会用。如果把你扔回 1999 年,你会去大厂还是创业?
Jeff 说两条路都好,但唯一的标准是问自己:如果这件事做成了,世界是会真真切切地变好,还是只是「哦,挺酷的」?如果是后者,就别浪费时间。
至于找合伙人,他的标准很有人情味:技能互补、自我意识低,最重要的是——你得喜欢跟他们待在一起,因为你们要一起蹚过无数个难熬的坑。把你的职业生涯当成一条工具腰带,每段经历都是在往里塞新工具,你永远不知道下个问题会需要这四把工具还是那三把。
【背景】主持人开头提到的「Jeff、Sanjay」指的是 Jeff Dean 和他的长期搭档 Sanjay Ghemawat,两人在 Google 一起写过大量基础系统代码。文中提到 Go,是一种 Google 开发的编程语言。
本集带走
最后收个尾,这一集值得带走的是几个核心判断。第一,推理硬件是下一个大 frontier,数据搬运的能耗是计算的 1000 倍,谁能把专用推理芯片做到极致,谁就能解锁 50 倍低延迟带来的全新产品形态。
第二,上下文工程是人人的杠杆,你不需要海量 GPU 去从头训练模型,只要把工具、检索和技能说明书喂给它,一个小团队就能做出大厂通用模型做不到的精准体验。第三,管理智能体的秘诀就是极度清晰的规格说明,你要把模棱两可的需求,翻译成机器不会误解的边界条件。
第四,选对问题是终极品味,别挑通用模型已经能做到 20% 的事,去挑那些它们彻底失败、或者你能独占私域数据的窄门。第五,多做疯狂的思想实验,去质疑那些 60 年来天经地义的假设(比如晶体管绝对不能出错),因为 MapReduce 和 TPU 都是这么叛逆出来的。
最后,Jeff 留下的终极问题:如果这件事做成了,世界是会真切变好,还是只是「挺酷」?把这个问题问到底,你的职业生涯这条工具腰带,自然会挂满最趁手的家伙。
可能有一点是人们还没有完全意识到,拥有基于智能体的系统是多么可能,这些系统不仅可以针对你关心的问题运行一两个小时,而且在某些问题领域,并且在拥有高能力模型作为底层支撑的情况下,你可以让它们运行几天或几周,并完成真正非常复杂的任务。
Probably one thing is people don’t quite realize how possible it is to have agent-based systems that can run not just for an hour or two hours on a problem you care about, but for some problem domains and with highly capable models underlying them, you can get them to run for days or weeks and do really, really complicated tasks.
—— Jeff Dean · [04:55]
所以那个系统在几年后产生了一个芯片,其能效比当时的 CPU 和 GPU 高 30 到 80 倍,而且延迟也低得多,比如延迟降低了 20 到 30 倍。
And so that system produced a chip a couple of years later that was 30 to 80 times more energy efficient than CPUs and GPUs of the day, and also much, much lower latency, like 20 to 30x lower latency.
—— Jeff Dean · [08:12]
我的意思是,如果你真正理解数据,你应该能够非常好地压缩它。
I mean, if you truly understand the data, you should be able to compress it really well.
—— Jeff Dean · [15:54]
所以,你知道,要寻找模型成功率为 0% 或 1% 的东西,而不是 20%。
So, you know, look for something where the model succeeds 0% or 1% of the time, not 20%.
—— Jeff Dean · [28:46]
如果你选对了问题并且成功解决了它,这比你出色地执行一个针对相当无聊问题的研究调查要好得多。
if you pick the problem well and you succeed in solving it, that’s way better than if you delightfully execute a research investigation into a rather boring problem.
—— Jeff Dean · [34:27]
一个有趣的思想实验是,如果你试图使用可能每天有 20 个错误而不是每百万年一个错误的晶体管构建一个系统,会发生什么。
an interesting thought experiment is what would happen if you tried to build a system out of transistors that might have 20 errors per day rather than one every million years.
—— Jeff Dean · [38:29]
所以这现在是一个验证装置,但它不再需要一个晚上,他们制造了一个速度快 300,000 倍并且几乎与运行全尺寸模拟器一样准确的东西。
So this is now a validation device, but instead of it taking a night, they made something that was 300,000 times faster and nearly as accurate as running the full scale simulator.
—— Jeff Dean · [45:17]
顺着「智能体」挖下去
- 当 AI 决定买什么软件:G2 的「信任层」生意同公司:Google · 同概念:Gemini、推理 (inference)
- Tether 做本地 AI:数据中心造太多了同概念:推理 (inference)、智能体 (agents)
- 开源权重不是威胁:Box CEO 聊 AI 的经济账同概念:推理 (inference)、蒸馏 (distillation)
换个口味
- 没有暗GPU:一位基金经理拆解AI泡沫论与棋局同公司:Google · 同概念:Gemini、TPU
- AI 会改变一切,但也「只和互联网一样大」同公司:Google · 同概念:Gemini
- Hugging Face CEO:开源 AI 更安全,下一阶段属于模型路由同概念:推理 (inference)、蒸馏 (distillation)
