OpenAI 工业算力负责人:把电子变成 token 的巨兽工厂
关联
把整个行业一年的算力支出算在一起,是 7000 亿美元——其中 OpenAI 一家今年就要花约 500 亿。说这话的人是 Sachin,OpenAI 的「工业算力负责人」:他曾是斯坦福教授、多次创业者、Intel 的 CTO,现在领导着许多人所称的人类历史上最大规模的基础设施建设。这一集,他第一次系统讲清了 AI 热潮背后的物理现实。
数据中心是「把电子变成 token 的工厂」
Sachin 给出了最好理解的心智模型:AI 数据中心就是巨大的工厂,把电力(电子)变成 token。它们像多个橄榄球场那么大,因为芯片运行时温度极高,必须用液体冷却——空气冷已经压不住了,而且液冷要同时做在芯片级和数据中心级,连变压器和线缆都需要冷却 。
液冷技术本身不新,新的是首次部署到这种规模,创新集中在可靠、便宜、可扩展;还有新型液体和吸热材料,因为冷得越好,芯片就能跑得越热——而「芯片越热,内存带宽和 flops 越多」,冷却能力直接等于智能产出能力 。
电力:先做电网的好公民,再谈自发自用
OpenAI 的硬性承诺: wherever 建数据中心,绝不从电网「夺走」存量电力,而是出资新建发电设施(燃气、太阳能或水电)和输电线路、变压器、变电站——「没有这些数据中心,这些基础设施本来不会得到资助」,附带好处是全美乃至全球电网被快速升级 。电网容量触顶的地方,他们开始做「表后发电」:现场自建发电与配电,让数据中心电力自给自足,目前主要靠燃气轮机,因为它是能量密度最高、最可运输且在美国供应最广的形式 。
核能?「来得越快越好」——它是人类能生产的最密集也最清洁的能源,将成为数据中心大规模可扩展能源的重要来源 。
需求永远跑在供给前面:他们怕的不是建多了
关于最常被问的「过度建设」风险,Sachin 的回答很直接:OpenAI 算力翻三倍、收入也翻三倍,「今天的需求远远超过算力供给,任何能上线的东西我们立刻消耗掉」——至少对 OpenAI 来说不存在闲置算力 。
真正的担忧在反方向:物理世界太慢。「任何时候我们觉得自己算力够了、可以放慢,结果总是负面地惊讶我们——糟了,不该放慢的。
」供应链、工厂、产能都跟不上他们想要的规模 。还有一个加速因素:AI 现在自己做 AI 研究,以前实验数量受限于人类研究员人数,现在实验数量爆炸,研究所需算力也跟着爆炸 。
瓶颈无处不在:许可审批、燃气轮机和变压器(这两个行业过去十年几乎没扩产能,突然遭遇需求冲击,扩产要数年)、以及电工水管工等技术工人短缺——「都是高薪工作,所有云厂商和实验室都抢着雇」。
自研芯片 Jalapeno:知道工作负载,就能走捷径
OpenAI 已全栈进入芯片业务。Jalapeno 的战略逻辑:OpenAI 确切知道自己要运行什么模型,所以能和硬件共同设计,让芯片在服务这些模型上超级高效。核心优化指标只有一个——每瓦特 token 数,因为当今世界受限于电力,同样电量产出更多 token 对所有人都好 。
从设计到流片只用了九个月——Sachin 称这是他职业生涯见过最快的,原因有四:团队里很多人在 Google 设计过 TPU;与在 ASIC 交付上有强记录的 Broadcom 深度合作;独有优势是知道未来模型长什么样,能省掉大量芯片设计决策;最后,AI 本身越来越多地参与设计和优化芯片——那原本是最耗时的环节,因为受限于人力处理数据和跑实验的速度 。「AI 正在自己造芯片了。
」「我认为递归的世界不远了——AI 将设计它训练和运行下一代 AI 所需的系统,包括芯片。」
配套地,他们还发布了 MRC 网络协议:把数据包同时喷洒到多条路径上,像城市里任意两点有很多条路,哪条先到走哪条——这样任何一条链路失效都不致命,让十万卡集群的训练不必操心网络故障 。
Stargate、组合策略与「智能成为供应品」
Stargate 如今是 OpenAI 算力策略的总括术语:与 Oracle 紧密合作(Abilene 数据中心已上线运行,用于训练最近两个模型)、与软银能源共同设计建筑外壳、未来可能自己设计甚至自建数据中心 。算力来源始终是组合式的:Microsoft、AWS、Google 等超大规模云厂商,加上 Corby 这类近云和芯片伙伴直供——「在我们需要的规模上,必须动用所有算力来源」。融资模式上,OpenAI 始终是承购方/租户而非业主,融资外包给合作伙伴 。
【背景】原文转写为「Corby」(“a near cloud”),结合上下文指 OpenAI 宣布合作过的近云算力供应商(很可能是 CoreWeave 的转写误差),正文按原文写法保留。
新业务「保证容量」则暴露了他们的自我定位:在算力短缺的世界里,token 永远是稀缺品,OpenAI 向企业保证一定美元价值的智能 token 供应——「智能正在成为每个数字化企业的供应单元」,锁定关键供应是良好的业务习惯 。
本集带走
- 数据中心 = 把电子变成 token 的工厂:橄榄球场大小、全液冷(芯片级+设施级,连变压器都要冷却),冷得越好产出智能越多。
- OpenAI 不抢电网存量电:每建一个数据中心就出资新建发电+输电设施,附带效果是电网被快速升级;电网触顶处转向表后自发电,核能被寄予厚望。
- 担心的方向和大众相反:需求远超供给、上线即耗尽;真正的风险是物理供应链(燃气轮机、变压器、电工)跟不上,不是建多了闲置。
- 自研芯片的护城河是「知道负载」:Jalapeno 九个月流片,靠的是知道自家模型长什么样从而砍掉大量设计决策,核心指标是每瓦特 token 数;AI 已参与芯片设计,「递归」不远。
- Stargate = 算力策略总括:多源组合(各大云 + 近云 + 芯片伙伴直供),OpenAI 做租户和承购方,融资外包给伙伴。
- 智能正在变成供应品:「保证容量」业务让企业像锁定电力一样锁定 token 供应。
【背景】主持人为 Matt Turk(The Mad Podcast);本集录制于巴黎一个行业会议间隙。转写稿中 Jalapeno、MRC 等名称来自语音识别,可能与官方拼写有出入。
今天的算力需求远远超过算力供给。所以我们能把任何东西上线,都会立即被消耗掉。
Demand far outstrips compute supply today. So anything we can bring online, we consume immediately.
—— Sachin Katti · [00:07]
我们确实相信,递归的世界离我们并不遥远——AI 将设计它自己所需的系统,来训练和运行下一代 AI,包括这个。
We do believe that the world of recursion is not that far, where AI will design the systems it needs to train and run the next generation of AI, including this.
—— Sachin Katti · [00:21]
所以我认为把数据中心可视化最好的方式,就是巨大的工厂,把电子变成 token。
So I think the best way to visualize data centers is giant factories that are turning electrons into tokens.
—— Sachin Katti · [05:52]
所以芯片越热,你获得的内存带宽就越多,你获得的 flops 就越多。所以有很强的回报。如果你能冷却得好,那也意味着你能产出更多智能。
So the hotter the chip, the more memory bandwidth you get, the more flops you get. And so there’s a strong payoff. If you can cool well, that also means you can produce more intelligence.
—— Sachin Katti · [07:59]
所以无论我们在哪里建数据中心,我们都会做出硬性承诺,即我们不会从电网夺走电力。事实上,我们是在投资电网以产生新的电力,这样我们才能把电力用于数据中心。
So whenever we build a data center anywhere, we make it a hard commitment that we are not taking power away from the grid. In fact, we are investing in the grid to generate new power so that we can consume it for data centers.
—— Sachin Katti · [08:44]
它来得越快越好。我认为它是我们所有人都能生产和消费的最密集的能源形式。而且它还是清洁的。
It can’t come soon enough. I think it is the densest form of energy we can all produce and consume. And it’s also clean.
—— Sachin Katti · [11:20]
我们把算力翻了三倍,收入也翻了三倍。
We tripled compute and we tripled revenue.
—— Sachin Katti · [15:53]
现在,AI 本身可以做 AI 研究了。我们能做的实验数量爆炸式增长。因此,研究所需的算力也爆炸式增长。
Now, AI itself can do AI research. The number of experiments we can run explodes. And therefore, the amount of compute you need for research also explodes.
—— Sachin Katti · [16:50]
任何时候我们觉得自己已经有足够的算力,可以慢下来了,总是会给我们带来负面的惊喜,比如,糟了,我们不该放慢速度的,对吧?
Any time we have thought we have enough compute, we can slow down. always negatively surprise us, like, oh, shit, we should not have slowed down, right?
—— Sachin Katti · [17:24]
我们在建造世界上最大的计算机。
We are building the largest computer in the world.
—— Sachin Katti · [27:41]
这里的独特优势在于,我们知道未来的模型可能长什么样,因此能够走捷径,省去很多你在芯片侧需要做的决策、设计决策。
There’s a unique advantage here of us knowing what the future models might look like and therefore being able to short circuit a lot of the decisions you need to make, design decisions you need to make on the chip side.
—— Sachin Katti · [35:26]
所以与其只挑一条路线,我们会把流量发送到所有这些路线上。哪条先成功,就走哪条。
So instead of picking just one route, We will send traffic across all of them. And whichever one succeeds, you take that.
—— Sachin Katti · [38:24]
顺着「创业与行业」挖下去
- AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱同公司:OpenAI · 同概念:推理 (inference)、数据中心 (data center)、GPU
- Ed Zitron:生成式 AI 是一场万亿级骗局同公司:OpenAI · 同概念:推理 (inference)、GPU
- 每块 GPU 多付 10 万美元插队:Speechify 创始人的算力账与战略悔棋同公司:OpenAI · 同概念:推理 (inference)、GPU
换个口味
- 超级智能为什么危险:Ryan Greenblatt 的推演与解法同嘉宾:Matt Turk · 同公司:OpenAI · 同概念:推理 (inference)
- 当 AI 决定买什么软件:G2 的「信任层」生意同公司:OpenAI · 同概念:推理 (inference)
- 不只做推理:Modal 如何跨界多节点训练与智能体云同公司:OpenAI · 同概念:推理 (inference)
