推理 (inference)
集里怎么说它
- 《PM的生存法则:AI时代别当瓶颈,去抢活干》(30:10起):本集提到 Oji 的智能房子运行在一个带有 AI 芯片和推理功能的处理器上
- 《Base 10 的 Julian:推理正在从「租用智能」走向「拥有智能」》(00:36起):本集主线:推理正从「我需要跑这个模型」变成「一套运行这些智能体的工具」,推理栈上不断积累模型路由、沙箱等原语。
- 《AI Engineer 大会背后的社区逻辑与创业生存法则》(05:47起):本集提到工程师想了解模型训练时做了什么,因为在推理时可以据此做另一件事,‘training’和’inference’作为对应概念出现
- 《Claude Tag:住在 Slack 里的主动型队友,如何让 65% 的 PR 由 AI 开出》(25:35起):本集在列举将模型原始智能转化为实际价值所需的基础设施时,顺带提到如何处理所有的推理
- 《不只做推理:Modal 如何跨界多节点训练与智能体云》(00:31起):本集说 Modal 最大的用例就是弹性推理,尤其是为 Suno、Runway 等客户在流量波动极大时提供按需自动伸缩算力的推理服务。
- 《OpenAI 工业算力负责人:把电子变成 token 的巨兽工厂》(13:39起):本集说推理如今可能已占算力的大头,且训练与推理界限模糊——合成数据、后训练、测试时计算全是推理。
- 《Hugging Face CEO:开源 AI 更安全,下一阶段属于模型路由》(14:40起):本集说开放权重的来源不重要,但用中国的 API 跑推理是「大得多的问题」——那是在发送数据,对方可以切断或偏向你的访问。
- 《「智能是数据的派生物」:Fireworks 创始人 Lin Kuo 的专用智能宣言》(00:55起):本集称推理市场增长极其疯狂、将成为世界最大市场之一;Fireworks 在模型调优后进一步针对推理部署优化,并追求训练与推理系统间的 0KLD 比特级等价以兑现训练投资。
- 《主导投资 Anthropic 的人:风投的游戏规则已经彻底变了》(20:52起):本集说「仅仅因为推理计算的成本,已经很难说你会成为一家 80%、90% 毛利率的公司了」,推理成本压低了应用公司的利润率结构
- 《Sam Altman 谈 AI 时代的创业法则:被全世界当成白痴是最大优势》(33:09起):本集把它说成:全球对其需求将在未来许多年里每年增长 10 倍,对高质量、低价格智能的需求实际上是无限的。
- 《让 AI 像人一样犯错:Simile 创始人的模拟人类生意》(21:36起):本集提到 Simile 找到了不同的建模方式,使用相同的奖励模型和哲学,但在推理时效率高得多,使模型运行成本降低了约 100 倍
- 《Jeff Dean 谈 AI 原生时代的创业经:找零个正确的甜点》(03:44起):本集把它说成:与训练不同,推理对延迟极其敏感,追求极低延迟时大批次处理就不管用了,因为必须等凑齐一大批请求才能一起算。
- 《Waymo 谈物理 AI 的七条实战教训》(04:46起):本集提到在物理世界中必须在车上运行所有推理、做出所有决定,计算设备只能放在车后备箱里
- 《开源模型没差距,缺的是让它跑起来的基础设施》(00:21起):本集把它说成:在 GPU 等加速器上运行大语言模型的计算密集型过程,需要处理输入输出的极大差异和非确定性。
- 《合成数据怎么做强化学习:Tonic AI 的方法》(06:48起):本集说基础模型的推理成本会随着那些公司走向 IPO 而上升,而开源模型能提供更便宜的推理
- 《从算盘到 AI 原生软件:Pipecat 创始人的八十年计算史漫游》(17:20起):本集说 2010 年代的云计算为扩展 AI 推理所需的基础设施奠定了基础;在嘉宾的大型多人游戏项目中,每一刻都有数百个实时推理调用在发生
- 《Mayfield 管理合伙人 Navin:AI 投资的泡沫数学与蓝海打法》(13:14起):本集说推理工作负载目前不到 10%,但推理比训练大 10 倍,当推理增长时硬件 CapEx 将继续增长;推理被比喻为跑在训练高速公路上的’车’
- 《Tether 做本地 AI:数据中心造太多了》(27:43起):本集把推理描述为’你向模型提问、得到回复’的计算过程,QVAC 在 Llama CPP 之上做了大量优化使其能扩展到几乎所有消费级 GPU
- 《AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱》(12:45起):本集把它说成:响应提示词的 token 完成。专门用于推理的芯片,其寿命比用于高强度的训练的芯片长得多。
- 《Lindy 创始人谈 AI 员工的上下文战争:从红黑树到”走去洗车”》(53:51起):讨论内部推理支出与薪酬的比例时提及,薪酬仍更高但三到六个月后将交叉
- 《Uber COO 谈会员制反转、自动驾驶终局与AI预算失控》(39:07起):本集在讨论合并人头预算和算力预算时提到,CTO 可以决定在推理上花更多钱如果认为那是最高 ROI
- 《当签名已死:AI智能体如何击穿传统网络安全》(05:53起):本集说推理正从数据中心和 NeoClouds 扩展到端点,将无处不在,蓝队需要考虑如何在这种推理分散部署的环境中进行防御
- 《SpaceX 600亿买Cursor:AI并购的疯狂逻辑》(14:30起):本集说’10 万的推理,你就可以雇佣这么多工程师’,将推理支出作为 AI 支出的核心指标;还提到 Amazon 基本上拥有 Claude Code 的计算资源,获得了那方面的推理收入。
- 《Martin Casado:AI 时代,钱比以前好使了》(34:46起):本集在列举 AI 堆栈各层价值积累时提到推理公司表现得很好
- 《Insight 创始人 Jerry Murdock:AI 泡沫何时破裂,谁会死掉》(11:59起):本集提到推理提供商之间的比较,以及通过交易所直接购买推理而不需要支付 5% 加价的模式
- 《Canva 联合创始人:AI 把设计成本从零变成美分之后》(13:30起):本集说要自己掌控数据飞轮并「管理推理」(manage the inference),才能把向数亿用户部署 AI 的成本降下来。
- 《前 Twitter CEO Parag:给智能体重造一个搜索引擎和一个新互联网》(10:12起):本集说智能体搜索是 LLM 推理的毗邻业务,买 LLM 做工作的客户十个用例里有九个需要让模型访问网络,且推理量每年增长 7 倍时固定费用的训练数据协议不具可持续性
- 《Parag:为什么智能体搜索不该照搬人类那一套》(10:12起):本集说 AI 推理量今年涨 7 倍、明年再涨 7 倍就是 50 倍,但固定费用授权合同金额不会跟着涨,导致内容方在续约时必然被稀释——这是固定费用模式在推理世界里的根本矛盾
- 《AI 应用层的黄金时刻:a16z 投资人 Anish Acharya 谈智能如何变成生意》(11:01起):本集说实验室向下纵向整合到推理和算力,因为推理的工作负载非常同质化,可以在价值链一段建巨大规模
- 《Ed Zitron:生成式 AI 是一场万亿级骗局》(14:40起):本集说它是数据中心内产生输出的过程,需要建好 GPU 来承接需求,买多浪费钱、买少客户用不了,且推理提供商似乎都不盈利。
- 《超级智能为什么危险:Ryan Greenblatt 的推演与解法》(37:44起):本集在 Plan A 交易结构中提到’停训练、只推理’(stop training and switch to just doing inference)作为暂停研发的具体手段
- 《NVIDIA 布局全栈、OpenAI 被迫上市与 AI 资本的”第五名效应”》(22:10起):本集在算收入构成时提到’一半的支出花在计算和推理上’(half of that spend goes on compute and inference),作为前沿模型成本结构的组成部分
- 《RL环境的供应链黑箱与模型的分工时代》(71:22起):本集提到推理正在移向边缘——未来一两年将获得成本 200-300 美元的硬件,能运行足够智能的模型满足 99% 需求;也提到 OpenAI 宣布了推理芯片 Jalapeno。
- 《最便宜的模型反而是最便宜的:Factory CTO 谈 AI 定价陷阱》(17:09起):本集说模型提供商想成为擅长卖推理的平台公司,Azure 应该是 Anthropic、OpenAI 和开放模型的推理场所
- 《Arm CEO 谈芯片、AI 与下一个十年的算力格局》(13:01起):本集说 AI 重心正从训练转向推理——token 的使用与分发——这一转移正是 CPU 需求回升的原因。
- 《Rackspace 首席 AI 官 Chetan Gupta:企业该停止纠结模型、开始思考架构》(34:10起):在嘉宾的分层架构中,推理层位于模型层之上,是「你如何从一个模型中获得一些智能」的方式。
- 《BlackRock Tony Kim:一万亿美元的资本支出,只为把数据移动几毫米》(08:27起):本集提到最好的模型建立在最优化推理之上,并提到推理云/边缘云提供「最后一公里的 token」把自己插进 token 流。
- 《Ollama CEO:开源模型正吃掉企业 80-90% 的 token》(09:03起):本集把推理引擎支持、推理供应商优化、经典计算问题在推理领域重演,当作 Ollama 零日发布行动手册和团队技术底蕴的核心话题。
- 《开源权重不是威胁:Box CEO 聊 AI 的经济账》(12:07起):本集嘉宾的核心经济学判断:AI 的赚钱机器是推理,钱最终会流向基础设施层;无论开源闭源,最终真正重要的只是推理成本。
- 《每块 GPU 多付 10 万美元插队:Speechify 创始人的算力账与战略悔棋》(07:29起):另一种 GPU 用途:用户调用 Speechify、给文本还音频时后台跑的数学;推理对芯片速度要求低、100 毫秒内出结果即可,因此可用老款 GPU,是买旧 GPU 不亏的关键。
- 《PG 炉边谈话:创业的核心从来没变过》(11:32起):本集用它论证低成本起步没死:同等推理水平下价格一年大约降 30 倍,token 现在贵只是 GPU 短缺所致,技术总会变便宜
- 《别小看 harness:智能体的「脚手架」正在决定成绩》(39:21起):本集在部署语境中反复出现:本地推理成本/延迟大降、云端优化本地栈但部署推理零云端成本、harness 跑出的推理轨迹可喂下一版模型。
- 《从 Hugging Face 到中国药企:NVIDIA 的开源终局与 AI 制药的未来》(07:37起):本集说软件层商品化让搭推理公司更容易、必然买 NVIDIA 芯片,且 Google Cloud 上 Gemini 与开源模型的推理收入在火箭般蹿升
- 《当 AI 决定买什么软件:G2 的「信任层」生意》(00:44起):本集反复强调验证层是「inference 时的工作」:模型在推理时识别高权威来源、执行实时检索,前沿实验室算力受限、只消费最容易消化的数据。
- 《Box 创始人 Erin Levy:套壳的逆袭与应用层的万亿机会》(10:43起):本集把它说成:Meta、SpaceX、中国、NVIDIA 等博弈结构不同的玩家可能把推理毛利打到 10%,token 成本长期下行,价值因此往应用层累积。
- 《一颗餐盘大的芯片:Cerebras 创始人讲晶圆级豪赌》(29:21起):本集说公司原以为推理会发生在分布式设备上,后来看到「AI 会聪明到人人都想用」时意识到「推理将会压垮计算基础设施」,于是转向推理;还通过与 AMD、AWS 的解耦拿到 5 倍额外吞吐量。
① 提到它的金句
9 条
所以在推理计算方面,这基本上比当今最前沿的模型小了一百多倍。
指向原始笔记的链接
So that’s like more than a hundred X smaller in terms of inference compute than basically the absolute frontier of models today.
—— Mustafa Suleyman · [10:28]
推理从「我需要运行这个模型」变成「一套运行这些智能体的工具」。
指向原始笔记的链接
Inference goes from, I need to run this model to a set of tools to run these agents.
—— Julian · [11:32]
推理从狭义的解决方案变成了解决更广泛问题的一套工具。
指向原始笔记的链接
inference turns from a narrow solution to a set of tools to solve a broader problem.
—— Julian · [12:07]
在游戏的每一刻,都有数百个推理调用正在发生,即使是一年前我们也无法构建任何这样的东西。
指向原始笔记的链接
At every moment in the game, there are hundreds of inference calls happening, and we couldn’t have built anything like this even a year ago.
—— Kwindla Kramer · [19:25]
这就是为什么如此多的 CapEx 正在投入,但推理工作负载还不到 10%。
指向原始笔记的链接
That’s why so much CapEx is going, but inference workloads are less than 10%.
—— Navin Chaddha · [28:58]
即使对于头部内容,这也是一个破碎的商业模式,因为当 AI 或推理增长时,假设今年增长 7 倍,明年再增长 7 倍。在这 50 倍上,他们的交易规模并没有增长 50 倍。
指向原始笔记的链接
And even for the head, it is a broken business model because when AIs or inference grows, let’s say 7x this year and another 7x the next year. On this 50x, their deal size is not growing 50x.
—— Parag · [38:25]
在美国开源这一边,我总体上认为 AI 的赚钱机器是推理。
指向原始笔记的链接
on the open source US side, I generally think that the moneymaker in AI is inference.
—— Aaron Levie · [12:08]
我们认为在不久的将来,你会看到人们日常推理调用中的很大一部分,甚至可能是大多数,会走向本地设备和本地笔记本电脑或本地工作站,而不是像今天这种一切都被推上云端的标准做法。
指向原始笔记的链接
We think in the very near future, you’re going to see a huge proportion, maybe even a majority, of people’s daily inference calls going to local devices and on-prem laptops or on-prem workstations, as opposed to the kind of standard of today where everything’s being pushed up to the cloud.
—— 嘉宾 · [45:06]
如果每个人都想使用它,推理将会压垮计算基础设施。
指向原始笔记的链接
If everybody wants to use it, inference is going to crush the compute infrastructure.
—— Andrew Feldman · [31:30]
② 出现在这些集
46 集
- 《PM的生存法则:AI时代别当瓶颈,去抢活干》 — 作为概念(提及)
- 《Base 10 的 Julian:推理正在从「租用智能」走向「拥有智能」》 — 作为概念
- 《AI Engineer 大会背后的社区逻辑与创业生存法则》 — 作为概念(提及)
- 《Claude Tag:住在 Slack 里的主动型队友,如何让 65% 的 PR 由 AI 开出》 — 作为概念(提及)
- 《不只做推理:Modal 如何跨界多节点训练与智能体云》 — 作为概念
- 《OpenAI 工业算力负责人:把电子变成 token 的巨兽工厂》 — 作为概念
- 《Hugging Face CEO:开源 AI 更安全,下一阶段属于模型路由》 — 作为概念
- 《「智能是数据的派生物」:Fireworks 创始人 Lin Kuo 的专用智能宣言》 — 作为概念
- 《主导投资 Anthropic 的人:风投的游戏规则已经彻底变了》 — 作为概念
- 《Sam Altman 谈 AI 时代的创业法则:被全世界当成白痴是最大优势》 — 作为概念
- 《让 AI 像人一样犯错:Simile 创始人的模拟人类生意》 — 作为概念(提及)
- 《Jeff Dean 谈 AI 原生时代的创业经:找零个正确的甜点》 — 作为概念
- 《Waymo 谈物理 AI 的七条实战教训》 — 作为概念(提及)
- 《开源模型没差距,缺的是让它跑起来的基础设施》 — 作为概念
- 《合成数据怎么做强化学习:Tonic AI 的方法》 — 作为概念(提及)
- 《从算盘到 AI 原生软件:Pipecat 创始人的八十年计算史漫游》 — 作为概念
- 《Mayfield 管理合伙人 Navin:AI 投资的泡沫数学与蓝海打法》 — 作为概念
- 《Tether 做本地 AI:数据中心造太多了》 — 作为概念
- 《AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱》 — 作为概念
- 《Lindy 创始人谈 AI 员工的上下文战争:从红黑树到”走去洗车”》 — 作为概念(提及)
- 《Uber COO 谈会员制反转、自动驾驶终局与AI预算失控》 — 作为概念(提及)
- 《当签名已死:AI智能体如何击穿传统网络安全》 — 作为概念
- 《SpaceX 600亿买Cursor:AI并购的疯狂逻辑》 — 作为概念
- 《Martin Casado:AI 时代,钱比以前好使了》 — 作为概念(提及)
- 《Insight 创始人 Jerry Murdock:AI 泡沫何时破裂,谁会死掉》 — 作为概念(提及)
- 《Canva 联合创始人:AI 把设计成本从零变成美分之后》 — 作为概念
- 《前 Twitter CEO Parag:给智能体重造一个搜索引擎和一个新互联网》 — 作为概念
- 《Parag:为什么智能体搜索不该照搬人类那一套》 — 作为概念
- 《AI 应用层的黄金时刻:a16z 投资人 Anish Acharya 谈智能如何变成生意》 — 作为概念
- 《Ed Zitron:生成式 AI 是一场万亿级骗局》 — 作为概念
- 《超级智能为什么危险:Ryan Greenblatt 的推演与解法》 — 作为概念
- 《NVIDIA 布局全栈、OpenAI 被迫上市与 AI 资本的”第五名效应”》 — 作为概念(提及)
- 《RL环境的供应链黑箱与模型的分工时代》 — 作为概念(提及)
- 《最便宜的模型反而是最便宜的:Factory CTO 谈 AI 定价陷阱》 — 作为概念(提及)
- 《Arm CEO 谈芯片、AI 与下一个十年的算力格局》 — 作为概念
- 《Rackspace 首席 AI 官 Chetan Gupta:企业该停止纠结模型、开始思考架构》 — 作为概念
- 《BlackRock Tony Kim:一万亿美元的资本支出,只为把数据移动几毫米》 — 作为概念(提及)
- 《Ollama CEO:开源模型正吃掉企业 80-90% 的 token》 — 作为概念
- 《开源权重不是威胁:Box CEO 聊 AI 的经济账》 — 作为概念
- 《每块 GPU 多付 10 万美元插队:Speechify 创始人的算力账与战略悔棋》 — 作为概念
- 《PG 炉边谈话:创业的核心从来没变过》 — 作为概念
- 《别小看 harness:智能体的「脚手架」正在决定成绩》 — 作为概念(提及)
- 《从 Hugging Face 到中国药企:NVIDIA 的开源终局与 AI 制药的未来》 — 作为概念
- 《当 AI 决定买什么软件:G2 的「信任层」生意》 — 作为概念
- 《Box 创始人 Erin Levy:套壳的逆袭与应用层的万亿机会》 — 作为概念(提及)
- 《一颗餐盘大的芯片:Cerebras 创始人讲晶圆级豪赌》 — 作为概念
③ 关联
点进去有真内容 —— 本页主要出口
智能体 · OpenAI · Anthropic · Cursor · GPU · NVIDIA · 护栏 · OpenRouter · 微调 · 沙箱
