后训
后训练 (post training)
概念 · 又名 post training / post-train
本站收录 21 集 · 2 条金句 · 关联 10 个
集里怎么说它
- 《Mustafa Suleiman:数据是新的护城河——AI 创业者的机会地图》(11:24起):预训练之后的微调/对齐阶段;Mustafa 强调它只需少量极高质量 token,创业公司可以从零自建数据,这是真正的护城河。
- 《Peter Deng:产品不必是最重要的东西》(34:47起):本集提到在 OpenAI 等大型模型公司中,post training 和产品之间存在着真正的共生关系和紧密合作,这会产生令人难以置信的成果。
- 《Anthropic 联合创始人:安全为什么不是添头,而是 Claude 性格的来源》(08:19起):本集提到随着后训练技术的改进,模型发布节奏从一年一次变成了每个月或三个月一次。
- 《Handshake:靠学生网络四个月做到五千万ARR》(06:03起):本集说后训练是在预训练收益见顶后,实验室增强和改进模型数据的主战场,包括 SFT、RLHF、轨迹数据、rubric 评估等形式,目前模型的大部分收益都来自后训练
- 《Chip Huyen:别追 AI 新闻了,真正提升 AI 产品的是这些事》(01:50起):本集说:预训练已基本耗尽高质量文本数据,各家预训练数据高度同质化,真正拉开模型差距的战场在后训练(包括监督微调、强化学习等)
- 《10亿收入不到100人:数据公司 Surge AI 如何逆行塑造 AI 未来》(15:36起):本集核心概念之一;被描述为一门艺术而非纯科学,需要研究者的品味与判断力,以决定模型应擅长什么、看重什么样的数据。
- 《Claude Code 负责人:写代码已被解决,下一步是什么》(08:59起):本集说 Boris 加入 Anthropic 后花了一个月做后训练来理解研究层面,即在模型训练之后进行的微调等优化工作
- 《Base 10 的 Julian:推理正在从「租用智能」走向「拥有智能」》(01:57起):本集说公司正用自己应用和工作流的数据后训练模型,让模型擅长那件具体的事——这是「从租用到拥有的智能」的核心;需求爆发因开源够好、公司到了规模、有了成功样板。
- 《黄仁勋对话 LangChain:用开放堆栈打造企业超级智能体》(05:10起):本集把它说成:针对 harness 对模型进行的训练,可以让模型更擅长应用它周围的驾驭机制,从而提高整个智能体系统的能力上限
- 《AI 安全排行榜:谁扛住了越狱,谁没有》(25:16起):本集称其为模型训练中用于指令遵循和拒绝训练的阶段,复杂度差异很大,从简单的静态示例加人类反馈到 Anthropic 的宪法 AI 和 OpenAI 的对抗性自我博弈。
- 《开源模型没差距,缺的是让它跑起来的基础设施》(07:47起):本集把它说成:像 Cursor 这样的应用层初创公司在开源模型基础上所做的特定数据微调,用以摆脱仅做闭源 API 套壳的局限。
- 《AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱》(56:28起):本集把它说成:在基础模型预训练之后引入的工具,如带人类反馈的强化学习(RLHF)。它是过去 18 个月收益的主要来源之一。
- 《Merge的”二次创业”:从SaaS集成到AI连接基础设施》(49:12起):本集提到人们开始做后训练,明年人们将开始训练自己专用于特定任务的模型
- 《Rich Sutton:LLM 不是全部智能,真正的AI必须持续学习》(16:26起):本集说后训练本身没问题,但大语言模型在后训练之后权重就冻住了,不再从经验中学习
- 《Martin Casado:AI 时代,钱比以前好使了》(32:25起):本集说许多做微调、后训练的公司更像是服务导向型公司,而非产品公司
- 《数据成了企业唯一的护城河:AI时代的数据基建怎么做》(06:22起):本集提到后训练和强化学习让针对特定数据集微调模型或开源模型成为可能,业务负责人担心 CEO 薪水等敏感数据被用于后训练
- 《RL环境的供应链黑箱与模型的分工时代》(69:19起):本集提到中国新创业公司的方向是小模型后训练,目标是在 200 到 300 美元的硬件上运行足够智能的模型。
- 《LongLake:把AI塞进真实服务业务的笨办法》(12:14起):本集说他们在内部对企业独有的、对前沿实验室完全分布外的真实服务业务数据进行后训练,让模型能完成结账、划范围等任务
- 《最便宜的模型反而是最便宜的:Factory CTO 谈 AI 定价陷阱》(08:45起):本集说企业会拿通用模型做后训练来满足高量专有任务,目前配方在少数人脑子里但未来会被工具民主化,点几个按钮、描述任务就能出专用模型
- 《邮箱里的 AI 助手:Plaid 前 CTO 谈如何在巨头围剿下赢》(09:20起):本集说市场上有人认为按公司/个人后训练自定义模型能留住用户;JD 也提到会用后训练的更小模型处理邮件打标签这类低智能任务,以及后训练模型确保智能体尊重隐私边界。
- 《把 100 万 token 用出 5 万的体验:SubQuadratic 的稀疏注意力》(19:31起):本集说它是预训练之后提取额外能力的阶段,其创造价值的能力受限于预训练;sub-Q 1.1 的后训练基本只到 100 万 token,却能外推 1200 万。
① 提到它的金句
2 条
在这个中间过程中,既然每个人都有非常相似的预训练数据,那后训练就是如今他们做出大差异的地方。
指向原始笔记的链接
where like post-trading, but middle course of this is more of everyone have very similar pre-training data, is that post-training is where they make a big difference nowadays.
—— Chip Huyen · [15:10]
研究在很大程度上表明,你在后训练阶段创造价值的能力,受限于你所做过的预训练。
指向原始笔记的链接
And so research has largely suggested that your ability to create value in the post-training phase is limited by the pre-training that you’ve done.
—— Alexander Whedon · [20:31]
② 出现在这些集
21 集
- 《Mustafa Suleiman:数据是新的护城河——AI 创业者的机会地图》 — 作为概念
- 《Peter Deng:产品不必是最重要的东西》 — 作为概念(提及)
- 《Anthropic 联合创始人:安全为什么不是添头,而是 Claude 性格的来源》 — 作为概念(提及)
- 《Handshake:靠学生网络四个月做到五千万ARR》 — 作为概念
- 《Chip Huyen:别追 AI 新闻了,真正提升 AI 产品的是这些事》 — 作为概念
- 《10亿收入不到100人:数据公司 Surge AI 如何逆行塑造 AI 未来》 — 作为概念
- 《Claude Code 负责人:写代码已被解决,下一步是什么》 — 作为概念(提及)
- 《Base 10 的 Julian:推理正在从「租用智能」走向「拥有智能」》 — 作为概念
- 《黄仁勋对话 LangChain:用开放堆栈打造企业超级智能体》 — 作为概念
- 《AI 安全排行榜:谁扛住了越狱,谁没有》 — 作为概念
- 《开源模型没差距,缺的是让它跑起来的基础设施》 — 作为概念
- 《AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱》 — 作为概念
- 《Merge的”二次创业”:从SaaS集成到AI连接基础设施》 — 作为概念(提及)
- 《Rich Sutton:LLM 不是全部智能,真正的AI必须持续学习》 — 作为概念(提及)
- 《Martin Casado:AI 时代,钱比以前好使了》 — 作为概念(提及)
- 《数据成了企业唯一的护城河:AI时代的数据基建怎么做》 — 作为概念(提及)
- 《RL环境的供应链黑箱与模型的分工时代》 — 作为概念(提及)
- 《LongLake:把AI塞进真实服务业务的笨办法》 — 作为概念
- 《最便宜的模型反而是最便宜的:Factory CTO 谈 AI 定价陷阱》 — 作为概念
- 《邮箱里的 AI 助手:Plaid 前 CTO 谈如何在巨头围剿下赢》 — 作为概念
- 《把 100 万 token 用出 5 万的体验:SubQuadratic 的稀疏注意力》 — 作为概念(提及)
③ 关联
点进去有真内容 —— 本页主要出口
智能体 · Anthropic · OpenAI · Cursor · Lenny · Meta · 推理 · ChatGPT · Claude · 沙箱
