预训练 (pre-training)
集里怎么说它
- 《Handshake:靠学生网络四个月做到五千万ARR》(06:03起):本集说预训练是摄取互联网上所有书面人类知识的过程,但大约 18 到 24 个月前收益开始渐近见顶,因为能灌的数据基本都灌完了
- 《Transformer 已见顶?OpenAI 与 Google 双雄离职造新架构》(01:23起):本集说它本质上是对互联网静态数据的行为克隆和压缩,新架构必须把它和强化学习结合起来进行端到端优化,才能带来算力效率数量级的提升。
- 《AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱》(56:39起):本集把它说成:动辄花费十亿美元的大型训练运行。一旦投资者看穿模型收益多来自挽具和后训练,预训练的这笔庞大开支就守不住了。
- 《Rich Sutton:LLM 不是全部智能,真正的AI必须持续学习》(23:28起):本集说当前范式做了太多的预训练和后训练,模型发布后就停止学习,这是不对的
- 《Parag:为什么智能体搜索不该照搬人类那一套》(11:41起):本集说 Parallel 不做预训练超大型模型,而是把东西压缩成微小的排序模型;也提到模型公司为预训练爬取时没有耐心等慢的 JavaScript 加载
- 《把 100 万 token 用出 5 万的体验:SubQuadratic 的稀疏注意力》(11:26起):本集说预训练给模型核心知识,后训练创造价值的能力受限于预训练;SubQuadratic 声称是唯一做过稳健数百万 token 预训练的团队,100 万 token 预训练能让模型外推到 1200 万 token 的检索任务。
① 提到它的金句
5 条
在这个中间过程中,既然每个人都有非常相似的预训练数据,那后训练就是如今他们做出大差异的地方。
指向原始笔记的链接
where like post-trading, but middle course of this is more of everyone have very similar pre-training data, is that post-training is where they make a big difference nowadays.
—— Chip Huyen · [15:10]
是的,我认为这是一个好问题,对开发者来说宽容的看法是,如果有一件事你真的不想搞乱,那就是预训练,因为它只是比你做的其他任何训练过程都要昂贵几个数量级。
指向原始笔记的链接
Yeah, I think it’s a good question and the charitable take for developers is that if there’s one thing you really don’t want to mess with, it is pre-training because this is just orders of magnitude more expensive than every other training procedure that you do.
—— Adam Gleave · [74:22]
并不清楚的是,用新架构和新范式预训练一个新模型的第一个周期,第一个周期就奏效是疯狂的。
指向原始笔记的链接
It’s not clear that the first cycle of pre-training a new model with a new architecture and a new paradigm, the first cycle of that working is insane.
—— Justin Johnson · [22:32]
据我们所知,我们是唯一做过稳健的数百万 token 预训练的人。
指向原始笔记的链接
As far as we know, we are the only people to do robust multi-million token pre-training.
—— Alexander Whedon · [11:26]
研究在很大程度上表明,你在后训练阶段创造价值的能力,受限于你所做过的预训练。
指向原始笔记的链接
And so research has largely suggested that your ability to create value in the post-training phase is limited by the pre-training that you’ve done.
—— Alexander Whedon · [20:31]
② 出现在这些集
6 集
- 《Handshake:靠学生网络四个月做到五千万ARR》 — 作为概念
- 《Transformer 已见顶?OpenAI 与 Google 双雄离职造新架构》 — 作为概念
- 《AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱》 — 作为概念
- 《Rich Sutton:LLM 不是全部智能,真正的AI必须持续学习》 — 作为概念(提及)
- 《Parag:为什么智能体搜索不该照搬人类那一套》 — 作为概念(提及)
- 《把 100 万 token 用出 5 万的体验:SubQuadratic 的稀疏注意力》 — 作为概念
③ 关联
点进去有真内容 —— 本页主要出口
后训练 · 智能体 · Anthropic · OpenAI · 合成数据 · Google · 推理 · Palantir · Transformer · Meta
