Transformer 已见顶?OpenAI 与 Google 双雄离职造新架构
关联
人物 Rohan Anil · Sonja · Jerry Tworek
公司 Core Automation · OpenAI · Google · Anthropic
概念 Transformer · 强化学习 · 预训练 · 测试时学习 · 算子 · 持续学习 · AGI · 计算深度 · 思维链 · 编码智能体
Transformer 已经把人类几乎所有的静态知识都压缩进了模型里,但如果明天 OpenAI 和 Anthropic 停止训练新模型,今天这些强大的模型会随着时间流逝变得越来越没用——这就是 Transformer 的天花板。说这话的人是 Jerry,他曾是 OpenAI 负责强化学习(一种让模型在环境里不断试错拿奖励的训练方法)和推理团队的核心人物,如今创办了 Core Automation 实验室,要寻找能替代 Transformer 的下一代架构。
这一集里,他和联合创始人 Rohan(前 Gemini 预训练负责人)一起,聊了三件事:为什么坚信 Transformer 在架构层面已经走到尽头,根本没法持续学习;为什么把预训练和强化学习拼在一起、端到端地优化,才是大幅提升计算效率的破局点;以及为什么他们选择离开资源最顶尖的大厂去创业,试图用极高的自动化水平去建造一个能每天疯狂试错的实验室。
为什么「大就是好」的扩展主义走到了头
聊起要寻找 Transformer 替代品的初衷,Jerry 先抛出了他个人的思想转变。他自认一直是个「强化学习最大主义者」,在 OpenAI 时坚信只要把强化学习的规模扩上去,AGI(能在所有具经济价值的工作上超越人类的系统)就水到渠成。
如果 2024 年有人问他 AGI 何时实现,他会斩钉截铁地说是 2025 年。他确实身处扩展强化学习的中心,眼看着模型跑分一路飙升。但残酷的现实是:他们并没有因此解决现实世界的真实任务 。
症结在哪?模型在实验室里拿高分,是因为评估它们用的基准和训练它们的数据本质上是同一枚硬币的两面 。
可现实世界的数据分布要混乱、模糊得多。目前 AI 主要靠两种方式在用的时候临时学习:一是上下文学习(模型根据你当前输入的提示词来理解上下文,不改动自身参数),但它容量有限,往往用个 20 分钟就得清理重置;二是持续微调(用新数据不断调整模型参数),但这会引发灾难性遗忘(新知识覆盖旧知识导致彻底忘事的老大难问题)。Transformer 根本做不到在真实部署中边用边学,一旦世界变了样,有了新事件或新工具,它的价值就会受损 。
大厂之所以不愿放手去试新架构,正是因为它们深陷商业竞争的泥潭。如果继续砸钱扩展 Transformer 就能保住下个季度的市场份额,就没心思去研究可能要花一两年才见效的颠覆性架构了 。
比大模型更紧要的:让计算花得值
架构是大问题,但这不意味着新架构只需在图纸上画得漂亮。Rohan 接过话头,把目光拉回到了更为硬核的算力效率上。他在 Google 深耕优化算法多年,他看待架构的视角非常务实:架构本质上是我们「花钱买算力」的一种方式,而当下的 Transformer 在推理(模型训练好后,接收用户提问并给出回答的过程)时实在太烧钱了 。
现在业界的主流做法是思维链和自回归解码(模型像写字一样从左到右一次只能吐出一个 token,靠不断生成新字词来延长思考时间以换取准确率)。Rohan 指出,这种「为了增加计算深度(网络处理信息的层数或逻辑深度)只能靠不断往后加字」的做法,是对算力的巨大浪费。大家为了补救,搞出了投机解码(让小模型先猜后面的词,大模型再来验证,从而加速生成)等「打补丁」的方案,其实都是治标不治本 。
在 Rohan 看来,真正能带来数量级提升的,是把预训练和强化学习这两个原本割裂的过程,端到端结合起来重新设计训练算法。他研究过优化器,比如曾用于 Gemini 1.5 Flash 的 Shampoo 算法,虽然比常规做法有两倍的效率提升,但依然没有榨干训练数据里的信息。
此外,哪怕是极小众的探索(比如去掉神经网络里极常用的残差连接去学更深层的网络),也必须依赖更强大的优化器才能成立。优化算法和架构设计是一枚硬币的两面 。
但面对「AI 能否逼近人类生物学习效率」的提问,Rohan 给出了否定的答案。人类的大脑能自己长出模拟电路并高效纠错,几经历练便能深刻掌握知识。
而目前的 AI 硬件基于数字电路,靠极高的并行算力暴力吞吐信息,显得极其笨拙。除非硬件发生彻底的颠覆,否则别想赶上生物学习的效率 。
自动化实验室与被卡住的内核生成
既然大厂既不敢赌新架构,又受困于短期的发布周期压力,这两位大牛的选择就是出走创业。Jerry 强调,Core Automation 想做的自动化实验室,并不是要把人类踢出局,而是要赋予研究员最大的主观能动性(让个人拥有更大的掌控感和行动力去完成高价值工作)。
就像人类从走路换成骑车,再到开车,同样的时间能跑出大得多的探索半径。如果一个人加上现在的编程智能体每天能做一个深度学习实验,未来或许能一天做一百个。
不过,要实现这种疯狂的实验节奏,他们撞上了一堵硬墙:内核生成。内核是直接与 GPU 硬件打交道的底层代码,想让任何新颖的 AI 架构真正跑出速度,就得写出极度优化的内核。他们曾和 GPU mode 联合举办过一场关于 QR 分解(一种基础的矩阵线性代数运算,常用于优化算法)的内核竞赛 。
结果既惊艳又令人沮丧:常规求解器只能提供基础性能;一个懂行的顶尖工程师配上搜索循环,能写出快 7 倍的代码;而如果世界上极其稀有的顶尖高手(全球大概只有三人)连续四周、花十万美元指挥编码智能体去搜,能写出快 60 倍的内核 。但如果直接把这个问题丢给当下最强的商业模型,它们根本束手无策。
Rohan 曾在 Google 推动过一种名为 n-gram 内存的技术,意图用额外的内存替代部分 Transformer 参数,最终却因为没人在底层写出相应的硬件加速内核,这个极具潜力的架构探索只能无奈搁置 。这也是为什么他们必须啃下内核生成这块硬骨头。
怎么定义成功:全队去度假,模型自己搞研究
那么,到底什么才算找到了替代 Transformer 的全新架构?Jerry 给出了一个极有意思的判断标准:测试时的持续学习。
在他看来,那个神奇的图表拐点往往姗姗来迟。一个深度学习系统极为复杂,往往需要接连做对五件事,模型才能跑通见效 。
他们想要的终极成功画面是:当实验室的系统每天都在 Core Automation 科学家们的真实工作中被使用,它会变得越来越懂行。Jerry 开了个意味深长的玩笑:等哪天我们整个团队放假去休假一整周,回来发现实验室里的模型竟然自己产出了更好的研究成果,那就说明成了。如果真到了那一步,他们大概会把假期再延长两倍、四倍,直到「永久度假」。
本集带走
最后收个尾,这一集值得带走的是三句话。第一,Transformer 的瓶颈是结构性的,它把人类现有的静态知识压缩得很好,但一旦世界变了、训练停了,它无法在真实部署中边用边学,这是它见顶的根本原因。
第二,想大幅提升计算效率,别再给「一次只吐一个词」的推理方式打补丁了,必须把预训练和强化学习结合起来端到端去优化,让算力花得更值。第三,要实现疯狂的实验迭代速度去寻找新架构,就得啃下硬骨头——用智能体攻克底层内核生成的难关,让模型自己学会为新颖的架构写出能在硬件上极速运行的代码。等哪天研究员能放心去放长假,模型还能在实验室里自己搞出新研究成果,那真正的下一代架构就算成了。
如果 Transformer 是有利可图的,如果你可以花费更多的努力和资源来扩大 Transformer 以在下一个季度获胜,那么很难把大量的注意力和精力投入到可能在一两年内更好或重新定义该领域的事情上。
If Transformer is profitable and if you can spend more efforts and more resources scaling Transformer to win in the next quarter, it’s very hard to put at least a lot of attention and a lot of energy to work on something that will maybe better or maybe will redefine the field in a year or two.
—— Jerry Tworek · [13:28]
我们可能比以往任何时候都在从经验学习上花费最多的算力,但强化学习并不是从经验学习的终点。
We probably are spending the most compute than ever on learning from experience, but reinforcement learning is not the end of learning from experience.
—— Jerry Tworek · [26:22]
目前的机制相当糟糕,如果你把它留给世界,我恐怕我们会花更长的时间才能替换 Transformer。
The current mechanisms are quite poor and it will if if you leave it to the world I am afraid that it will take us like a much longer time horizon before we replace the transformer
—— 嘉宾 · [18:15]
就像 Jerry 说的,现在有公司在竞争发布周期,因为 tokens 不具粘性。
It’s like, as Jerry said, there are companies now competing for release cycles because tokens are not sticky.
—— 嘉宾 · [34:05]
我认为核心自动化所设想的自动化版本,在某种程度上是赋予每个人最大水平的主观能动性。
I think the version of automation by Core Automation is about giving each human maximum level of agency in some way.
—— Jerry Tworek · [35:03]
对我来说,AGI 是一个可以在没有任何人在循环中的情况下自我改进的模型。
For me, AGI is a model that can improve itself without human in the loop in any way.
—— Jerry Tworek · [38:21]
人类与大语言模型的混合模式现在真的非常成功。但是没有人类的大语言模型,就不怎么行,根本不行。
The human-LLM hybrid is really, really successful right now. But LLMs without humans, not so much, not at all.
—— Jerry Tworek · [39:00]
但这需要高水平品味的人类,就像世界上大概只有三个人,并且在四周内花费大约十万美元在这些编码智能体上,才能得到一个速度快 60 倍的解决方案。
But it requires the high-taste human, like there’s maybe three people in the world, and spend about $100,000 on these coding agents over a span of four weeks to get to a solution that’s 60x faster.
—— 嘉宾 · [41:10]
正如我提到的,我们相信 Transformer 无法进行持续学习。没有办法在 Transformer 上进行持续学习。
We believe, as I mentioned, that transformers are incapable of continual learning. There’s no way how to put continual learning on transformers.
—— Jerry Tworek · [45:21]
而我在 2024 年和 2025 年初看到的是,当前的路径无法让我们到达那里。
And what I have seen there in 2024 and in early 2025 is that the current path doesn’t get us there.
—— Jerry Tworek · [39:09]
理论上最优的架构对任何人都没有用。
A theoretically optimal architecture is not useful to anyone.
—— 嘉宾 · [17:40]
顺着「创业与行业」挖下去
- AI 繁荣若崩塌:数据中心债务、AGI 囤积与市场清算同公司:Anthropic、Google、OpenAI · 同概念:AGI
- 红杉合伙人 David Cahn:AI 需赚回 4 万亿,这场棋局没有中间态同公司:Anthropic、Google、OpenAI · 同概念:AGI
- AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱同公司:Anthropic、OpenAI · 同概念:AGI、预训练 (pre-training)
换个口味
- AI 安全排行榜:谁扛住了越狱,谁没有同公司:Anthropic、OpenAI、Google · 同概念:思维链 (chain of thought)
- Rich Sutton:LLM 不是全部智能,真正的AI必须持续学习同概念:强化学习 (reinforcement learning)、持续学习 (continual learning)、预训练 (pre-training)
- OpenAI 总裁 Greg Brockman:我们已进入 AGI 时代,而真正的瓶颈不是模型同公司:OpenAI · 同概念:AGI、强化学习 (reinforcement learning)
