Transformer 不满十岁:AI 集中不是宿命

Lucas Kaiser · AI 研究者 · 2026-09-07
听中文精华AI 合成朗读00:00
它比我们团队当年做 Transformers 研究时用的八台 8GPU 机器算力还强。
— Lucas Kaiser

关联

这一集来自 a16z 在旧金山开源 AI 峰会上的一段访谈,主持人 Sophia Du 对话的嘉宾是 Lucas Kaiser——AI 研究者、那篇奠定现代 AI 的论文《Attention is All You Need》的共同作者,正是它引入了 transformer(今天几乎所有大模型背后的基础架构)。

【背景】《Attention is All You Need》2017 年由 Google 团队发表,共八位作者;文中人名照转写稿记为 Lucas Kaiser。

他的核心判断一句话就能说清:今天 AI 的权力集中,是当前技术路线的属性,不是 AI 的必然特征。

集中是怎么来的

编码智能体大约在去年年底、今年年初开始真正能用了,而这代 AI 的本质决定了它的集中:你必须在昂贵的数据中心里、用海量数据训练模型,于是只有大公司做得起,再向所有人收费。想更强?

大公司的答案不是研究突破,而是「做得更大、更大、再更大」——这需要几十亿美元,需要抓取互联网每个角落的数据。研究突破不像商业提案,有就有、没有就没有,没法靠预算砸出来 [01:08-02:00 Lucas Kaiser]。

但 transformer 甚至还不满十岁。它的短板很明显:喂整个互联网,它相当聪明;让它只学一件具体的事,它就很蠢。 Kaiser 认为这不是死路,而是一个「有望被解决的研究问题」——可能需要一个让小数据也能学好 smaller model 的突破,而没人确切知道该往哪里找:它可能涉及模型架构、损失函数、数据和训练方式的组合 [02:06-03:20 Lucas Kaiser]。

突破存在吗?我们就是证明

主持人问:会不会有算法突破让小玩家真正竞争?他的回答是:我们知道它存在,人类就是证明

人类不是样样精通的通才,但特定领域的专家在自己领域里,有时比超级大模型还好。所以「小数据学成专家」的算法在自然界是存在的,只是我们还没在技术上找到它 [02:52-03:07 Lucas Kaiser]。

【背景】集成(ensemble)指把多个模型各自预测组合起来、往往比单一模型更准的经典方法,Kaiser 拿它作为「分布式模型可以更强」的基础研究依据。

他甚至给出一个更根本的猜想:给定固定的数据量,从中学习的最佳方式可能就是拥有大量分布式的模型——各自强大,合在一起更强。基础研究(比如集成方法)确实有理由支持这一点 [04:43-04:59 Lucas Kaiser]。

一块 GPU 就够开始研究了

对个人研究者,他给了一个非常具体的鼓励:他最近自己买了一块 5090 RTX GPU,它的算力比他团队当年做 transformer 研究时用的八台 8GPU 机器还强。你没法用它训练大 LLM,但完全可以做研究和实验——而且他相信机器学习研究里还剩非常多的东西可挖,很多人应该这么做 [03:44-04:13 Lucas Kaiser]。

他还有一层观察:OpenAI 在他加入时是非常纯粹的研究实验室,现在也是一家要做产品的大公司,对研究的专注变少了。这恰恰是开源运动和学术界的机会 [03:24-03:44 Lucas Kaiser]。

为什么乐观

很多人看 AI 现状会悲观:大公司、大数据中心,你只能订阅一个自己左右不了的服务。他的回应是:这只是今年、明年的状态,是技术的一个阶段,而阶段会过去。

因为太好用,所有人都聚焦在大数据上;但既然它现在这么贵,也许行业会重新聚焦更基础的研究。机器学习的进步并没有止步于 2017 年 [05:31-05:37 Lucas Kaiser]。

他想象的未来:每个人可能拥有自己的模型,从少得多的数据里学习,像人类一样各自成为不同领域的专家——「现在你问一个大语言模型要个笑话,答案总是一样的,总是关于原子的什么梗」,这种千篇一律会随研究追上来而改变 [06:05-06:35 Lucas Kaiser]。对研究者来说,这是一个巨大的追赶机会。

本集带走

  • 集中是技术属性,不是宿命:transformer 不满十岁,它的「吃数据、吃算力」是这一代架构的特点,下一个突破可能改写整个经济学。
  • 「小数据学成专家」的算法被证明存在:人类领域专家就是活证据,只是计算机上还没实现——这是开源和学术界最大的机会窗口。
  • 个人研究的门槛已经低到一块消费级 GPU:一块 5090 的算力超过当年发明 transformer 的整个团队,做不了大模型,但够做突破性研究。
  • 大公司转向产品,纯研究出现真空:OpenAI 式实验室越来越像产品公司,基础研究的机会正在外移。
全部金句 4 条

它比我们团队当年做 Transformers 研究时用的八台 8GPU 机器算力还强。
It has more power than the eight 8GPU machines we used as a team to do the Transformers research.
—— Lucas Kaiser · [03:50]

我们的大脑仍然不输给模型,我们也不是通才,而且不存在一个全人类的大脑。
Our brains are still unmatched by the models, and we are not generalists, and there’s not like one big brain of humanity.
—— Lucas Kaiser · [04:34]

我从根本上认为,在给定固定数据量的情况下,从数据中学习的最佳方式可能是拥有大量分布式的模型。
I think fundamentally, it might be that given a fixed amount of data, the best way to learn from it is to have a lot of distributed models.
—— Lucas Kaiser · [04:43]

所以是的,Transformer 在你喂给它整个互联网时很强大,但我们知道存在一个更优秀的算法,它能从小得多的数据中学习,并在所学的东西上表现得令人惊叹。
So yes, transformers are great when you feed them all of the internet, but we know there is an algorithm that’s even better and it can learn from much smaller data and be amazing at the things it’s learning.
—— Lucas Kaiser · [05:03]

接着看

顺着「创业与行业」挖下去