用物理设计新材料:Max Welling 的 AI for Science 双向之路

Max Welling · cusp.ai 联合创始人 · 2026-08-27
听中文精华AI 合成朗读00:00
相对这些量子力学近似,有三到四个数量级的加速,效率更高。
— Max Welling

关联

这一集的主角是 Max Welling——cusp.ai 的联合创始人兼 CTO、阿姆斯特丹大学教授,理论物理博士出身。他的核心主张是:物理与 AI 不是「AI 应用于物理」的单向关系,而是一场双向的交叉授粉——AI 在帮他设计全新材料,而物理里热力学、、对称性破缺这些深层结果,可能反过来成为下一代神经网络的设计原理。最反直觉的一点:他book里论证,现代生成式 AI 的数学与非平衡热力学的数学不是类比,而是同一套

为什么是材料:原子的组合近乎无限,宇宙只「发现」了一小部分

Max 对材料着迷的起点很朴素:原子组合的方式近乎无限,宇宙里自然形成的只是其中一小部分,剩下的都可以由人去设计,带着各种奇异特性 。他和联合创始人 Chad Edwards 创办 cusp.ai(2024 年春,初始融资约 3000 万美元,团队如今约 50 人,在伦敦、柏林设实验室)时的动机是气候:加速能源转型,以及把大气中的二氧化碳抽出来 [05:44-06:58 Max Welling]。

碳移除的量级常被低估:在实现碳中和之后,仍有 50 到 100 年,人类需要每年移除的量约为当前排放量的一半——大约相当于一个装满液态二氧化碳的日内瓦湖,而目前根本没有低成本的技术做这件事 [09:33-09:52 Max Welling]。难点在于二氧化碳在大气中太稀薄,捕集的成本大头是能源和吸附材料——于是第一个项目就落在改进吸附材料上,用的是「金属有机框架」(MOF:金属节点加有机连接体构成的网状分子,极其多孔、表面积巨大,空气吹过时分子会粘在孔壁上)[10:21-12:18 Max Welling]。这类材料正是今年诺贝尔化学奖的获奖对象——Max 特意澄清,发现者是化学家(他记得是 Kitagawa、Yagi、Robson 等教授),不是他 [11:31-11:46 Max Welling]。

【背景】「今年获诺贝尔化学奖」的金属有机框架,指 2025 年授予 Kitagawa、Robson、Yagi 三位化学家的奖项,与转写稿中 Max 的回忆一致。

平台怎么工作:一个「搜索未知材料」的智能体

cusp.ai 做的东西可以理解成一个搜索引擎,但搜的不是已有文档,而是已知和未知的材料——没有合适的就从头设计 [10:38-10:47 Max Welling]。核心是一个智能体,编排一长串计算,整个管线是这样:

  1. 查库:先在大规模材料数据库里检索(其中不少是大型出版商的独家授权文献),看是否已有满足目标性质的材料 [16:56-17:22 Max Welling]。
  2. 生成:没有就上生成式模型——和生成图像/视频同类的模型,只是这里以「条件陈述」告诉它「我要这些特定性质的分子」,一次生成数十万个,因为算起来很便宜 [17:31-17:59 Max Welling]。
  3. 多尺度过滤:从便宜到昂贵逐级筛选——先把分子弛豫到基态、查带电性、稳定性、孔径等快速检查,扔掉大批不靠谱的;再为该材料类别微调/蒸馏一个机器学习力场,跑分子动力学模拟(让分子「扭动」起来算关键性质);更贵的尺度上还用偏微分方程建模材料所在的器件 [17:59-19:58 Max Welling]。
  4. 实验:最后才进实验室,老办法下只敢对 10 个量级的候选做实验;正在兴起的「自动驾驶实验室」一天能做上百个实验,智能体根据实验数据与计算数据定下一轮实验设置,闭环快得多 [20:02-20:52 Max Welling]。

这条管线的地基是等变性(equivariance,指模型输出随输入的旋转平移同步变换——世界是三维对称的,转一下分子,力也跟着转)[05:05-05:25 Max Welling]。背景是:算原子间力理论上要求解薛定谔方程,10 个电子以上就不可行,连 DFT(密度泛函理论,其发明者拿了诺贝尔奖)这样的近似都昂贵;用神经网络做替代模型能拿到相对量子力学近似三到四个数量级的加速 [04:03-04:57 Max Welling]。Max 理论物理博士的旧热情与机器学习的新热情在这里「完美统一」[05:30-05:41 Max Welling]。

进展、商业模式与开源

效果上已有定性证据:做仿真的科学家说,以前要一个博士周期才能做完的事,现在几天搞定(不过这主要指数字领域)[22:04-22:20 Max Welling]。有实验环节的项目在跑:一个已做完实验室实验,半导体项目几个月后进实验,阿姆斯特丹的钙钛矿(一种可叠在硅太阳能电池上、把更多可见光转为电能的半导体晶体结构)项目进行中,还与丹麦技术大学合作催化,并与一家亚洲大型国家实验室签了约 [21:20-23:42 Max Welling]。

商业模式是合作伙伴生态:材料类别太广,每类都有学界或业界的「超级专家」,cusp 负责设计、合作方负责合成;同时也自筹资金跑内部项目(碳捕集 MOF、半导体),发现好东西就持有 IP 再找客户 [14:26-15:32 Max Welling]。

学术侧没停:cusp 也发表论文,最近最重要的是和 NVIDIA 一起开源了新的分子动力学框架——把机器学习力场编译进 JAX(基于 Python),让模拟在 GPU 上高效并行运行,因为传统 MD 模拟器多跑在 CPU 上,跑不动神经网络 [24:38-26:01 Max Welling]。基础模型方面用 Materials Project 数据集和 Meta 的 OMOL(大量 DFT 计算构成)训练广泛适用的力场/表示,再按材料类别微调蒸馏成又专又快的小模型——MD 模拟一步只有一飞秒,力场要被调用极多次,快是硬需求 [27:54-29:01 Max Welling]。分子还能写成 SMILE 字符串,所以 LLM 风格模型与图神经网络都能用,甚至可以把文献文本和分子图混在一起——每次提到某个分子,就用一个小图神经网络把它变成词元 [30:14-31:06 Max Welling]。

生成式 AI 的数学 = 非平衡热力学的数学

Max 快写完一本书,谈生成式 AI 与随机热力学。核心论断出奇地具体:现代生成式 AI(概率模型、扩散模型等)的数学,与非平衡统计力学/热力学的数学是等价的——不是「万物皆偏微分方程」式的类比 [35:06/35:41 Max Welling]。

为什么这么深?因为两边底层都是信息论:一个观察者面对太多自由度、不得不丢失信息,只能用概率去刻画——这套数学同时是热力学和机器学习的核心 [36:02-36:43 Max Welling]。

几条漂亮的对应:

  • :物理学里从能量减去熵才得到可做功的自由能,像是系统的可测属性;但按 Max 引述的物理学家 E.T. Jaynes 的观点,熵恰恰刻画了你对世界缺失的全部信息——贝叶斯统计里的主观概率与物理熵在此汇合 [37:03-38:17 Max Welling]。
  • Landauer 定理:从设备里擦除一个比特,必须以热的形式向环境耗散 kT 量级的能量——香农信息与物理能量的直接换算 [38:21-38:50 Max Welling]。
  • 热力学第二定律即信息只会持平或丢失:信息不消失,只是从系统转移到你完全无法恢复的热浴里 [39:07-39:39 Max Welling]。
  • 两边各自发展的工具互为精确对应:机器学习的「随机正则化流」与物理的「伴随自由能估计」结果是完全相同的方法 [39:56-40:18 Max Welling]。

交叉滋养是双向的:正向,扩散模型可以加速化学家关心的计算,比如蛋白质与药物结合/未结合态的自由能差;反向,随机热力学里的「反绝热驱动」概念可用于改进扩散模型、降低生成中的统计误差 [41:40-43:14 Max Welling]。而且这不是扩散模型独有的巧合——第一篇扩散模型论文的标题里就写着「非平衡热力学」,作者当年就知道这层联系;书还覆盖变分自编码器、MCMC、自由能估计 [40:50-43:52 Max Welling]。对理解模型本身也有用:热、功、熵产生这些机器学习里不用的概念,为理解并改进扩散模型提供了全新视角;随机热力学本身也是研究非平衡系统的新领域,两边的学者对彼此的工作都极感兴趣 [45:03-45:41 Max Welling]。

波与对称性破缺:物理深层结果当神经网络设计原理

Max 最近在 ICML 主题演讲里讲了另一个方向:把引入神经网络。动机有二 [46:16-47:46 Max Welling]:

  • 大脑里现在真的观测到了行波——从单电极进步到成百上千电极后,到处都能看到,问题只剩「这是功能还是副作用」[46:28-46:57 Max Welling]。
  • 神经网络的「过度平滑」:信息穿过数千层会被指数级压制,输入与输出变得彼此独立;深度学习里的很多技巧(残差、归一化之类)本质上都是在对抗这件事。推理任务也需要记忆——在很远的将来才被要求输出的计算,怎么在时间上「通信得很深」[46:58-48:33 Max Welling]。

大自然用波做长程通信:材料里的声子(晶格振动)、宇宙里让我们看见深空的光波——而神经网络完全不用这个工具 [48:35-49:13 Max Welling]。

做法来自物理学的自发对称性破缺:给每个神经元额外加一些维度、内置一个对称性;用足够大的随机权重初始化后,对称性自发破缺,产生戈德斯通模(Goldstone modes)——可以不耗任何能量传播的波,从网络开头稳定振荡到结尾,再把网络训练起来利用这些「免费」的振荡 [53:23-56:46 Max Welling]。

动力学系统视角下这正好落在甜点位:太稳定(一切收敛到一点)丢信息,太不稳定(混沌)信息还在但数值精度追不上——那正是「熵增加」的真正含义;最好的神经网络和大脑都运行在**混沌边缘**,而引入波之后网络自然而然就待在混沌边缘,不需要精细调参去凑 [51:07-53:14 Max Welling]。实测在需要记忆的任务上(随机时刻存数、随机远期时刻求和),这些波模型远好于 RNN [49:53-50:24 Max Welling]。Max 的总结:这是把物理的深层结果直接当作神经网络的设计原理,而可挖的数学与物理富矿还有的是 [56:53-57:12 Max Welling]。

本集带走

  • 加速来自替代模型:用神经网络替代 DFT 等量子力学近似来算原子间力,可拿到三到四个数量级的加速——这是 AI for science 材料管线的地基。
  • 设计新材料的管线是漏斗:查库 → 生成数十万候选 → 便宜到昂贵的多尺度过滤(基态弛豫、快检、蒸馏力场跑 MD、偏微分方程建模器件)→ 最后才实验,自动驾驶实验室一天百个实验正在把最后一环也提速。
  • 等变性是化学/材料里的「免费先验」:世界三维对称,模型输出随输入旋转平移同步变换,用在预测原子力的模型上正合适。
  • 生成式 AI 与非平衡热力学共享同一套数学(信息论),两边的工具互为精确对应——扩散模型即「把结构毁掉再反向从噪声造结构」,第一篇扩散模型论文标题里就写着非平衡热力学。
  • 把自发对称性破缺内置进神经网络,会得到不耗能、天然稳定的行波(戈德斯通模),让网络自动运行在混沌边缘,长程信息传递和记忆任务远胜 RNN。
  • 商业模式可参考:平台 + 合作生态(设计归我、合成归伙伴),同时自筹资金做内部项目拿 IP,用「从发现到客户付钱」走通全链路来建立行业信心。
全部金句 10 条

相对这些量子力学近似,有三到四个数量级的加速,效率更高。
Three-order to four-order magnitude acceleration, more efficiency relative to these quantum mechanical approximations.
—— Max Welling · [04:57]

所以我们现在能做的,基本上就是为一个非常具体的任务提出一个全新的分子,然后在实验室里制造它,再把它用于那个特定任务。
And so what we can do is we can now basically come up with an entirely new molecule for a very specific task and then make it in the lab and then use that for that particular task.
—— Max Welling · [13:16]

我们的一些科学家说过:我们现在几天就能做完以前一个博士周期才能做完的事,但这更多是在数字领域。
So some of our scientists, they have said things like, we can do now in a few days what took a PhD before, but that’s more in the digital domain.
—— Max Welling · [22:04]

现代生成式 AI,包括概率模型、扩散模型和许多其他东西,它们的数学结果等同于描述现代非平衡统计力学或热力学的数学。
Modern generative AI, including probabilistic models, including diffusion models, and many other things, their mathematics turns out to be equivalent to the mathematics that describes modern non-equilibrium statistical mechanics or thermodynamics.
—— Max Welling · [35:06]

物理学的核心是信息论。
At the core of physics is information theory.
—— Max Welling · [36:06]

扩散模型其实就是一个把结构取来并毁掉的过程,这通常是世界上发生的事,熵随之上升;然后我们尝试在时间上逆转它——从噪声出发创造结构,这就是我们的生成模型。
So diffusion models really are a process by which you take structure and you destroy it, which is typically what happens in the world. The entropy goes up. And then we try to reverse that backward in time, which is to start with noise and create structure, which is our generative models.
—— Max Welling · [41:02]

热和功、熵产生这些概念,我们谈论机器学习模型时并不使用,但我认为它们为思考正在发生什么、以及如何改进模型,提供了一个非常新颖且有趣的视角。
Concepts like heat and work and entropy, production, these things we don’t use when we talk about machine learning models, but I think they give you a very new and interesting perspective on how to think about what’s going on and how to also improve them.
—— Max Welling · [45:03]

所以你真正想要的是处在中间某处——不太稳定也不太不稳定——这叫混沌边缘。人们已经发现,事实上表现最好的神经网络就在这个混沌边缘上运行。
So what you really want is sitting somewhere in the middle, somewhere that’s not too stable and not too unstable, and that’s called edge of chaos. And people have found that, in fact, neural networks that perform best operate at this edge of chaos.
—— Max Welling · [52:34]

我们还发现,如果在神经网络中加入这些波,你会非常自然地运行在混沌边缘,而不必微调系统去凑到那里。
And we found that if you include these waves in your neural network, you very naturally operate in this regime edge of chaos, and you don’t have to fine-tune the system to be there.
—— Max Welling · [52:58]

所以在这里,我们把物理的一个深层结果用作神经网络的设计原理。
And so here we use something, a deep result from physics as a design principle for neural networks.
—— Max Welling · [56:53]

接着看

顺着「智能体」挖下去

换个口味