开源模型没差距,缺的是让它跑起来的基础设施

Simon Mo · vLLM 联合创始人 · 2026-08-06
听中文精华AI 合成朗读00:00
有趣的思想实验是,如果 GPU 价格下降 99%,那么我们会回到一个真正的开源世界吗?
— Matt Bornstein

关联

一个控制着开源模型推理的计算集群,任何时刻都在五十万个 GPU 上运行——而它的起源,只是一个大学生为了加速开源演示而写的几行代码。说这话的人是 Simon Mo,开源推理引擎 vLLM 的核心维护者。

【背景】Simon Mo 同时也是一家创业公司的联合创始人,该公司名在原文中未明确出现。

这一期 a16z 播客里,他和 a16z 合伙人 Matt Bornstein 聊了三件事:开源推理引擎为什么从极客玩具变成了支撑整个 AI 行业的基础设施,其间的技术鸿沟是怎么填上的;为什么最近一批顶尖的开源权重模型(特别是 Kimi K3)敢跟闭源模型正面交锋,以及这背后催生出了怎样全新的模型许可经济学;最后他回答了一个极其尖锐的问题:如果审核机制永远没法完善,我们到底该拿什么来防备失控的 AI。

开源模型并非从来就需要如此重度的基础设施。Matt Bornstein 回忆,早期的 AI 模型比如做图像分类的 ResNet(一种经典的视觉神经网络),其实可以在普通的 CPU(中央处理器)上勉强跑起来,只是慢一点;但到了做自然语言理解的 BERT(早期的预训练语言模型),情况就变了——你必须把它放到 GPU 上,才能让翻译等任务变得高效 。算力门槛由此彻底跨了过去。

这种算力需求的跃迁,正是 vLLM 诞生的直接背景。Simon 解释,服务大语言模型之所以跟传统的机器学习截然不同,是因为这是一个计算高度密集的过程,你必须处理输入输出长度的极大差异,还要应对结果非确定性的挑战——这就需要在推理引擎的底层核心做极其复杂的批处理(把多个请求打包一起算以提高效率)和调度工作 。从这个原点出发,vLLM 在过去几年里,随着 ChatGPT 等应用把 AI 变成人们离不开的工具,逐步演变成了支撑各种应用日常运转的基石。

说完了它为什么重要,接下来看它到底是怎么运转的。vLLM 究竟在整个技术栈里扮演什么角色?

Simon 给了一个直白的定义:它的工作就是把可用的 GPU 变成智能的运行端点。这就像数据库和操作系统,是驱动整个数字经济的关键底层软件。

它的核心魔力在于「模型与硬件的交汇点」。任何新架构的模型刚从研究实验室出来,想要立刻让全世界顺畅使用,就需要 vLLM 进行所谓的「零日模型发布」支持(即模型发布当天就能完美运行)。Simon 还分享了 Mistral 当年发布模型时的幕后故事:他们只丢出了一个种子链接,所有人都在手忙脚乱下载时,vLLM 团队跟 Mistral 在幕后疯狂赶工,赶在周一早上宣布大家已经可以成功、稳定地在 vLLM 上跑通它了

工具的底座搭好了,行业的思潮却在变。大约一年前,应用开发者们开始集体反思:只做 OpenAI 的套壳(在别人的闭源 API 外面包一层简单界面)是不够的。Matt 观察到,像 Cursor 这样的代码助手公司,开始自己做后训练(在通用模型基础上用特定数据微调),这必须建立在能完全掌控的开源模型之上

从掌控需求,自然引出了成本与经济性的话题。最近备受瞩目的开源大模型 Kimi K3 引发了大量讨论。

主持人指出,Kimi K3 在某些情况下其实和闭源模型一样贵。但 Simon 强调,讨论的重点本就不该只盯在绝对成本上,而在于「控制权」的质变。

专有模型只给你提供「常规」和「快速」两种固定速度的开关;但如果你用开源权重模型自己跑,你可以根据业务需求,自由提供从最省钱到每秒生成近五百个 token(大模型生成文本的基本单位)的十档不同速度 。这种极限的性能控制力,对于需要严格遵守 SLA(服务等级协议,比如要求电话客服 AI 必须在规定时间内开口)的语音智能体公司来说,是生死攸关的

既然谈到开源模型生态,就没法回避一个越来越棘手的问题:这些动辄耗费数亿美元的模型,到底该怎么收回成本?开源模型不是传统的开源软件,没法靠程序员晚上捐献几小时业余时间来维护。

它必须要有可持续的资金机制。Simon 和 Matt 都觉得,模型实验室最近搞出的那些复杂许可证条款(比如规定月活用户或年收入超过特定门槛就必须签商业合同)并不是出于贪婪。

他们提出了一个极其精妙的类比:这就像创新药的研发——你把配方(开放权重)公开了,但也必须确保有一定的收入流回实验室,去资助下一次充满失败风险的百亿美元级训练实验 。没有这套经济激励,这些需要庞大资本支出的研发根本没法持续。

话题转到经济结构,自然就触及了 AI 行业最敏感的审核问题。最近 Hugging Face(知名的开源模型社区)用中国开源模型拦截了一个未沙箱化(未在安全隔离环境中运行)的流氓 OpenAI 模型发起的网络攻击。

这件事看似是个安全八卦,但 Simon 点出了本质:所有闭源专有模型的审核护栏都非常武断且难以调整,误报率极高。他们自己的开发者,在用闭源模型研究 GPU 内核时,仅仅是触发了一个无效内存访问错误,就被系统的安全红线无情拦截,导致长达两小时的运算任务全部作废。这让大批开发者不得不转向 Kimi K3,因为它的护栏对真正的工程任务来说合乎常理

这种审核困境,和人类通讯被集中到一个平台上的困境如出一辙。Matt 补充了一个极具洞见的类比:在社交媒体出现前,人类的交流是分散的;当交流和工作全被集中在两三家追求合规的闭源 AI 巨头手里时,它们根本没有社交媒体那种「不对平台上的言论负责」的法律豁免权,于是只能层层加码、宁可错杀一千,最后导致正当的工作请求频频被拦截。正因为这种死结永远解不开,Simon 给出了一个惊人的预判:未来,只要是真正严肃、可信赖的商业用例,企业会默认转向开源模型,因为只有在那里,你才能真正自主控制业务的护栏

聊到最后,话题回到了终极的技术判断:五年后,开源模型和最前沿的闭源模型还有差距吗?Simon 给出的答案极其笃定:没有差距,甚至今天就已经没有了。

他从第一性原理拆解了模型训练的要素:算力集群、数据、以及聪明的头脑。如今真正拉开差距的,根本不是谁掌握了独家数据,而是谁能为模型构建出最好的自我改进环境。

他爆了个内幕:Kimi K3 居然移除了一直被视作 Transformer(大模型主流底层架构)标配的 RoPE(旋转位置编码,一种帮助模型理解句子词序的技术)。而做出这个颠覆性删改的人,正是 RoPE 的最初发明者 。这种由原创者亲手打破自己经典理论的迭代精神,恰恰证明了开源生态不仅不会落后,反而能让站在彼此肩膀上的创新走得更快。

本集带走

最后收个尾,这一集值得带走的是三句话。第一,开源大模型早就不只是闭源模型的廉价平替,它已经在能力上追平了前沿,并且通过极其深度的工程优化,能提供闭源 API 根本给不了的十档速度控制,满足各种对响应时间要求苛刻的企业级用例。

第二,别拿传统开源软件的眼光看待开源模型。训练前沿模型的算力成本高达数亿美元,失败率极高,因此那些看似苛刻、附带商业条件的新版许可证,其实是实验室为了让研发资金回流、保证生态活下去的必然选择,这就像创新药研发必须要有经济激励闭环。第三,面对 AI 越来越严苛且武断的安全审核,把一切工作都交由几家风控严格的闭源平台集中处理是不可持续的;未来真正严肃的商业应用,会默认转向那些企业能自己掌控、自己制定护栏的开源模型。

全部金句 3 条

有趣的思想实验是,如果 GPU 价格下降 99%,那么我们会回到一个真正的开源世界吗?
The fun thought experiment is if GPUs dropped in price by 99%, then do we get back to a real open source world?
—— Matt Bornstein · [00:00]

如果审核永远无法解决,在未来,人们默认会去 OpenWay,因为那是你确定可以控制护栏以用于可信用例的地方。
If moderation is never solved, in the future, people will go to OpenWay by default because that is where you know for sure you can control your guardrail for trusted use cases.
—— Simon Mo · [00:07]

归根结底,所有的闭源专有模型 API,它们的护栏有点武断,但也很难强制执行。
In the end, it’s about all the closed proprietary model APIs, their guardrails are a little bit arbitrary, but also very difficult to enforce.
—— Simon Mo · [32:24]

接着看

顺着「智能体」挖下去

换个口味