Ollama CEO:开源模型正吃掉企业 80-90% 的 token
关联
在本地和云端运行开源模型的 Ollama,如今被 900 万开发者使用、拥有 178,000 个 GitHub 星标、85% 的财富 500 强企业都在用——它几乎是观察「开发者实际在用哪些 AI 模型」的最佳窗口。这一集的嘉宾就是 Ollama 的联合创始人兼 CEO Jeffrey Morgan。他带来的最大判断是:开放模型的需求正在爆发,企业内部的 token 消耗,终将有 80%、90% 走开源模型 。
企业正在倒向开源模型,成本只是入口
Ollama 看到的最大趋势,是企业向开放模型的转变,混合来自美国和中国的模型,主要由编码智能体和 AI 助手这类协作场景驱动 。一个具体的例子:AT&T 已经把 40% 的 token 消耗转移到了开放模型上,目前主要走美国和欧洲的模型,但也在评估中国模型 。
驱动力是什么?「成本是到目前为止最大的痛点,开放模型可以介入并解决。」但 Jeff 强调,成本只是短期问题,每个企业真正的北极星是「更好地掌控 AI,并为自己的业务定制它」——开源给了他们这个可能 。
增长曲线非常陡:Ollama 云端上单个开发者每周平均 token 用量,年初以来有两个大拐点——第一波由编码智能体驱动(Kimi、GLM、Minimax 发布后,开源模型终于能驱动编码智能体了);四月 OpenClaw 起飞后,连非开发者也能把难题交给模型长时间自动完成,单用户用量出现约 5 倍的跃升,整体则从年初以来涨了 150 倍 。上下文窗口也从 128K 涨到了开放模型的百万以上 。
周期还会来吗?发布节奏在加快
主持人问:2024 年初微调自定义模型火过一阵又退潮,这次是周期还是长期趋势?Jeff 的回答有点反直觉:开源模型的发布节奏正越来越快——以前大约六个月一次,这个夏天 DeepSeek Flash 已经迭代了三次。
这让「自己训练模型」更难跟上,但工具也在变好,让想微调的团队能跟得上 。而如果前沿实验室因为安全问题放慢脚步,开源模型还在持续变强,差距只会继续缩小。
值得一提的是安全测试这个独特用例:闭源前沿模型会拒绝帮你对产品做渗透测试,而 Hugging Face 上能找到专门训练来做这类攻击的开源模型。企业采用开源模型最大的障碍其实不是来源,而是安全和治理——「根据我们与客户交流的经验,无论在欧洲还是美国,如果你能解决安全方面的问题,采用源自中国的模型实验室是完全可行的」。
零日发布的「消防演习」,以及 OS 隐喻
模型发布越来越快,Ollama 制定了一套「成功的零日模型发布」行动手册:确保模型在你常用的推理引擎里被支持、速度达标(这通常要数周);为模型找到合适的 harness(测试框架/调用框架)并配套好;保证云端容量充足,因为零日往往是增长最大的一天;还要和 NVIDIA、Apple Silicon 等合作把硬件层调快。幸运的话能提前几周拿到模型,但很多工作是在发布前最后 24 小时才凑齐的——「通常是一场消防演习」。
Jeff 认为操作系统这个老掉牙的比喻放在这里是对的:硬件驱动、供应商、推理层、应用运行时,把这些粘合在一起是一个组合复杂度极大的问题,Ollama 的角色就是做出一个能把任何 harness 匹配到任何模型的通用运行时 。
更有意思的视角:Jensen 说过五层蛋糕(应用、模型、基础设施与推理、芯片、能源),前沿实验室第零天就为开发者把五层全备好了,这正是开源世界想重现的东西。但在模型层和应用层之间,「有太多构建机会在今天的技术栈里是被隐藏的」——知识接入、智能体协调、沙箱执行。
Jeff 认为这些层一定会被拆分出来变成独立公司:云计算的历史已经证明,开发者最终偏好每一项都用最佳单品,而不是 Heroku、Google App Engine 那种全捆绑 。哪些东西永远不会下沉进模型?有状态的东西——存储、凭证、安全工具,因为模型训练再频繁也不可能是最新数据 。
稳态:大部分 token 走开源,最难的任务留给前沿
企业预算在闭源和开源之间会怎么分?Jeff 的判断:企业内 80%-90% 的 token 会走开源模型,但因为开源把成本打下来了,可能只占预算的 10%-20%。
「你的大部分 token 会通过开源模型」——这会在其上启用一大批新用例,因为 token 丰裕了,你只会给团队越来越多的访问额度 。最难的任务留给前沿实验室,中间大量问题则是开源与闭源协同——就像 AWS 的 DynamoDB 和 Postgres 被客户结合使用一样常见;也像律师事务所:合伙人(前沿模型)负责调度,助理律师(开源模型)干逐项的活 。至于所有实验室共同的立场,「就是如何服务客户」,路由决策最终由客户做主 。
本地复兴:GB300 放桌上,编码循环回到毫秒级
Ollama 从本地起家,编码智能体的需求目前明显在云端,但 Jeff 认为它会回到本地——因为硬件在追上来。新一代设备跑 200 亿到 400 亿参数的模型非常出色,有时能到 1200 亿,而且一台「商店里第二低内存的 MacBook」就够了。
NVIDIA 的 DGX Spark 放在桌上提供 128 GB 统一内存,还有极快的网络链路,可以像迷你数据中心机架一样堆叠起来跑更大的模型;Apple 这边则有非常成熟的 MLX 技术栈,两者从 Ollama 的测试看都很有竞争力。Jeff 觉得这会是「个人桌面的一场很酷的复兴」——GitHub Copilot 那种毫秒级自动补全的体验会回到桌面上,本地和云端最终一起用。他还提到一个细节:很多银行、工业企业的每个工程师桌上本来就放着 NVIDIA 工作站 GPU,有的有数万台——这些硬件本来是为 CAD 买的,现在能免费跑模型了。
一个扎眼的对比:在本地模型端,美国和中国的模型不分伯仲;而在云端托管模型上,被消费的基本是 100% 的中国模型。「基本上,我们需要更多美国实验室来做大模型」,NVIDIA 的 Nemotron Ultra 是第一波回应。NVIDIA 的策略也很有趣——护城河不是卖 token 或开软件业务,而是大量开源、扶持生态,反过来巩固硬件领先地位 。
下一战:极致效率与 Flash 模型
年初开源模型追平了智能前沿(「我们可能落后前沿闭源模型不到三个月」),下一个要解决的就是极致效率。DeepSeek Flash 这类新模型每 token 成本和每任务成本都超低,对 80% 的任务足够好用、又快又便宜——Jeff 认为这类模型会最先实现「无限 token」:像 ChatGPT 一样,你根本不用想自己用了多少 。
而且便宜的小模型能被链式编排起来协同完成任务,产出大模型级别的结果,这对初创公司是新的机会带。关于「上帝模型」的争论,他的立场务实:大多数客户用例中,模型到了「足够好」的某个水平就会被持续使用,不必去够最强的模型;但确实存在只有最强模型才能解锁的用例 。Kimi 在网页开发上一度成为最好的模型,说明这已经不是差距问题,而是正面对抗 。
地缘政治怎么处理?Jeff 说客户分两类:一类不在乎模型来自哪、只在乎在哪运行;另一类非常在乎来源——不只是安全,还有模型的「说话方式」。
最重要的裁判标准是端到端可审视:数据从哪来、是什么造就了这个模型。至于是不是有「被设陷阱」的中国模型,他想不出任何已知案例;而且财富 500 强的 IT 安全团队对此早有经验——一个普通应用有数千个开源依赖,供应链投毒这件事「已经存在几十年了」,模型只是更不透明一点,但它是确定性的,做正规安全筛查大体可解 。
站在油井上之前:两年的荒野与两周的转向
Ollama 的故事对创业者可能最有价值。Jeff 和联合创始人 Michael(滑铁卢大学的室友)之前在 Docker 做了 Docker Desktop,懂得什么叫好的开发者体验——但「公司头几年其实一直在寻找:用这项能力到底该解决什么才是正确的问题」。
2021 年冬申请 YC 时的想法是「Docker Desktop for Kubernetes」,后来又做过一次从未公开谈过的转型(桌面开发者安全)。两年里团队超过 10 人却看不到北极星,「真的很吓人」。
转折来自一次自我审视:我们是前 VMware、前 Docker 的人,我们知道怎么让东西跑起来——于是决定给自己两周发布 Ollama 第一版。正好 Llama 2 在两周结束时发布,他们就顺势上线了。
「在那之前是两年,说实话,过度思考客户、产品,就是没有把东西推出去。」
之后的故事:成为最快冲到 10 万 GitHub star 的项目之一,比 Docker 和 Kubernetes 快得多;从 Reddit 上的爱好者起步,大约 18 个月就覆盖了 85% 的财富 500 强——关键在于开放模型免费上手、随处可跑、不需要请示许可,这对爱好者有利的东西,恰好也完美适配企业内的开发者。变现等到了今年:Ollama 直到年初才靠 Ollama Cloud 收钱,但团队凭 Docker 时期的伤疤,知道要小心「不思考变现的文化」,更知道最大的风险是把客户当作「互联网上的一个模糊团块」——必须见到他们、弄清他们的需求 。至于 2022 年 A 轮找 Benchmark 融资时(那还是 DALL·E 的日子、ChatGPT 之前),路演靠的并不是当时在做的「为 Kubernetes 解决 SSO」,而是「人本身,以及我们为什么存在」——投资人 Peter 从 Docker 时期就认识他们,看到的是立身之本,不是当时碰巧在解的那个问题。
最后一个观点,关于旧经验哪些失效了:上一代 PaaS 时代说「你建在别人之上的一层很脆弱」,在 AI 世界完全不成立——往上层走反而更好,因为离客户更近;系统世界要求一切确定、经过验证,而 LLM 从定义上就是不确定的,这是特性不是缺陷;还有,有了 AI,很多问题不再需要大规模投入人手。「从 2000 年代的基础设施 1.0、2010 年代的云计算,到现在的 AI 领域,有很多规则都被打破了。」而模型和服务商过剩的时代,新的稀缺是策展——把它们整合成真正能用的东西 。
本集带走
- 开源模型已成企业主力,且比例还在涨:AT&T 已把 40% 的 token 消耗转到开放模型;Jeff 预判企业内 80%-90% 的 token 最终走开源,但只占预算 10%-20%,省下的钱会催生更多新用例。
- 「每任务成本」比「每 token 成本」更值得盯:DeepSeek Flash 这类模型对 80% 的任务足够好、又快又便宜,是最先走向「无限 token」的一类;把多个便宜模型编排协同,能产出大模型级别的结果。
- 最难的任务留给前沿模型,其余走混合路由:像律所合伙人分派活给助理律师,像 DynamoDB 配 Postgres——开源与闭源协同是稳态,不是替代。
- 采用中国开源模型的真障碍是安全治理,不是来源:有已知「后门」案例为零;供应链投毒是几十年的老问题,正规安全筛查大体可解。安全测试(渗透测试)反而是开源模型的独特优势场景。
- 别过度思考,给自己两周把东西推出去:Ollama 前两年换了多个方向、看不到北极星,两周冲刺加 Llama 2 发布才引爆——「过度思考客户、产品,就是没有把东西推出去」。
- 开源项目起飞后的两个陷阱:形成不思考变现的文化;把客户当互联网上的模糊团块。要持续见客户、弄清需求。
- 本地硬件正在复兴:DGX Spark(128 GB 统一内存、可堆叠)和 Apple MLX 都已能高效跑 20B-120B 模型,毫秒级编码补全体验会回到桌面。
成本是到目前为止最大的痛点,开放模型可以介入并解决。
Cost is by far the largest pain point that open models can jump in and solve.
—— Jeffrey Morgan · [02:18]
在模型层和应用层之间有太多构建机会,它们在今天那种五层蛋糕技术栈里是被隐藏的。
There’s so many opportunities to build between the model and the application layer that are kind of hidden in today’s, you know, five layer cake stack.
—— Jeffrey Morgan · [13:51]
所以总的来说,存储数据是一个非常巨大的问题空间,我认为它永远不会下沉到模型层。
So generally storing data is like a huge problem space that I don’t think will ever make its way down into the model layer.
—— Jeffrey Morgan · [17:21]
绝大多数的 token——这是我们的看法——在企业内部会是开源模型,比如说 80%、90%。
The super majority of tokens, and this is our take, it will be open models within a business, call it 80, 90%.
—— Jeffrey Morgan · [18:19]
我认为对大多数客户用例来说,模型会在某个水平上变得足够好,然后他们可以继续使用那个水平的智能。
I think for most customer use cases, there’s a level at which a model becomes good enough, and then they can continue using that level of intelligence.
—— Jeffrey Morgan · [32:26]
你把你的用户群和客户群,把你的客户,当作互联网上的一个模糊团块,这是一种非常危险的看待客户的方式,因为你想见到他们,弄清他们的需求。
you consider your user base and customer base, like your customer, just a blob on the internet, which is a really risky way to think about customers because you want to meet them, figure out their needs.
—— Jeffrey Morgan · [49:26]
所以这种策展——当模型和服务商充足的时候,如今稀缺的是把它们整合成能用的东西。
So this curation and, you know, when there’s a abundance of models and providers, now there’s a scarcity in bringing that together into something that works.
—— Jeffrey Morgan · [56:50]
顺着「智能体」挖下去
- 每块 GPU 多付 10 万美元插队:Speechify 创始人的算力账与战略悔棋同公司:NVIDIA · 同概念:GPU、推理 (inference)、智能体 (agent)
- 「智能是数据的派生物」:Fireworks 创始人 Lin Kuo 的专用智能宣言同公司:NVIDIA、OpenRouter · 同概念:token、推理 (inference)、GPU
- Mayfield 管理合伙人 Navin:AI 投资的泡沫数学与蓝海打法同公司:NVIDIA · 同概念:GPU、推理 (inference)、智能体 (agent)
换个口味
- Ed Zitron:生成式 AI 是一场万亿级骗局同公司:NVIDIA · 同概念:GPU、token、推理 (inference)、智能体 (agent)
- AI 投资泡沫的崩盘剧本:为什么万亿美元建数据中心注定亏钱同公司:OpenRouter · 同概念:GPU、token、推理 (inference)
- 黄仁勋:AI毁灭论是胡说八道,自由贸易让美国必赢同公司:NVIDIA · 同概念:开源模型 (open models)、智能体 (agent)
