Arena CEO:现实是唯一可信的裁判,开源正在改写规则
关联
这一集聊的是 Arena——整个 AI 行业都盯着它回答一个问题:到底哪个模型最好?主角是联合创始人兼 CEO Anastasios Angelopoulos,一个从伯克利统计学家、理论机器学习博士生走出来的创始人。他最初把 Chatbot Arena 当作「一个副项目的副项目」在 Soda Hall 地下室里做出来,如今这家公司今年 6 月年化收入达到 1 亿美元、估值 17 亿美元。
钩子是收入速度:1 亿美元年化收入只花了八个月,公司从 15 到 20 人涨到 75 到 80 人。但 Anastasios 说得更直白:「我们也不知道目标是什么,因为我们一直在超越它。」
核心理念:现实是唯一可信的裁判
Arena 的起点是一个观察:模型在 MMLU 这类选择题基准上表现好的,往往不是用户真正爱用的那个——因为「它们全都是针对测试去训练的」。所以他信奉一条理念:「现实是唯一一个你真正能信得过的裁判。」
他对学术圈自造基准的批评相当不客气:「不应该是某个自以为聪明的家伙随便搞出来的什么破基准测试。」 基准测试为什么泛滥?
「因为基准测试能吸引注意力。」而用户根本不知道什么模型对自己的任务表现最好。他举了「鹈鹕骑自行车」这个曾经风靡 Twitter 的 SVG 基准测试当反面教材——如今连这种测试都饱和了,因为它进了训练数据。
不只是排行榜:是一家数据公司
Arena 起步是 battle 模式:输入一个 prompt,得到两个回答,用户选哪个更好。但他坦承,历史最大批评是「人类偏好实在是模型质量的一个不完整信号」——人们投票时并不核查事实,还可能投给印证自己偏见的答案。
所以他们在很大程度上放弃了以 battle 为主要信号,现在最重要的信号是任务完成率:你的活儿干完了吗?再加上可控性、幻觉率、事实性。
事实性用自动化流水线测:提取模型的所有事实性断言,塞进一堆搜索模型去网页找证据支持或推翻。他们还捕捉隐性反馈——用户反复换着问法重问(查询重构)、点下载、合并 PR,「每一次交互都是一条反馈」。
用户画像也出乎意料:28% 是软件工程师,17% 科学家,15% 金融,6% 法律,6% 医疗——是一群知识型工作者,不只工程师。
商业模式上,公开排行榜「从来不涉及钱」,当作公益运营;收费的是与实验室合作:实验室一周有 50 个模型检查点(checkpoints,训练过程中的中间版本),Arena 在代表真实使用的数据上评估,交回洞察仪表盘。「这就是把我们规模做到超过一亿美元收入的产品。」下一步是把同样的方法塞进每家企业,帮它们搞清哪个模型最适合自己的员工和用户、以及如何在性能与成本间权衡。
开源与中国的「翻转时刻」
他认为行业最大变化是闭源与开源模型之间的「相变」。Kimi 在他们的网页开发 Arena 上排第一,是「第一次看到对蒸馏叙事的违背」——「蒸馏叙事」指「中国之所以能跟上,唯一的原因是他们在蒸馏美国的智能」。
而「如果他们排第一而美国排第二,这怎么可能是真的?」网页开发不是小类别,「大部分经济价值都来自这里」。
他的判断:「我认为美国人还没有充分认识到来自中国科学家的智慧和创造力。」我们正在进入中美之间的「翻转时刻」(flippening)。
开源榜上的差距有多夸张?纯开源模型里美国最接近的是 Thinking Machine,只能排第 10——「上面有九家中国的」,而且因为新模型发布,「现在可能更多了」。
为什么美国落后?他的归因是商业模式:花 50 亿美元训练一个前沿模型然后免费送出去,「听起来像个蠢主意」,中国公司因不同的公司动态可以这么做,美国公司不行。
现在两条变现路径:一是带营收门槛的「半开源」许可证(产品营收超 2000 万美元就要分成);二是拿开源当打入企业的楔子,围绕它做 AI 现代化业务。他还预测:「会有针对开放模型的严厉监管」——监管俘获几乎必然,但一线希望是美国因此会做出自己的开源模型,因为「我们绝对需要美国的开源」。
他做多什么、做空什么
看空 API 层的锁定:「Anthropic 的收入在 API 上一路爆棚……
但来得容易,去得也容易。」花那么快花的钱,不可能没有切换供应商的能力。
「如果一个开源模型能以 10% 的成本完成 90% 的工作——未来几年完全可能发生——我认为这是相当结构性的问题。」
看多两件事:OpenAI 的消费者广告市场(「至今没被充分开发利用,但仍是 AI 领域最大的机会之一」——能年化做出数千亿美元收入的生意,世上只有广告和伟大的硬件寥寥几类);以及应用层公司——开源把服务成本砍掉 80-90% 后,毛利率问题缓解,「价值会继续往栈的上游走」。被叫了多年「套壳(wrappers)」是「一种非常偷懒的描述方式」。
对「模型整合论」的回应:每周都有人问,「而现实总是相反的」——AI 改变每个行业,带来的是百花齐放,「我们的生意如果只有一个模型提供商就很糟……我们想要 10 个,我们想要 50 个」。
最糟的一天
创业低谷撞上了人生低谷:种子轮「投资条款书要来了」的阶段,岳父在塞尔维亚心脏病突发去世,他放下一切飞过去,葬礼两天后就开始打电话谈判。妻子几个月里每天哭,后来变成两天一次、四天一次,如今偶尔哭,「她说,我记得我爸爸,但我开始忘记我爸爸了」。
几周后又遭遇 MIT、Stanford 等机构联署、背后有 Cohere(当时约排第 70 名)的《Leaderboard Illusion》论文,指控 Arena 偏袒闭源模型——「感觉像被人在背后捅了一刀」。他说妻子花了很久才原谅他把公司放在优先位置,「可能因为她是对的,那些决定确实不全都合理」。
接下来
两个优先事项:一是智能体——进入智能体后评估对象不只是模型还有 harness(智能体的执行框架,含子模型、子智能体的多组件系统),他们在 arena.ai/agent 上把编排器和 harness 随机化以收集交互效应,还做了一年路由器(router,自动帮你选最合适的模型),「路由器现在火了,但我们早就在这局游戏里了」;二是把这套「自我改进的数据飞轮」复制进每家企业,帮它们建自己的路由器、避免供应商锁定、拿到 AI 主权。他对自己的定位一句话:「我把 Arena 视为价值系统…
…整个游戏的关键就在于选择正确的价值系统,而我们的价值系统是对真实的人有用。」
本集带走
- 评估基准的病根是「为测试而训练」:自造的小基准会饱和(进了训练数据就失效),人类投票又只是不完整信号。更可靠的信号是任务完成率、查询重构次数、文件下载是否真被使用、PR 是否被合并这类真实使用痕迹。
- 开源在网页开发等高价值类别已能登顶,「中国只靠蒸馏美国智能」的叙事被排行榜打破;美国纯开源最强也只排第 10,上面有九家中国模型。
- 开源冲击下的格局判断:API 锁定未必存在,「90% 的活、10% 的成本」是结构性威胁;价值可能向应用层转移,OpenAI 最大的未开发金矿可能是消费者广告。
- 排行榜是公益、评估才是生意:公开榜单免费做信任,向实验室卖开发期的检查点评估与洞察仪表盘,这就是 1 亿美元收入的来源。
- 高速增长的用人逻辑:人员不必随营收线性扩张,只在合同、基础设施等产品需要处补人——八个月内 15-20 人涨到 75-80 人,撑起 1 亿美元年化。
那是因为它们全都是针对测试去训练的。所以我们有一个理念:真正重要的是现实。现实是唯一一个你真正能信得过的裁判。
That’s because they all trained to the test. And so we had this philosophy that it’s really about reality. Reality is the only judge that you can actually trust.
—— Anastasios Angelopoulos · [03:35]
不应该是某个自以为聪明的家伙随便搞出来的什么破基准测试。
There shouldn’t be some random f**ing benchmark that’s made by some dude that thinks they’re smart.*
—— Anastasios Angelopoulos · [06:28]
它通过提供效用来衡量效用。关键在于,用户激励和平台激励完美一致,因为我们是在试图衡量效用。
It’s measuring utility by providing utility. The point is that the user incentive and the platform incentive are perfectly aligned because we’re trying to measure utility.
—— Anastasios Angelopoulos · [09:06]
人们就是没理解到,AI 因为会改变每一个行业,所以会带来百花齐放。
People are just not understanding that AI, because it transforms every industry, is going to lead to many flowers blooming.
—— Anastasios Angelopoulos · [04:48]
但我认为现在开始出现的头号事情是闭源模型和开源模型之间的相变。
But I think the number one thing that’s starting to happen now is there’s a phase shift between closed and open models.
—— Anastasios Angelopoulos · [13:19]
你知道,我认为美国人还没有充分认识到来自中国科学家的智慧和创造力。
You know, I don’t think Americans are fully appreciating the intelligence and creativity that’s coming from Chinese scientists.
—— Anastasios Angelopoulos · [14:24]
我要花 50 亿美元训练一个前沿模型,然后我就这么把它免费送出去。听起来很蠢,对吧?
I’m going to spend $5 billion training a frontier model and then I’m just going to give it away. Sounds stupid, right?
—— Anastasios Angelopoulos · [17:01]
如果有两个,我们也只是勉强撑着。我们想要 10 个。我们想要 50 个。
And if we have two, we’re barely making it. We want 10. We want 50.
—— Anastasios Angelopoulos · [45:01]
顺便说一句,我看多的一件事是 OpenAI 上的消费者广告市场,这显然至今还没有被充分开发利用,但我认为它仍然是 AI 领域最大的机会之一。
By the way, one thing I’m long is the consumer ads marketplace on OpenAI, which has obviously not been fully utilized to this day, but I think remains one of the biggest opportunities in AI.
—— Anastasios Angelopoulos · [40:27]
我知道它们在很长一段时间里被称为套壳(wrappers)。而且我认为这一直是一种非常偷懒的识别这些公司或描述这些公司的方式。
I know they were called wrappers for a very long period of time. And I think that’s always the very lazy way of… You know, identifying these companies or describing these companies.
—— Mamoun Hamid · [43:22]
胜率接近 100%。而且顺便说一句,要让人们在任何事情上达成一致几乎是不可能的。
It was nearly a 100% win rate. And by the way, it’s almost impossible to get people to agree on anything.
—— Anastasios Angelopoulos · [38:57]
而整个游戏的关键就在于选择正确的价值系统。我们的价值系统是对真实的人有用。
And the whole game is about picking the right value system. And so our value system is a utility to real people.
—— Anastasios Angelopoulos · [58:30]
顺着「创业与行业」挖下去
- NVIDIA 962亿美元季度背后:智能体时代的资本与生存法则同公司:Anthropic、OpenAI · 同概念:开源模型 (open source)、智能体 (agent)
- 从 Hugging Face 到中国药企:NVIDIA 的开源终局与 AI 制药的未来同公司:Anthropic、OpenAI · 同概念:开源模型 (open source)、智能体 (agent)
- 解散会议前一个月上线 Bolt:一夜从 50 万到 550 万美元 ARR同公司:Anthropic · 同概念:开源模型 (open source)、智能体 (agent)
换个口味
- Codex 负责人亲述:OpenAI 内部如何造编程智能体同公司:OpenAI · 同概念:开源模型 (open source)、智能体 (agent)
- 开源贡献的真正门槛:不是代码,是认知负荷同概念:开源模型 (open source)、智能体 (agent)
- 当 AI 变成黑客武器:给企业智能体修防火墙同公司:Arena · 同概念:智能体 (agent)
