基准测试 (benchmark)
集里怎么说它
- 《Braintrust CEO Ankur Goyal:做 AI 评估的纪律八年不变,但玩法正在剧变》(03:08起):本集说 MMLU 已完全是个毫无意义的东西,模型发布时晒性能柱状图『全是营销,背后几乎没有什么科学依据』,有些公司的评估模型根本没法运行。
- 《10亿收入不到100人:数据公司 Surge AI 如何逆行塑造 AI 未来》(19:54起):本集被强烈批判的概念;嘉宾认为现有基准测试要么本身有错,要么因有明确答案而易被模型「爬山优化」,与现实世界脱节,正在带偏 AI 发展。
- 《桥水内部版 AI 分析师 PAT:把数小时研究压到几分钟》(16:14起):本集把它说成:让智能体变得可靠的必要手段;通过开发人类审核的基准(包括故意制造预期会失败的基准),不断迭代上下文以让智能体爬山式地改进。
- 《主导投资 Anthropic 的人:风投的游戏规则已经彻底变了》(35:26起):本集说连它都加了成长期载体,「泳道」概念已经消失;Matt 的 A 轮基金之选
- 《把数据中心搬上太空:StarCloud 的万亿美元硬科技突围》(00:52起):本集提及领投了 StarCloud 1.7 亿美元融资的投资机构,因其极其看重该团队的工程实力而决定投资。
- 《让非工程师也能下指令:Superconductor 的多人智能体协作法》(13:25起):本集把它说成:不能只信公开基准,而应在自家的真实代码库上,拿代表优秀工程水准的 PR 让不同智能体去跑,以此得到质量、成本与时间的细分数据对比。
- 《模型路由为什么还没解决:Amazon Nova 负责人的实话》(11:57起):本集说基准是给外界看信号的,比如’这个模型在迁移或 Web 应用上还行’,但非常窄、现实里未必适用;SweeBench 去年是标准,转眼模型就冲到 90% 不再有区分度
- 《Legora:三个非律师如何造出法律AI操作系统》(13:02起):本集提到 Legora 融资时最终与风险投资公司 Benchmark 合作,对方投资了 951 万美元。
- 《Ollama CEO:开源模型正吃掉企业 80-90% 的 token》(38:59起):Ollama 2022 年(ChatGPT 之前)的 A 轮投资方;本集讲当时路演靠的是团队本身和立身之本,而非当时在解的 Kubernetes SSO 问题。
- 《Arena CEO:现实是唯一可信的裁判,开源正在改写规则》(06:28起):本集对它大加批评:模型「全都是针对测试去训练的」,自造基准会饱和(进了训练数据就失效),「基准测试能吸引注意力」;现实才是唯一可信的裁判
① 提到它的金句
4 条
我认为有很多它表现不太好的情况,但我觉得如果你把 LLM 当裁判的用途从一个基准重新定义为一个异常检测器,那它其实是可以的。
指向原始笔记的链接
Well, I think there’s a lot of cases where it doesn’t work very well, but I think if you reframe the utility of an LLM as a judge from being a benchmark to being an anomaly detector, then I think it’s actually okay.
—— Ankur Goyal · [25:10]
那些基准测试不代表你的工作负载。正如我们之前说的,AI 的边界是参差不齐的——某个模型可能在基准测试上做得很好,但这并不必然意味着它对你的工作负载也会做得很好。
指向原始笔记的链接
They don’t represent your workloads. And as we said earlier, the boundary of AI is jagged, right? So although a certain model might do very well on a benchmark, it doesn’t necessarily translate into that it will do very well for your workloads as well.
—— Chetan Gupta · [38:19]
不应该是某个自以为聪明的家伙随便搞出来的什么破基准测试。
指向原始笔记的链接
There shouldn’t be some random f**ing benchmark that’s made by some dude that thinks they’re smart.*
—— Anastasios Angelopoulos · [06:28]
当我们做基准测试时,它们在代码评审上是超越人类的。
指向原始笔记的链接
When we benchmark them, it’s like they’re superhuman in code review.
—— Tibo Sottiaux · [47:53]
② 出现在这些集
10 集
- 《Braintrust CEO Ankur Goyal:做 AI 评估的纪律八年不变,但玩法正在剧变》 — 作为概念(提及)
- 《10亿收入不到100人:数据公司 Surge AI 如何逆行塑造 AI 未来》 — 作为概念
- 《桥水内部版 AI 分析师 PAT:把数小时研究压到几分钟》 — 作为概念
- 《主导投资 Anthropic 的人:风投的游戏规则已经彻底变了》 — 作为被讨论公司(提及)
- 《把数据中心搬上太空:StarCloud 的万亿美元硬科技突围》 — 作为被讨论公司(提及)
- 《让非工程师也能下指令:Superconductor 的多人智能体协作法》 — 作为概念
- 《模型路由为什么还没解决:Amazon Nova 负责人的实话》 — 作为概念(提及)
- 《Legora:三个非律师如何造出法律AI操作系统》 — 作为被讨论公司(提及)
- 《Ollama CEO:开源模型正吃掉企业 80-90% 的 token》 — 作为被讨论公司
- 《Arena CEO:现实是唯一可信的裁判,开源正在改写规则》 — 作为概念
③ 关联
点进去有真内容 —— 本页主要出口
智能体 · Anthropic · OpenAI · 评估 · ChatGPT · Claude Code · 开源 · OpenRouter · NVIDIA · Codex
