Stanford AI Index 报告十大要点速览

2026-08-30
听中文精华AI 合成朗读00:00
超过 90% 的著名前沿模型是在 2025 年生产的,其中几个现在在许多方面达到或超过了人类基准
— Daniel Whitenack

关联

这一集是 Practical AI 播客的两位主持人 Daniel(Prediction Guard 的 CEO)和 Chris(首席 AI 研究工程师)快速过一遍 Stanford 发布的 AI Index 报告——这是一份每年更新、数据驱动的 AI 行业全景扫描。最反直觉的一点:AI 模型能在国际数学奥林匹克拿金牌,但读模拟时钟的准确率只有 50.1%

AI 能力没有见顶,反而在加速

报告头一条就纠正了一个流行误解:AI 能力并没有高原化(plateau),而是在加速。超过 90% 的著名前沿模型是 2025 年产出的,其中不少在多项任务上达到或超过人类基准

不过 Daniel 也提醒,基准测试本身有缺陷,不能完全当真。与此同时,五分之四的大学生已经在用生成式 AI,Daniel 回想自己五年博士生涯,觉得用现在的工具至少能砍掉一半时间 。Chris 也说自己在工作中,以前算一个研究项目的工作量,现在一周就能搞定

中美模型性能差距已基本抹平

第二点是中美 AI 模型性能差距已实质性地闭合,不再是”领导者-追随者”关系,而是两个共同领导者 。Daniel 从实操角度补充:在开源模型这边,中国明显领先;但闭源前沿模型那边,美国仍有优势,所以不能简单说中国模型全面超越

Chris 指出一个结构性变化:美国在顶层开源上其实在退步——Meta 已经转向完全闭源,而中国大力拥抱开源。这意味着东方大规模用开源模型、西方用闭源模型,这种地缘分裂的后续影响值得观察

基础设施与人才的隐忧

美国拥有最多的 AI 数据中心,但多数芯片依赖单一台湾代工厂制造 。更触目惊心的是人才数据:过去一年,搬到美国的 AI 研究者和开发者数量下降了 80%

Chris 认为这跟移民政策等政治因素直接相关 。不过 Daniel 也指出,现在小团队就能做出大营收,加上远程办公常态化,公司即使在美国拿 VC 的钱,实际干活的工程师也未必在美国

锯齿状前沿:能拿金牌,不会看表

报告用”锯齿状前沿”形容 AI 的能力分布:Gemini DeepThink 在国际数学奥林匹克拿了金牌,但读模拟时钟只有 50.1% 的准确率 。Chris 把这归结为现有模型本质上是语言模型,缺乏对真实世界的理解——Jan Lecun 多次呼吁需要”世界模型”(能对生活中所有事物建立真实语境的模型)

Daniel 则提了另一个角度: Claude 对他 ClickUp 里的工单一无所知,但接上 Claude Code Skill 后就什么都知道了。所以问题不光在模型本身,还在于模型有没有”身体”——有没有连接真实世界的工具和接口

机器人:受控环境很强,家里不行

机器人仍然在大多数家庭任务上失败,哪怕在受控环境(比如工厂或软件仿真)里表现优异 。Daniel 去过芝加哥的餐饮展会,发现做菜的”机器人”本质上就是个加热的滚筒,跟想象中的人形机器人切寿司差得远 。Chris 认为中国在机器人(包括无人机)上积累更久、优先级更高,可能领先美国一个台阶

安全治理严重滞后

负责任的 AI 没有跟上能力发展的步伐,安全基准滞后,AI 事件急剧增加 。Daniel 提到他们之前请过 Sean MacGregor 聊 AI 事件数据库,记录在案的事件已经很多,没记录的更多

有意思的是 Chris 从国防行业角度说:恰恰因为联邦法规的约束,国防领域的 AI 护栏和负责任 AI 努力,可能比大多数商业行业都多 。Daniel 预测,未来一年会看到”可输出的证明”成为审计和认证(比如 SOC 2 或 AI 专项认证)的组成部分,市场会倒逼企业重视

入门级岗位在消失,但学习方式也在变

AI 带来的生产力提升,恰恰出现在入门级就业开始萎缩的那些领域 。Daniel 直说:现在不可能靠写 SQL 查询拿到初级开发岗了

但他认为工具也能帮新人更快上手——比如公司内部有自己写好的代码技能库,新人接上就能跑,加速成长 。Chris 以自己学 Rust 为例:用 Claude Code 不光让模型写代码,还让它解释为什么这样写、有哪些选择,把 AI 当学习伙伴而不是单纯替你干活,这样学得更快

正规教育没跟上,但全民在学

80% 的高中和大学生用 AI 处理学业,但只有很小比例的老师制定了相关的使用政策 。Chris 的女儿是 AI 工具重度用户,但期末考试不带工具照样全 A——关键是用 AI 来学,而不只是用来交差

有趣的是,Chris 的母亲(八十多岁退休的技术人员,早年做过老派 AI)喜欢在 Photoshop 里手工修图,Chris 说服到一半就停了——因为那是她的爱好,享受过程本身,不一定非要让 AI 替她做 。Daniel 补充:自酿啤酒的人也不会因为商店有更好的就停手,但如果在公司里坚持手写信不用邮件,那就行不通了 。区分爱好和工作场景,是关键。

报告还提到但没展开的几点:AI 环境足迹在扩大、科学 AI 模型超越人类科学家但更大不等于更好、AI 在改变临床护理但严谨证据有限、AI 主权成为国家政策特征、AI 专家和公众对未来看法差异很大

本集带走

  • AI 能力没有高原化,在加速:90% 以上的著名前沿模型是 2025 年出的,别信”瓶颈论”。
  • 中美模型性能差距已闭合:但结构上分化了——中国走开源、美国走闭源,这种分裂的长期影响要关注。
  • “锯齿状前沿”是理解 AI 能力的关键概念:能拿 IMO 金牌不等于会看表,语言模型缺的是对真实世界的连接,不只是模型参数的问题。
  • 入门级岗位在消失,但工具也能加速新人成长:别只让 AI 替你干,让它解释为什么这么做,当学习伙伴用。
  • 安全治理严重落后于能力:AI 事件在激增,“可输出的证明”很快会成为企业审计的硬要求。
  • 区分爱好和工作场景:爱好享受过程就不必强上 AI,工作中有生产力预期就不用 AI 就不行了。
全部金句 6 条

超过 90% 的著名前沿模型是在 2025 年生产的,其中几个现在在许多方面达到或超过了人类基准
over 90% of notable frontier models were produced in in 2025, and several of those now meet or exceed human baselines on a number of things
—— Daniel Whitenack · [04:06]

Gemini DeepThink 在 IMO 上获得金牌,但只能在 50.1 的时间内准确地读取模拟时钟。
Gemini DeepThink getting the gold medal at the IMO, but only being able to read an analog clock 50.1 of the time in terms of accurately.
—— Chris Benson · [12:36]

一个孤立的模型对你没有多大好处。你必须与那个世界有连接
a model a model in isolation doesn’t do you a whole lot of good. You’ve gotta have that connection with the world
—— Chris Benson · [15:36]

实际上我认为人们会在国防行业感到惊讶,我们的行业周围可能比大多数商业行业有更多的护栏和负责任的 AI 努力。在美国这里有联邦法规禁止某些事情,而在商业领域人们为了安全问题可能只是激增并去做。
I actually think people would be surprised in the defense industry that there is probably more guardrails and responsible AI efforts around our industry than most commercial industries. There are federal regulations here in The US that prohibit certain things that in the commercial space people might just surge and go do in terms of safety issues.
—— Chris Benson · [22:38]

就在去年,AI 研究人员和开发人员搬到美国的数量下降了 80%
there’s been an 80% decline just in the last year in terms of the number of AI researchers and developers moving to The US
—— Daniel Whitenack · [28:11]

你再也不可能通过编写 SQL 查询来获得初级软件开发职位了。
There’s no way you can get a junior software dev position writing SQL queries anymore.
—— Daniel Whitenack · [38:27]

接着看

顺着「智能体」挖下去

换个口味