Chip Huyen:别追 AI 新闻了,真正提升 AI 产品的是这些事

Chip Huyen · 2026-08-13
听中文精华AI 合成朗读00:00
我就会说,好吧,如果改进不多,那你为什么要花那么多时间去辩论那些对你的性能没有多大影响的事情?
— Chip Huyen

关联

很多团队不断追问「如何跟上最新 AI 新闻」「该选哪个技术栈」——但 Chip Huyen 拿出的对比清单很扎心:人们以为能提升 AI 应用的,是追最新动态、换框架、纠结数据库;而真正提升应用的,是和用户交谈、准备更好的数据、优化端到端工作流、写更好的提示词 。如果你纠结的两个技术方案对最终性能影响很小,就不值得花大量时间去辩论

预训练、后训练与「采样」被低估的力量

模型本质上是在编码语言的统计信息:模型读了海量数据后,就能基于已输入的内容,预测下一个最可能出现的词(token,介于字符与词之间的语言单位)预训练(Pre-training)用大规模数据提升模型的「通用能力容量」;但如今大家面临的瓶颈是,互联网上的高质量文本数据已经基本被耗尽,各家实验室获取的预训练数据高度同质化 。因此,真正拉开差距的战场转移到了**后训练**(Post-training)。

后训练的一种常见方式是**监督微调**:让专家写出高质量的问答范例,或者让已有的大模型生成答案,再训练小模型去模仿(这个过程也叫蒸馏)。另一种方式是强化学习,通过收集信号来奖励模型的正确输出。信号可以是人类反馈(让人类在两个回答中做相对比较,比打绝对分数更容易),也可以是可验证的奖励(比如做数学题,答案等于特定数值才算对)

此外,采样策略(决定模型是永远选概率最高的词,还是选一些概率稍低但更有创意的词)是一个能极大提升性能、却被极度低估的杠杆

评估(Evals):不是写不写,而是投资回报率

围绕评估(evals,指衡量 AI 产品表现的方法)有个争论:有些顶尖公司主张凭感觉(vibe check),有些则追求严密测试。Chip Huyen 给出了非常务实的判断框架:算投资回报率 。如果你的产品已经运转、用户在增长,抽调两名工程师花大量时间写评估,可能只把指标从 80% 提升到 85%;但如果把同样的精力用来上线一个全新功能,收益往往大得多 。所以,非核心功能做到「足够好」就行。但如果你在运营大规模业务、出错会带来灾难性后果,或者产品本身就以准确率为核心竞争力,那你就必须对评估极其严苛

评估的数量也没有标准答案,核心是「覆盖度」。比如评估一个深度研究应用,你不能只看最终报告。

你要拆解它的每一步:它生成的搜索查询够多样吗?抓取的网页有重叠吗?

有相关性吗?每一步都需要不同的评估方法

RAG 的最大性能提升不在选数据库,而在数据准备

RAG(检索增强生成)就是为模型提供相关的外部上下文来辅助回答 。很多人在 RAG 上纠结该用什么向量数据库,但 Chip Huyen 观察到,决定答案纯质量的最大因素是**数据准备**(当然,如果你对延迟有极致要求,数据库依然重要)

具体怎么做数据准备?

  • 切块设计:文档切块不能太长(否则抓取不到足够多样的上下文),也不能太短(导致每个块信息量不足)

  • 改写文档格式:有人直接把播客内容重写成「问答(Q&A)」格式,大幅提升了检索效果

  • 为 AI 加注释:人类专家看文档有常识和上下文,但 AI 没有。

比如文档写着某个参数输出是 1 或 -1,人类懂尺度,AI 却不知所云。加上一层专门给 AI 看的注释,能让它真正理解信息

公司引入 AI:生产力难衡量,人才结构剧变

企业内部引入 AI 工具(比如编码智能体)最大的痛点是很难衡量生产力 。Chip Huyen 经常抛给管理层一个问题:你是宁愿给团队买很贵的编码智能体订阅,还是多招一个人头(head count)?基层主管往往选人头,因为扩充编制对他们在组织内的成长更有利;但高管会选 AI 助手,因为他们更关心实际的业务指标

【背景】head count 指企业正式员工的招聘名额/编制。

不同水平的工程师从 AI 工具中的获益也不同。一家公司做了随机试验:把工程师分为高、中、低三档,只给各组一半人使用编码工具 Cursor

结果发现:表现最好的高级工程师获益最大(因为他们最懂如何解决问题,能把 AI 当作无限兵力的初级工程师);表现最差的人则完全无感 。不过也有公司反馈,资深工程师恰恰是最抗拒 AI 的群体,因为他们对代码标准更有主见 。为此,有公司直接重组了工程团队:让高级工程师专注写规范、把关代码审查;让初级工程师和 AI 产出代码

但 Chip Huyen 指出,系统思维(理解各个组件如何协同工作、全局定位问题根源)是 AI 难以替代的核心能力。她举了自己部署应用时的例子:AI 遇到报错,只会不停地在代码、环境变量、语言之间盲目试错;但真正的问题其实是她所在的付费层级不支持该功能——AI 缺乏跳出局部、审视全局系统的能力

接下来会发生什么:界限模糊、推理计算与多模态

未来几年组织结构会大改:工程、产品、营销等原本泾渭分明的职能会打通(因为评估需要同时懂架构和用户),大量非核心的外包职能会被 AI 自动化替代 。同时,基础模型那种跨代际的狂飙突进可能会放缓,真正的提升将来自后训练阶段和应用构建

一个非常关键的趋势是**测试时计算**(test time compute,指把更多算力花在让模型做推理和生成上,而不是花在训练上)。比如面对一个数学题,让模型生成四个答案,做「多数投票」;或者让模型在给出最终答案前,先生成更多「思考」的内容。基础模型本身没变,但花更多算力去探索和思考,就能得到好得多的结果

面对工具,却不知道该造什么?

很多团队手握能写代码、做设计的强大 AI 工具,却陷入了「想法危机」——不知道该构建什么 。Chip Huyen 的实用建议是:花一周时间关注自己的日常工作,留意那些让你感到沮丧、烦躁的瞬间,问一句「这事能不能换个方式做?」。解决自己的小痛点,就是学习和应用 AI 最好的切入点。

本集带走

  • 别陷入技术选型的陷阱:如果两个技术方案对最终性能影响很小,就不值得花时间去辩论。先评估「最优方案」与「非最优方案」的差距到底有多大。
  • 后训练与采样策略更重要:预训练数据已被耗尽,真正拉开模型差距的是后训练;同时,调整采样策略(权衡最高概率与创意)能极大提升性能且经常被忽视。
  • 评估(eval)看投资回报率:不是所有功能都要写严密评估。非核心功能做到「足够好」就行;但如果是高风险的大规模业务或以准确率为卖点的核心功能,就必须严苛对待评估。
  • RAG 的核心是数据准备:别纠结向量数据库。重点应放在:合理设计切块大小、将文档改写为问答格式、为 AI 补充人类常识性的注释。
  • 重组工程团队:适应 AI 时代的做法是,让资深工程师专注系统架构设计与代码审查,让初级工程师与 AI 负责产出代码。
  • 用系统思维破局:AI 在处理定义明确的局部任务时很强,但在跨组件排查故障时容易盲目试错。全局理解系统如何协同运作,是无法被替代的能力。
  • 用「测试时计算」提升效果:同样的基础模型,如果在推理时生成多个备选答案进行投票,或让它生成更多思考过程,就能显著提升最终表现。
  • 从日常沮丧中找点子:不知道用 AI 做什么?观察自己工作中最让人烦躁的小痛点,造个小工具解决它。
全部金句 4 条

我就会说,好吧,如果改进不多,那你为什么要花那么多时间去辩论那些对你的性能没有多大影响的事情?
I was like, Okay, if it’s not much improvement, then why do you want to spend so much time debating something that doesn’t make that much difference to your performance?
—— Chip Huyen · [06:10]

所以我认为采样策略是极其重要的。它可以让你以巨大的方式提升性能,而且非常、非常被低估。
So I think my sampling strategy, I think is something extremely important. It can have you boost a performance in a huge way and very, very underrated.
—— Chip Huyen · [12:40]

在某个时刻,我们在互联网数据上实际上已经有点达到极限了。
At some point, we are actually have kind of maxed out on the internet data.
—— Chip Huyen · [14:58]

在这个中间过程中,既然每个人都有非常相似的预训练数据,那后训练就是如今他们做出大差异的地方。
where like post-trading, but middle course of this is more of everyone have very similar pre-training data, is that post-training is where they make a big difference nowadays.
—— Chip Huyen · [15:10]

接着看

顺着「智能体」挖下去

换个口味