AI 产品不能照搬软件老办法:从高控制低自主开始
关联
构建 AI 产品和传统软件最根本的两个差异,大多数团队在动手之前根本没想清楚。
第一个差异是非确定性。传统软件比如预订酒店,用户走的是你设计好的按钮和表单,路径可预测。
但 AI 产品的输入端是自然语言,同一个意图用户有无数种说法;输出端你调用的 LLM 本身就是个概率性的黑盒,对提示词措辞极其敏感。输入不可控、输出不可控、中间过程也不完全可理解——你要拿一个三面都不确定的东西,去交付一个确定的结果,这就是 AI 产品” messy”的根源,而智能体系统让这个问题更严重 。
第二个差异是主观能动性(agency)与控制的权衡。每多给 AI 一点自主决策权,你就多放弃一点控制权。问题在于,很多人直接跳到”全自主智能体”,结果要么系统做出危险决策,要么根本不可控 。
从高控制、低自主开始,逐步放权
正确做法是像训练爬山一样:不从山顶开始,从最小影响、人类全程把关的地方起步,建立信心后再逐步增加 AI 的自主权 。
以客户支持为例,分三步走:
V1——路由分类:智能体只负责把工单分到正确部门。即便分错了,人类可以立刻纠正,风险极低。这步的真正价值是暴露你企业的数据有多乱——分类法层级错乱、死节点没人维护,这些”隐藏债务”不亲自建一版你根本看不见 。
V2——副驾驶建议:路由跑稳之后,让智能体根据标准操作流程生成回复草稿,人类改完再发。这步的关键收益是你免费拿到了人类行为日志——草稿被改了什么、删了什么——直接喂进改进飞轮 。
V3——端到端处理:当草稿被采纳率很高、新错误模式趋于零时,才让智能体直接回复客户,甚至执行退款、提工单等操作 。
同样的逻辑适用于其他场景:编码助手 V1 只做行内补全,V2 生成测试让人类审,V3 才自主提 PR;营销助手 V1 起草文案,V2 跑多步Campaign,V3 才跨渠道 A/B 测试自动优化 。
判断能不能进入下一阶段的标志不是时间表,而是”意外率”——如果你连续校准一两天,没看到新的错误模式、用户行为稳定了,才适合往上走。但要注意,换了底层模型(比如从 GPT-4o 切到 5)或者用户行为本身演变了(比如开始问更深层的问题),校准就得重来 。
持续校准、持续开发(CCCD)框架
把上面的思路做成可执行的开发流程,就是 CCCD 框架,可以理解为 AI 版的 CI/CD 。
右侧——持续开发:先界定能力边界,把”期望输入长什么样、期望输出长什么样”整理成数据集。这个动作本身就有价值——你会发现团队里 PM、工程师、领域专家对”产品该怎么表现”根本没对齐。然后设定评估指标(不是”做不做 evals”,而是你想盯哪些维度),部署并跑指标 。
左侧——持续校准:上线后你会发现用户行为超出你预想的数据集范围。评估指标能抓到你已知的错误,但抓不到”涌现出来的新错误模式”。这时要做的是:分析行为、发现新模式、修复具体的 bug,同时为系统性问题设计新的评估指标,反馈回开发侧 。
关键认知:评估指标只能抓已知的错,生产环境监控才能暴露未知的错。两者都做,但不要迷信任何一个能”解决一切”——社区里”evals 万能”和”全是 vibe coding”都是错误的二分法 。
而且”evals”这个词已经被语义扩散了:数据标注公司说的 evals 是专家写错误分析笔记,PM 说的 evals 是定义产品行为,有人说的 evals 其实是跑 LM Arena 看模型排行——这些是流程里完全不同的环节 。
成功公司的三个维度
技术框架之外,能跑出来的公司有三个共性 :
领导者必须亲自动手重建直觉。Rackspace 的 CEO 每天凌晨 4 点到 6 点专门追 AI 最新动态,周末做 vibe coding,然后把问题带回来跟专家讨论。
这不是让他写代码,而是他过去 15 年积累的产品直觉在 AI 时代需要推倒重来——他必须承认自己可能是”房间里最笨的人” 。CEO 不深入,下面工程师再使劲也推不动 。
文化上要赋能,不要制造 FOMO。领域专家是 AI 产品成功的关键——你得靠他们判断 AI 行为对不对。
但如果公司氛围是”不学 AI 就被淘汰”,专家会拒绝配合,因为觉得你在取代他们。正确的叙事是”AI 让你 10 倍效率” 。
技术上要痴迷工作流,不是痴迷 AI 本身。没有一个真实工作流是”丢一个智能体进去就搞定”的。
永远是:ML 模型做一部分、确定性代码做一部分、人类做一部分。你得把工作流拆清楚,为每个子问题选对工具 。
一个判断标准:如果有人卖你”一键智能体,两三天见效”,这纯粹是营销。企业数据和基础设施太乱了,即使数据层和基础设施层都很好,替换一个关键工作流也至少要四到六个月 。
本集带走
- 从高控制、低自主起步:先让 AI 做风险最低的事(比如分类路由),人类全程把关,确认行为可控后再逐步放权,不要第一天就上全自主智能体
- 每一步都在喂飞轮:V2 副驾驶阶段让 AI 起草、人类修改,修改记录本身就是免费的训练信号——不要跳过这一步直接到 V3
- 评估只抓已知错,生产监控抓未知错:两者都要做,不要迷信任何一个能单独解决问题
- 先对齐”产品该表现成什么样”:动手前花时间把期望输入输出整理成数据集,你会发现团队内部根本没对齐
- 换模型要重新校准:底层模型变了或用户行为演变了,之前积累的校准可能全部失效
- CEO 必须亲自用:不是写代码,是重建被 AI 颠覆的直觉——领导者不深入,AI 转型不可能自下而上成功
- 四到六个月是底线:任何人承诺”一键智能体几天见效”都是营销,企业数据混乱度决定了这个周期
但每次你将决策能力或自主权移交给智能体系统时,你都在某种程度上放弃了一些你的控制权。
But every time you hand over decision-making capabilities or autonomy to agentic systems, you’re kind of relinquishing some amount of control on your end.
—— Kiriti Badam · [10:12]
在我们看到的所有这些 AI 进展中,一个容易的、滑坡式的错误就是只考虑解决方案的复杂性,而忘记你试图解决的问题。
In all this advancements of the AI that we are seeing, one easy, slippery slope is to just keep thinking about complexities of the solution and forget the problem that you’re trying to solve.
—— Aishwarya Reganti · [21:00]
但现在有了 AI,这些直觉必须重新学习,领导者必须变得脆弱去做这件事。
But now with AI in the picture, those intuitions will have to be relearned and leaders have to be vulnerable to do that.
—— Kiriti Badam · [26:20]
截至今天,这并不是关于成为竞争对手中第一个拥有智能体的公司。而是关于,你是否建立了合适的飞轮,以便你可以随着时间的推移而改进?
As of today, it’s not about being the first company to have an agent among your competitors. It’s about, have you built the right flywheels in place so that you can improve over time?
—— Kiriti Badam · [30:33]
我可能会甚至会说,如果有人向你兜售一键式智能体,那纯粹是营销。
I probably will go as far to say that if someone’s selling you one click-agents, it’s pure marketing.
—— Kiriti Badam · [31:35]
所以我觉得评估很重要,生产监控很重要,但是只有其中一个能为你解决问题的这种观点,在我看来是完全不屑一顾的。
So I feel evals are important, production monitoring is important, but this notion of only one of them is going to solve things for you that is completely dismissible in my opinion.
—— Aishwarya Reganti · [37:48]
我认为 Martin Fowler 在某个时候在 2000 年代有这个术语叫语义扩散,这基本上意味着一个人提出了一个术语,每个人都开始用他们自己的定义来糟蹋它,然后你就会失去它的实际定义。
I think Martin Fowler at some point had this term called semantic diffusion back in the 2000s, which kind of means that someone comes up with a term, everybody starts butchering it with their own definitions and then you kind of lose the actual definition of it.
—— Kiriti Badam · [39:30]
如今构建真的非常便宜。设计更昂贵,真的在思考你的产品,你要构建什么。它真的会解决一个痛点吗?什么是如今更有价值的?
Building is really cheap today. Design is more expensive, really thinking about your product, what you’re going to build. Is it going to really solve a pain point? Is what is way more valuable today?
—— Kiriti Badam · [64:53]
而你在整个组织中或你自己的生活经验中建立的那种知识,我觉得那种痛苦就是转化为公司护城河的东西。
And that kind of knowledge that you built across the organization or across your own lived experiences, I feel that pain is what translates into the moat of the company.
—— Aishwarya Reganti · [73:40]
顺着「智能体」挖下去
- PM的生存法则:AI时代别当瓶颈,去抢活干同概念:evals、主观能动性 (agency)、智能体 (agent)
- Braintrust CEO Ankur Goyal:做 AI 评估的纪律八年不变,但玩法正在剧变同概念:evals、智能体 (agent)、护栏 (guardrails)
- Anthropic 平台负责人:Claude 平台的「三层蛋糕」与给 token 分工的「策略」同公司:Claude · 同概念:evals、智能体 (agent)
换个口味
- 当写代码变便宜,OpenAI Codex负责人说「品味」成了最贵的资源同公司:ChatGPT、OpenAI · 同概念:主观能动性 (agency)、智能体 (agent)
- DevOps 之父 Patrick Debois:AI 时代组织比技术更难成熟同概念:evals、智能体 (agent)、vibe coding
- 评测优先:Braintrust 创始人谈 AI 产品开发的真正工程同概念:evals、智能体 (agent)
