Stripe 内部公司大脑 Kai:让上万人放心把工作交给智能体的治理术

Sharadh Krishnamurthy · Stripe 工程经理 · 2026-09-07
听中文精华AI 合成朗读00:00
更难的问题在于如何大规模地复刻一家公司的运作方式。
— Sharadh Krishnamurthy

关联

这一集聊的是一件很多大公司都在琢磨的事:怎么让全公司上上下下、不只是工程师,都敢放心地把日常工作交给 AI。主角是 Sherrod,Stripe 的工程经理,他和同事 Anupam 一起构建了 Kai——Stripe 的「公司大脑」和内部公司智能体

最颠覆的一点是:Kai 现在每周有超过 10,000 名 Stripe 员工在用、公司 86% 以上的人都是它的用户,但维护它的核心团队不到 10 个人。而最初做出第一个版本,只花了「一个半工程师」两周时间。Sherrod 的核心主张是:让 AI 触达每个人,难点根本不在技术,而在治理——「更难的问题在于如何大规模地复刻一家公司的运作方式」,关键不是提供 AI,而是「提供正确的治理结构,让每个人都可以放心去使用 AI,并知道它会为他们做正确的事」

项目(Projects):一个治理单元,而不只是聊天分组

大多数团队用「项目」来归拢文件和对话,Stripe 却把它做成了配置层和治理层——这是 Sherrod 认为他们「多下了功夫」的第一件事。

一个项目就是一圈边界:有人(通常是这个领域的 DRI,即直接负责人)来决定这个工作流里 AI 该用哪些工具、哪些数据、什么默认模型、多少安全控制。项目大到 500 人,小到 5 个人都有。

比如可以在项目层面设默认模型,不让「这个工作不需要超级模型」的任务烧昂贵的 token 。people 团队甚至有一个完全独立、后端全安全加固的 Kai 版本项目

Sherrod 的理念是:「我们应该尽量减少每天必须主动做出这些选择的人数,它应该自动为他们做正确的事」。少数懂成本、性能、延迟权衡的人搭好台子,其他人直接用。

项目还能接自定义智能体——不一定是 Kai 默认那个,可以换成完全定制的后端 API 和 harness,用同一套功能 。用他的话说,Kai 看起来像一个单一产品,「它其实不是。它就像多层蛋糕上面的一层糖霜」,每一层都可以按企业需求定制

数据智能体:三层分诊 + 被暴力砸也不垮的仓库

Stripe 几乎人人用 Kai 做的第一件事,是创建数据仪表板。背后靠的是 Ask Data 技能的一套「三层分诊」:先找现有的报告和直接产物,不行再下到官方认可的分析层(blessed analytics layer,即把公司最关键指标统一管理的那一层)找正确的查询,实在没办法才落到数据目录、自己写查询

这套东西原本是给人类设计的,但对智能体同样关键——因为「它们能回答问题,但它们完全不知道那是不是正确的查询或正确的表」

另一条不太性感但致命的经验:数据仓库必须扛得住高并发查询,因为「一旦拿不准,智能体就会直接暴力破解」。Stripe 用 Trino(一个分布式 SQL 查询引擎)做查询层,长期投入让它极具韧性,「这些投入让智能体可以疯狂地猛砸它而不会把它砸垮」

他们还做了「智能体身份」——在基础设施里声明「这是一个智能体、它在干什么」,以此做优先级和负载卸载 。代价也是真实的:「事实证明,智能体只是把你所有的故障模式都调到了最大」,早期确实有智能体失控、差点搞挂核心系统,好在及时发现并加固了

主持人 Claire 由此给出一个反直觉的建议:想让 AI 交付更多产品?不是去优化产品开发流程,而是「把你 DevEx 团队的规模翻一倍。

把你数据团队的规模翻一倍」。AI 之前为人类效率做的平台投入,就是智能体时代的杠杆

技能平台:从一次会话到全公司可复用的工作流

Kai 的第二个亮点是把「技能」做成了一个平台,而不只是一个技能创建器。流程是:你在 Kai 里迭代出一个好用的仪表板后,让内置的 skill creator 把这次会话学到的东西打包成一个标准开放规范的技能,可以私有保存,也可以发布给全公司

真正的魔法在检索。编码智能体在仓库里干活,有天然的目录层级可以挂技能;但企业员工的工作横跨五六个系统,没有层级可言。所以 Stripe 投入做了技能的打包与检索——你只说「给我调出最新的采纳情况仪表盘」,Kai 就能自动加载几秒前刚创建的那个技能

规模上来后,质量和数量成了一件事:「对这类系统来说,质量和数量是分不开的,因为上下文就是一切」——塞进太多低价值上下文,结果只会变差 。Stripe 大约有 2000 个技能,其中约 50 个被全公司每天重度使用,另有 100-150 个长尾技能由局部团队使用,还有一堆只有两三个人用的——遥测数据会告诉平台方哪些该提拔进通用工作流、哪些该移出去省上下文 。平台还会自动给每个技能作者发改进建议(爬山优化),Claire 还补充了别家做法:30 天没人调用的技能提醒、弃用、两周后删除

工具策略:敏感工作流里给智能体拴绳

工具策略(tool policies)是治理落到具体动作的一层。比如 HR 团队处理敏感信息:既不能禁止用工具,也不能放任智能体把敏感数据写进全员可见的公开文档。做法是在项目层面设定:某些工具直接允许、某些工具触发「人在回路」审批——智能体要创建日历邀请时,先弹出确认,人来点头

这里有个很现实的洞察:「如果你给人们设置太多摩擦,他们就会去做不安全的事情,因为人类就是这样运作的。如果我在每个会话、每个工具上都向你展示这个,最终你会按错按钮」。所以摩擦要精准——只在真正敏感的操作上要求人确认,且按项目划定范围,不全场广播。

一个半人、两周、到上万人

推广路径也够精简:Sherrod 自己业余写代码当「个人贡献者」,一个半工程师两周做出 V0——他强调「一旦我们能给人们展示一些东西,答案就变得显而易见了」,光靠嘴很难说服人为什么需要这东西 。试点阶段约 200-300 个用户,GTM 团队的 Ilia 是最早的大客户,营销团队几乎全员涌入

真正的爆点是一次全公司演示,「然后对每个人来说就豁然开朗了」。如今不到 10 人的核心团队服务每周 10,000+ 用户,靠的是编码智能体的生产力加上 AI 之前就打好的基础设施。Sherrod 也坦承:「我们非常清楚地认识到,我们处在这段旅程的最早期阶段」

本集带走

  • 治理先于功能:让全公司用 AI 的瓶颈不是模型,而是治理结构——有人替大家把模型、工具、数据的默认选择配好,普通人零决策直接用。
  • 把「项目」当治理单元:按工作流(而非按人)划边界,配置默认模型、可用工具、数据权限和人在回路审批;权限跟着场景走,不在每个会话里重复弹窗。
  • 数据智能体三件事:分层分诊(现有报告→官方分析层→数据目录)、仓库扛得住暴力查询、给智能体独立身份做限流——为人类做的数据平台投入,智能体直接复用。
  • 技能要当产品运营:让任何人把成功会话打包成可复用技能并共享,同时用遥测管理质量与数量——低价值技能占上下文,会直接拉低所有结果。
  • 摩擦要精准:安全管控加太多,人会开始绕过它;只在真正敏感的动作上要求人确认。
  • 先做出东西再说服:一个半工程师两周的 V0 比任何方案文档都有说服力。
全部金句 10 条

更难的问题在于如何大规模地复刻一家公司的运作方式。
The harder problems are in trying to replicate the way a company works at scale.
—— Sharadh Krishnamurthy · [03:41]

我们应该尽量减少每天必须主动做出这些选择的人数,它应该自动为他们做正确的事。
We should try to minimize the number of people who have to actively make these choices every day, and just it should do the right thing for them.
—— Sharadh Krishnamurthy · [09:25]

它们能回答问题,但它们完全不知道那是不是正确的查询或正确的表。
They can answer the question, but they have no idea if it was the right query or the right table.
—— Sharadh Krishnamurthy · [17:12]

这些基础性的投入,如今当你把智能体扔上去时就给了你极大的杠杆。
Our foundational investments that now give you extreme leverage when you throw agents at it.
—— Claire Vaux · [17:50]

而我说,把你 DevEx 团队的规模翻一倍。把你数据团队的规模翻一倍。投入平台建设。对人类有好处,对智能体也有好处,而这就是能让你跑起来的东西。
And I say, double the size of your DevEx team. Double the size of your data team. Like, work on platform investments. Good for humans. Good for agents. And that’s what will let you run.
—— Claire Vaux · [18:04]

智能体在搞挂你的基础设施方面非常有创造力。
Agents are very creative at bringing your infra down.
—— Sharadh Krishnamurthy · [19:26]

事实证明,智能体只是把你所有的故障模式都调到了最大。
It turns out that agents just dial up all your failure modes.
—— Sharadh Krishnamurthy · [20:10]

如果你给人们设置太多摩擦,他们就会去做不安全的事情,因为人类就是这样运作的。
If you put too much friction in front of people, they’re just going to do unsafe things because that’s how humans work.
—— Sharadh Krishnamurthy · [35:40]

而且我几乎认为,对这类系统来说,质量和数量是分不开的,因为上下文就是一切。
And I almost think you can’t separate quality and quantity when it comes to these systems because context is everything.
—— Sharadh Krishnamurthy · [41:38]

我想让智能体让我为它们工作。
I want the agents to put me to work.
—— Claire Vaux · [46:55]

接着看

顺着「智能体」挖下去

换个口味