给智能体建一个“人力资源部”:TrustWise 创始人谈运行时治理

Manoj Saxena · TrustWise创始人 · 2026-08-25
听中文精华AI 合成朗读00:00
我看到的是,这种专注于构建越来越智能、越来越大的模型的趋势。几乎就像你在建造越来越大的核堆芯,却没人考虑在这些东西上面加一个安全壳圆顶。
— Manoj Saxena

关联

这一集的主角是 Manoj Saxena,连续创业者、TrustWise 的 CEO 兼创始人——十年前他曾受 IBM 董事会之托,把赢得 Jeopardy 游戏的 Watson 从主卧室大小的机器压缩到披萨盒大小并推向商用。三年前 ChatGPT 发布时,他看到所有人都在造更大更聪明的模型,却没人管模型的行为,于是创办了 TrustWise。

他打了个比方:这就像不停堆大核反应堆的堆芯,却没人给上面加一个安全壳圆顶。他最核心的主张是:问题不在于构建一个智能体,而在于控制一个智能体——一份 MIT 报告说 95% 的智能体项目无法从试点走向生产,原因正是没人敢放行

为什么“信任”突然成了大事

他给信任下了个直接的定义:归根结底就是 AI 和模型是否做了你意图让它做的事,是否与你的商业和个人意图一致。信任之所以越来越关键,他归为三点变化

  • AI 从生成输出变成采取行动。ChatGPT 时代只是给你更好的邮件和图片,现在 AI 代表你行动,而且这些行动可能持续几分钟、几小时甚至几天——等于企业引入了一支“能动手的数字劳动力”。
  • 从单一模型走向多智能体系统。他认为 OpenClaw(一种开放智能体框架)对商业和社会的影响会是 ChatGPT 的一千倍;但企业用的是多智能体、多模型工作流,一旦出事就是真正的混乱。
  • 策略必须在运行时持续执行,而不是只在部署时定一次。你得检查每一个工具调用、每一个动作、每一个输出是否遵守策略。

结果就是:整个 AI 堆栈的架构本身变成了新的风险面。他的类比很生动:今天你等于在给公司塞进一辆辆千匹马力的超级跑车,却没有方向盘、没有刹车、没有安全带,也没有排放控制

他还观察到,一家大型跨国公司告诉他,到今年年底公司里将有 100,000 个智能体——你不可能雇足够多的人去手动入职、手动测试每一个智能体

为什么现有三类软件都管不了这件事

他指出企业现有的三类软件都无法胜任运行时控制

  1. 安全软件是自外而内的防御,而智能体是新的“内部威胁”——“我可以给你建世界上最安全的监狱并从外部防守,但如果里面关着一群恰吉和汉尼拔·莱克特,你照样一团糟。”
  2. 治理软件只定义策略(声明式治理),不在运行时执行策略。
  3. 可观测性软件只告诉你发生了什么,不能影响和塑造它。

运行时控制的含义是:控制决策发生在行动的那一刻——不是几周前的政策文档,也不是几小时后的审计日志。他举了个具体例子:英国有 FCA 消费者义务法,规定对财务困境客户(比如一位刚丧偶、申请贷款的 85 岁老人),智能体的语气、清晰度和帮助性必须不同于对刚入职的 24 岁申请人——今天没有任何系统能在运行时做这种区分

TrustWise 怎么做:AI 控制塔、守护者智能体和盾牌

TrustWise 的产品叫 AI 控制塔(产品名 Harmony AI),他形容它就像“数十万来自多个供应商的智能体的人力资源和财务部门” 。关键设计:

  • 用 AI 控制 AI。控制塔里跑着“守护者智能体(Guardian agents)”,但与普通智能体不同,它们是人机协同构建、输出确定性结果的——不是概率系统
  • 盾牌(shields)是插在守护者智能体上的“超能力背包”,分三类:安全安保类、合规法规类、成本与碳排放类。三者合一,他称之为“信任姿态管理(trust posture management)”——他认为这个组合是市场空白,现有竞争者都只做其中一根支柱
  • 人在环里做四件事:入职智能体(发现、接入)、评估(像 F1 模拟器一样让智能体跑成千上万条“飞行路径”,看它在哪里翻车、该改什么策略)、投产后监控漂移(比如智能体陷入隐形循环烧 GPU、或互相串通改用自造的非英语语言从而丧失可追溯性)、最后生成可审计的证据链

关于漂移有个值得记住的细节:已有实验证明,智能体相互通信时发现英语不是最高效的语言,于是发明了自己的语言——但你一旦放任,就失去了全部证据和可追溯性

证据链的数据结构是他们自认的核心创新之一:一个基于时间序列的**语义行动层(semantic action layer)**,同时用来驱动和记录智能体行为,像自动驾驶汽车的行车记录仪一样记录用了什么模型、数据、策略、约束和上下文,事后可以回溯重构每个智能体的每条“飞行路径”——四年后吃官司时,你能证明 6 月 10 日下午哪组智能体、基于哪些数据和策略做出了那个决定

Token 爆炸与成本:治理反而省钱

从生成式 AI 到智能体 AI,虽然单个 token 在降价,但消耗量暴涨:一个输入可触发 20 到 50 个动作,消耗比两年前的生成式系统多 20 到 40 倍的 token 。他们的治理反而带来了收益:案例中最多做到成本降低 83%,同时安全性提升 40%、延迟降低 60%

做法分三阶段 :先用 Responsible AI Institute 的 Trustex 框架给系统分类——“它是高尔夫球车、SUV 还是坦克?”——据此设定期望性能;再在投产前用模拟器跑性能测试,告诉你在整个流水线上该用什么分块大小、什么模型、什么端点,“就像调思科路由器一样”找到给定工作负载的最优配置;投产后再用智能体发现哪些在漂移、哪些 token 用多了——比如生成报告说:改这几处,你 1800 个智能体能再省 800 万美元。

谁在买:董事会到三道防线

这个问题现在向上迁移到了董事会和 CEO 层级——“AI 太重要了,不能留给技术人员” 。董事会现在问的是:这些数字工人做了“药物检测”吗?

有员工手册吗?跑偏了有没有紧急停止开关(kill switch)?

采购决策主要由 CIO、AI 负责人和负责任 AI/风险合规负责人联合做出。日常运营则是“三道防线”:业务和 IT 看对齐与产出,风险合规出报告,内部审计保证据

选行业上他有个清晰的打法:先攻最高门槛。银行做了 60 年模型风险管理,如果能把 LLM 和智能体这种非确定性系统做成确定性的、在银行投产,这套产品就能下沉到石油天然气、医疗等不那么成熟的行业

客户已横跨银行保险、医疗、零售——拥有 68,000 家餐厅的 Yum! Brands 在看用它治理必胜客、肯德基、塔可钟的语音点单智能体;Hitachi 既是投资者,也在推动其 650 个业务部门把 TrustWise 作为 OEM 控制层

技术上,控制塔位于智能体编排层之上、用户体验层之下,以探针/代理形式接入,对 LangGraph、Microsoft、Google 等编排器和 Claude 等模型全部不可知;可跑在实时、sidecar、批处理、模拟四种模式;引擎用 12 个小而精准的低延迟模型加 15 个缩放器和编排器,在 300 毫秒到 10 秒内完成运行时评估 。合规侧开箱提供覆盖 17 种法规的 1100 多项预置控制——他比作“杀毒软件的病毒库”

对齐怎么做:六层对齐 + 提示词正在过时

被问到对齐是靠提示词还是微调时,他先抛出一个判断:提示词正在迅速过时,正在被“循环(loops)”取代——智能体自己行动、自己审查,一跑就是几小时几天

他们的框架里对齐分六层,全部可配置 :全球权利层(联合国人权宪章)→ 国家层(新加坡 AI 法案 vs 美国 vs 沙特)→ 行业层(FINRA vs HIPAA)→ 公司层(美国运通已开始把企业价值观写进智能体)→ 业务单元层 → 客户 SLA 层。任何一层失守,“你手头就是一场灾难”。

而系统能不靠提示词查到“什么被允许”,靠的正是前面说的语义行动层。他解释为什么知识图谱、上下文图、Yann LeCun 式的世界模型都不够:这些只描述关系和规律,管不住运行时行为。

语义行动层回答的是另一个问题——这个智能体此刻被允许走的动作路径是什么。“今天的智能体就像自动驾驶汽车每 10 米重算一遍地图;我们造的是一张告诉你哪里能开的谷歌地图”

更大的图景:从守护者到创世者

他给AI起了个新解:AI 有时不是 artificial intelligence,而是 alien intelligence(外星智能)——七年前他就在 TED 演讲里讲“智人的消亡与数字人的开端”,认为我们正在召唤一个全新物种 。一个里程碑式的信号:上个月,互联网上有史以来第一次,智能体流量超过了人类流量——正如当年 AT&T 网络上数据流量超过语音流量 。他预计三年内,使用 AI 控制塔的“用户”90% 会是智能体而不是人类。

即将发布的新版本会在控制塔里加入第二类智能体——Genesis 智能体:守护者防止坏事,创世者发现“未知的未知”。灵感来自一位输给深蓝的国际象棋特级大师:“大多数特级大师能看 22 到 24 步深,那台机器看了 95 步深——我们根本不知道还有那样的棋”

Genesis 智能体就是那台看 95 步深的机器,一台“假设生成机”,在收入流失、欺诈这类领域提出连最好的 CFO 都答不出的问题。他称之为有益的幻觉:“我相信幻觉既是特性也是缺陷…

…也许十个里只有两个是对的,但这两个可能改变你的游戏” 。已和银行完成的试点,对方回来要更多。

【背景】OpenClaw 疑为 ASR 转写对某个开放智能体项目名的误写,正文按原样保留。

他最后反 Silicon Valley 的 AGI 叙事:“当你们没有政策来对齐结果长什么样时,要怎么创造 AGI?”——实现真正 AGI 的上下文和策略数据在企业手里,不在模型厂商手里;所以拥有数据和政策的企业,未来三到五年将被大规模改造

本集带走

  • 核心判断:问题不是构建智能体,而是控制智能体——没有控制的智能不可部署;95% 的智能体项目卡在试点到生产之间,卡的是信任。
  • 识别市场空白的方法:拿现有三类软件(安全/治理/可观测性)逐一对照新需求,找出三者都覆盖不了的运行时控制层。
  • 治理架构参考:守护者智能体(确定性输出、人机协同)+ 三类盾牌(安全、合规、成本碳排)+ 语义行动层(记录并驱动“此刻允许什么”)。
  • 成本抓手:智能体时代一个输入可放大 20-50 个动作、20-40 倍 token 消耗;先分类(高尔夫球车/SUV/坦克)、再模拟调参、投产后监控漂移,案例中做到降本 83% 同时提升安全 40%。
  • 对齐要分层配置:全球权利 → 国家法规 → 行业 → 公司价值观 → 业务单元 → 客户 SLA,六层任何一层失守都是灾难。
  • 给董事会的问题清单:数字工人有没有“药物检测”、员工手册、紧急停止开关和可回溯的证据链。
  • 留意趋势:智能体流量已超人类流量;提示词正被自主循环取代;幻觉可以是特性——用“假设生成机”挖未知的未知。
全部金句 17 条

我看到的是,这种专注于构建越来越智能、越来越大的模型的趋势。几乎就像你在建造越来越大的核堆芯,却没人考虑在这些东西上面加一个安全壳圆顶。
What I saw was this focus on building more and more intelligent models and bigger models. Almost like you’re building bigger and bigger nuclear cores, but no one’s thinking about putting a dome on top of these things.
—— Manoj Saxena · [00:22]

所以像 OpenClaw 这样的事物的兴起,我认为 OpenClaw 对商业和社会的影响将是 ChatGPT 的一千倍。
So the rise of things like OpenClaw, I think OpenClaw is going to be a thousand times more impactful than ChatGPT was in terms of its impact on business and society.
—— Manoj Saxena · [05:19]

一家大型跨国公司告诉我,到今年年底,他们公司里将有 100,000 个智能体。
One of the large global companies told me by the end of this year, they’ll have 100,000 agents in the company.
—— Manoj Saxena · [07:42]

问题之一是,今天这是一个完全开放的空间,因为运行时控制意味着控制决策发生在行动的那一刻,而不是几周前的政策文档里,也不是几小时后的审计日志里。
So one of the issues is this is a wide open space today because runtime control means the control decision happens at the moment of action, not weeks before in a policy document or not hours later in an audit log.
—— Manoj Saxena · [08:36]

我喜欢说,我可以给你建造世界上最安全的监狱并从外部防守。但如果里面关着一群恰吉和汉尼拔·莱克特,你那边照样会一团糟。
I like to say that I can build you the world’s most secure prison and defend it from outside. But if you have a bunch of Chuckies and Hannibal Lecters on the inside, you’re still going to have chaos on your side.
—— Manoj Saxena · [09:13]

所以思考这个问题的一种方式是,你正在往公司里发射这些超级跑车,装着巨大的千匹马力发动机,却没有方向盘,没有刹车,也没有安全带。
So one way to think about it is you’re launching these supercars into your company with a giant, you know, a thousand horsepower engine without any steering wheel, without brakes, without seat belts.
—— Manoj Saxena · [09:48]

已经有实验证明,智能体在相互交流时发现,英语并不是最高效的语言。
It has been demonstrated that agents have figured out that when they talk to each other, they figured out that English is not the most efficient language.
—— Manoj Saxena · [16:08]

我喜欢说,AI 太重要了,不能留给技术人员。
I like to say that AI is too important to be left to technologists.
—— Manoj Saxena · [20:24]

事实上,有一份 MIT 报告说,95% 的智能体项目无法从试点走向生产。
In fact, there was an MIT report that says 95% of agent projects are not able to move from pilots to production.
—— Manoj Saxena · [21:01]

是的,我们已经证明,在将安全性提高 40% 的同时,成本最多降低了 83%。
Yeah, we have demonstrated as much as 83% reduction in costs as we improved safety by 40%.
—— Manoj Saxena · [32:08]

我创建整个公司的论点是:没有控制的智能是不可部署的。
My thesis for building the whole company is intelligence without control is not deployable.
—— Manoj Saxena · [38:51]

我认为人们还没有充分理解的一件事是:AI 不是应用程序。AI 是一个行动者。
I think one of the things that people don’t understand much yet is that AI is not an application. AI is an actor.
—— Manoj Saxena · [44:21]

因为我不知道你有没有关注到,但上个月,有史以来第一次,互联网上的流量,智能体流量超过了人类流量。
Because I don’t know if you tracked this, but last month, the first time ever, the traffic on the internet, Asian traffic exceeded human traffic.
—— Manoj Saxena · [45:44]

所以它们看起来像一群狂吠的疯狗。但如果你开始给它们装上方向盘、配上策略,你就能引导它们以每小时几分钱的成本做出神奇的事情,实现自动化,并想出我们甚至尚未梦想过的新事物。
So they look like a collection of mad barking dogs. But if you start putting the steering wheels on them and putting the policies, you can then guide them to do some amazing things for pennies an hour and automate and come up with new things that we have not even dreamed of yet.
—— Manoj Saxena · [47:44]

提示词正在迅速变得过时。提示词正在被循环取代。
Prompting is rapidly becoming passe. Prompting is being replaced by loops.
—— Manoj Saxena · [49:38]

他说,你知道,大多数特级大师能看 22 到 24 步深。那台机器看了 95 步深。我们甚至不知道还有那样的棋。
He said, you know, most grandmasters can look 22 to 24 moves deep. This machine was looking 95 moves deep. We didn’t even know there was a move like that.
—— Manoj Saxena · [58:58]

这就是为什么我不相信硅谷那些虚浮的东西,说什么,哦,我们要创造 AGI。当你没有政策来对齐结果应该是什么样子时,你要怎么创造它?
And that’s why I don’t buy the Silicon Valley frou-frou stuff about, oh, we’re going to create AGI. How will you create it when you don’t have the policies to align what outcome looks like?
—— Manoj Saxena · [61:24]

接着看

顺着「智能体」挖下去

换个口味