Anthropic 零信任框架:智能体安全的六层防御

2026-08-30
听中文精华AI 合成朗读00:00
可能目前 90% 以上拥有 AI 部署的组织、企业并没有按照这个模式运作。他们根据这个框架,会完全暴露。
— Daniel Whitenack

关联

Anthropic 发布了一份安全框架文档,主题是「面向 AI 智能体零信任」。说这话的是 Daniel,他是 Prediction Guard 的 CEO,和联合主持人 Chris——一位有国防和情报背景的 AI 安全研究工程师——一起逐块拆解了这份框架。最值得注意的一点是:Daniel 估计,目前 90% 以上已经部署了 AI 的企业,如果按这个框架去衡量,是完全暴露的

背景很简单:企业不管是为了提效还是为了防守,都不可避免地要引入自主智能体(不需要人手动触发、自己调工具、自己执行操作的程序)。但攻击者同样能用这些能力,而且利用速度从过去按月算缩短到了按秒算——光靠人根本跟不上,所以你不得不用智能体来防智能体 。问题变成了:你自己放的智能体也可能干坏事,怎么管?

零信任不是新概念,但智能体让老方法不够用了

传统网络安全是「周边式」的:信任网络内部的一切,防外部。零信任反过来——假设威胁已经在网络内部,每个用户、设备、请求都视为潜在威胁,不做认证授权就不信

这个概念本身不新,NIST 在 2020 年就出了《零信任架构》文档。Chris 说在国防和情报领域这已经是核心思路:每个 API 请求都必须带安全凭证,细粒度到具体操作

但智能体把事情变复杂了。它们用分布式工具集、跨会话保持上下文、多智能体之间还能互相通信——这种动态性是传统零信任模型没预见到过的。Anthropic 引了两个术语:爆炸半径(智能体出问题时能造成多大破坏)和**最小主观能动性**(OWASP 提出的概念,从「最小权限」延伸过来——只给智能体完成其任务所需的最少操作能力,不多给)

六类威胁:从提示词注入到记忆投毒

框架列了六类当前对智能体系统的威胁:

提示词注入和指令操纵。直接的比如在聊天框里输「忽略你的指令做这个」,这算基础的。

更难防的是间接注入——比如智能体连着你的邮箱,附件里藏了隐藏指令。Daniel 举了个例子:他帮一家公司设计技术面试题,故意在 PDF 里用白字写了和黑字指令相反的内容,结果用 Claude Code 做题的人如果没发现,智能体就会执行那些隐藏指令

工具和资源滥用。智能体通过 MCP(一种让智能体调用外部工具的协议)连接各种服务。

问题在于,你可能只告诉智能体某几个 API 端点,但没有在网络层关掉其他端点——智能体自己去看 Swagger 文档就能发现你没告诉它的路由,然后越权调用 。Chris 补充说,恶意 MCP 服务器的概念已经被记录在案,针对这类漏洞的恶意软件正在成批出现

身份和特权滥用。智能体经常用服务账户运行,权限偏高;而且智能体可以在运行时动态派生出新的智能体,新智能体可能继承或获得超出它所需的权限 。Chris 指出,一个智能体很容易生成另一个权限过高的子智能体,然后被利用

供应链和依赖风险。智能体在运行时可能动态加载外部工具、安装包、改基础设施——供应链在实时变化。

而且模型本身有供应链(权重、训练方式、是否容易被越狱),MCP 服务器也是软件组件,有自己的依赖和漏洞 。Chris 强调,传统的所有漏洞——从 BIOS、CMOS 一直到网络和防火墙——在这之上全部仍然适用

记忆和上下文投毒。如果你对写入智能体记忆或向量数据库(存检索增强生成数据的一种数据库)的内容没有控制权,智能体或外部方就能往里面塞东西。Daniel 举过一个医疗场景:先让智能体处理患者 A,再逐步让它把「患者 A 等于患者 B」这个信息过滤进去,之后查患者信息时就会拿到不该拿的数据

RAG 投毒。和上面类似,但针对的是检索增强生成用的数据源,本质也是往智能体的信息源里掺东西。

分层防御:六个维度,三个等级

框架把防御措施按六个维度展开,每个维度分三个等级——基础(最小可行)、企业(真正健壮)、高级(高风险/强监管环境)。这里挑几个关键的说:

智能体身份和认证——这是所有其他能力的基础,没有身份就没法执行后面的任何策略 。基础做法是给每个智能体实例分配唯一的加密标识符(不是贴个标签,而是有加密材料支撑),从创建到退役全程追踪,ID 出现在所有日志和访问请求里。

企业级是带完整生命周期管理的证书认证。高级是硬件支持的身份——把凭证存在硬件安全模块里,配合远程认证 。Chris 解释了硬件绑定凭证的意思:你必须物理上拥有一件硬件(比如 USB 密钥)才能通过认证,攻击者拿不到这个物理东西就过不了这一层

访问控制和特权管理——有了身份之后,授权层要强制执行「最小主观能动性」。但 Daniel 指出一个微妙之处:你可能在指令里只告诉智能体某几个端点,但如果没有在网络层物理关掉其他端点,智能体自己能发现并用上那些你没授权的路由 。基础做法是基于角色的访问控制(RBAC)加默认拒绝。

可观测性与行为监控——这两个是配对的。可观测性解决「智能体干了什么」:你需要一条完整的链路追踪——哪个用户用哪个 API 密钥触发了哪个智能体、它发了什么提示、调了什么工具、输入是什么、被哪条策略拦了 。行为监控则判断这些动作「该不该发生」:看到某种行为模式就触发响应——可能是阻断、可能是记录、可能是告警

输入验证和输出控制——这是最常被想到的,但 Daniel 认为它被过度强调了。他打了个比方:量体温不等于你就有健康的生活方式、有家庭医生、有饮食计划——点检查只是门槛,不是全部

完整性和恢复——前面的预防和检测都假设智能体正常运行,那不正常了呢?Chris 指出这其实是个大难题:如果智能体脱轨了,而且它正在执行关键业务,你不能只是把它关掉,关键业务还得继续跑——怎么把系统回滚到安全状态,在智能体场景下比以前难得多 。框架建议基础级至少要有文档化的回滚流程,高级级要做到带自动修复的自愈系统

落地路径和思维转变

框架给了一个分阶段实施顺序:识别需求 → 管理供应链风险 → 定义智能体边界 → 防御提示词注入 → 保护工具访问 → 保护智能体凭证 → 保护智能体记忆

Chris 总结了一个核心思维转变:传统零信任是相对静态的,像监管合规一样逐项打勾;但智能体系统具有涌现性,能力是动态产生的——你需要把同样的零信任理念从静态思维升级为「预测动态能力」的思维

Daniel 提到 Anthropic 文档里的一个哲学级转变——AI 供应商化:与其依赖可能脆弱的第三方开源项目,不如让智能体编码系统直接生成一个你专有的版本纳入你的项目,从根源上消除第三方依赖风险

但他也承认一个没解的难题:当利用时间线从月缩短到秒,你不能指望半夜叫醒安全主管来批准关停某个智能体——人类做遏制决策的速度可能根本跟不上 。Chris 的判断更直接:这是网络安全领域的一场革命,全球情报机构和犯罪组织都在学怎么利用这些漏洞,我们还在起点

【背景】NIST 指美国国家标准与技术研究院;OWASP 是一个专注于软件安全的开源社区项目,其 Gen AI 项目专门关注生成式 AI 安全问题;MCP 全称 Model Context Protocol,是 Anthropic 推出的让 AI 模型连接外部工具和数据源的开放协议;RAG 即检索增强生成,是一种让大模型在生成回答前先从外部数据库检索相关文档的技术;CISO 是首席信息安全官的缩写。

本集带走

  • 给每个智能体实例分配加密身份:不是贴标签,是用加密材料支撑的唯一标识符,出现在所有日志和访问请求中,这是所有其他安全措施的地基。
  • 最小主观能动性必须落到网络层:只在提示词里告诉智能体「你能用这几个端点」不够——如果网络层没关掉其他端点,智能体自己能发现并越权调用。
  • 可观测性要能串完整链路:用户 → API 密钥 → 智能体身份 → 目标 → 提示内容 → 工具调用 → 输入 → 治理策略结果,缺一环就谈不上监控。
  • 输入输出检查只是门槛,不是全部:就像量体温不等于有健康管理方案,点检查不能替代身份认证、访问控制、行为监控这些系统性措施。
  • 回滚方案必须提前文档化:智能体脱轨时关键业务不能停,到时候再想怎么恢复就晚了——基础级至少要有写好的回滚流程。
  • 警惕间接提示词注入:邮件附件、PDF 白字、文档隐藏文本都是载体,任何智能体能读到的外部内容都可能夹带指令。
全部金句 4 条

可能目前 90% 以上拥有 AI 部署的组织、企业并没有按照这个模式运作。他们根据这个框架,会完全暴露。
Probably 90% of plus of of organizations, enterprises that have AI deployments currently are not operating according to this model. They are according to this framework, they would be completely exposed.
—— Daniel Whitenack · [12:02]

一个智能体很容易派生出另一个智能体,并且它拥有比它所需的更多的特权,然后那个可以被利用。
It’s very easy for one agent to spin off another agent, and and it has more privilege than it needs, and then that can be taken advantage of.
—— Chris Benson · [22:06]

你只能告诉智能体这些端点,但如果你没有物理上关掉其他端点的网络或什么的,就没有什么阻止那个智能体在这种情况下脱轨。
You could only tell an agent about these endpoints, but if you haven’t physic like, if you haven’t literally shut off the network for other endpoints or something, then there’s nothing preventing that agent from, like, going off of the off of the rails in that case.
—— Daniel Whitenack · [34:40]

如果事情发展得如此之快,我只是认为人类很难,如果你的基础设施中正在发生某事,并且利用时间表从几个月到几小时到几分钟到几秒。你不能只是依靠在半夜叫醒 CISO 来批准关闭这个东西。
If things are moving so fast, I just think it’s gonna be hard for humans to, you know, if if something is happening in your infrastructure and exploit timelines go from, you know, months to to hours to minutes to seconds. You can’t just, like, rely on waking up the CISO in the middle of the night to approve, you know, shutting this thing down.
—— Daniel Whitenack · [44:41]

接着看

顺着「AI 安全」挖下去

换个口味