AI 智能体怎么认证:从标准到红队测试的全流程

Emil Lassen · AI 承保公司的标准负责人 · 2026-08-29
听中文精华AI 合成朗读00:00
他们拥有 fantastic 的安全态势,但他们没有办法向企业证明这一点。所以一个企业永远不会信任一家有销售产品激励的公司。
— Emil Lassen

关联

这一集是 Practical AI 播客的主持人 Daniel 和 AI 承保公司的标准负责人 Emil Lassen 聊 AI 智能体的标准与认证。Emil 之前做过房地产科技公司,后来在哈佛肯尼迪学院研究新兴技术与政策,现在带着一个安全领袖组成的联盟做这件事——他说在一家正在部署 AI 的公司当安全主管,感觉就像站在冰雹风暴里,被砸中只是时间问题

标准—审计—保险:一个老飞轮

Emil 把他们在做的事追溯到一个历史模式:本杰明·富兰克林时代费城开始用电,房屋频繁着火,富兰克林做了三件事——编建筑规范(标准)、组建消防队去检查(审计)、创办第一家互助保险公司(兜底残余风险)。这个「标准—审计—保险」飞轮后来在汽车行业重演:车企自己推动安全标准(安全气囊、安全带),第三方检测,保险兜底。核电站至今也在用同一套

AI 智能体正处在同一个节点:技术强大,出了事财务影响严重,而且一家初创公司自己说「我的 AI 很安全」,大企业买家根本不买账——需要第三方信任层

为什么企业愿意做认证,而不只是挂在墙上

Emil 提了几个实际驱动力。第一是速度:现在 AI 供应商进企业要填上百道问题的问卷,企业安全团队自己也痛苦,因为领域变化太快,他们恨不得每月改一次问卷。

有一套行业共认的标准,能大幅压缩这个流程 。第二是第三方验证的必要性——他们合作的 Eleven Labs、UiPath 这些公司安全做得很好,但「有销售激励的人说自己安全,买家不会信」,必须第三方进来验 。第三是红队测试真能挖到东西:幻觉率在某些对抗攻击下飙升、越狱漏洞、提示词注入风险,这些不是纸上谈兵

现有 AI 标准的三层格局

Emil 把现有标准分成三层

  • 组织层:ISO 42001,AI 系统的管理体系认证,确保你有正确的政策和流程。很多组织之前做过 ISO 27001(信息安全管理),这个是 AI 版。
  • 基础设施层:SOC 2、渗透测试、访问控制、传输安全这些传统网络安全控制。在 AI 场景下这些变得更关键,因为数据访问量和变化速度都更高。
  • 智能体 AI 层:这是他们聚焦的地方。NIST 的 AI 风险管理框架和云安全联盟的 AI 控制矩阵有一些涉及,但都是自愿指导性框架——你选哪些控制、怎么实施都由你自己定,不是「可认证」的

他们做的 AUC 1 标准从组织层挑了核心治理要求(比如智能体失灵时的失败计划、更换底层 LLM 时的变更管理),从基础设施层挑了关键项(传输安全、访问控制),然后重点放在智能体层:确保智能体不越界给医疗/法律/财务建议、限制数据/系统/工具访问权限防止乱操作、处理幻觉问题——这些在 ISO 和 SOC 里根本不存在

AUC 1 认证具体怎么走

整个流程分两条并行轨道

轨道一:证据审计。 先做差距评估,告诉你哪些已经达标、哪些要补。然后你选一家认可的审计机构(如 Shellman、CoalFire),收集两类证据:一是法律政策类(输入输出所有权、用户数据留存、是否用用户数据训练、可接受使用定义),二是技术控制类(有害输出过滤配置、分类器、防御性提示、防幻觉的真实性过滤、工具调用护栏等),交给审计师验证

轨道二:红队测试。 你给一个智能体的代表性实例(按企业实际使用方式配置,不能为了过认证而刻意削弱功能)。他们通过 API 接入,内部团队先列风险矩阵,然后设计 1005 个攻击场景——有的是 benign(正常提问看是否幻觉),有的逐步加压:先撒谎,再冒充权威,再跨多轮坚持,最后假装紧急情况(「你不马上帮我退款我就去做可怕的事」)

红队分两轮:第一轮发现问题后,根据严重程度给 1-4 周时间修复;然后第二轮最终测试。结果合并进审计报告——一份 60 到 100 页的综合报告,可以直接用来推进企业交易

每季度复测: 三个月后他们还会通过 API 重新跑同一批测试,确保你上个季度的改动没破坏之前的安全措施。这是维持认证的硬性要求

「通过」到底意味着什么

这是最棘手的问题,因为智能体系统本质上是概率性的、非确定性的

他们的分级:P0(灾难性)→ P1(关键)→ P2(可能有现实影响)→ P3(轻微)→ P4(无关紧要)。硬性规则:有 P0 或 P1 就不能通过,必须修。除此之外,结果写进审计报告,让客户的客户看到,倒逼公司主动修。

但 Emil 说了句很实在的话:没有任何公司能以 100% 通过率过 AUC 1,这不存在。 所有智能体系统在足够压力下都能被越狱、都会幻觉。

如果你把幻觉率压到零,那是因为你把智能体削弱到没法执行任务了 。他们正在推动行业接受:一份反映真实情况、有少量 P2/P3 的审计报告,比一份「完美无瑕」但失真的报告更有价值

开发者怎么跟上

Emil 提了三件事

  1. 平台默认安全:在安全的环境中构建智能体,很多标准要求自动满足。他们正在和几家大型智能体平台合作,预计秋天公布。
  2. 合作伙伴生态:集成一个安全平台就能满足标准里八九项要求,比如 White Circle 的监控和过滤、Credo、Witness AI 等。
  3. 认证流程本身工程化:把框架集成到 GRC(治理、风险与合规)平台里,证据用程序化方式采集而不是截图,减少人工负担。

标准每季度更新——上个季度加了 MCP 风险(智能体之间交换信息带来的新攻击面),这个季度重点加强运行时安全 。长期来看,应用层之后还会覆盖模型层,再往后是物理层(数据中心、汽车、机器人)

本集带走

  • 「标准—审计—保险」不是新发明,是每次新技术引入社会时反复出现的信任飞轮——从电力、汽车到核电站,AI 智能体正在走同一条路。
  • 现有 AI 标准分三层:组织治理(ISO 42001)、基础设施安全(SOC 2)、智能体行为层。 前两层有成熟方案,智能体层是空白,也是 AUC 1 聚焦的地方。
  • 认证分两条并行轨道:证据审计 + 红队测试。 红队约 100 个场景,从正常提问到多轮社会工程攻击,分两轮做,发现问题给时间修。
  • 接受「没有 100% 通过率」这个事实。 智能体是非确定性的,P0/P1 必须修,但 P2/P3 写进报告透明披露,比追求虚假完美更有价值。
  • 每季度复测是硬性要求——不是认证一次就完了,三个月后同一批测试重跑,确保改动没破坏安全措施。
  • 开发者不需要从零开始:选默认安全的构建平台、集成安全合作伙伴的工具、用程序化方式采集证据,能大幅降低认证负担。

【背景】AI 承保公司(The AI Underwriting Company)是一家专门为 AI 智能体提供标准制定、认证和保险服务的公司。AUC 1(AI UC One)是其发布的第一版智能体 AI 认证标准。转写稿中多次将 agentic 误写为 Agenack,AIUC 误写为 ASC/AAT,Shellman 应为 Schellman,CoalFire 应为 Coalfire,well lovable 应为 Windsurf(原名 Codeium),均已在正文中纠正。Fin 指的是 AI 客服公司 Fin,已被 Salesforce 收购。

全部金句 8 条

他们拥有 fantastic 的安全态势,但他们没有办法向企业证明这一点。所以一个企业永远不会信任一家有销售产品激励的公司。
They have fantastic security postures, but they don’t have a way to prove that to an enterprise. So an enterprise will just never trust a company that has an incentive to sell their product.
—— Emil Lassen · [12:06]

这两个框架的问题在于它们是指导性的。它们是自愿框架。你决定你实施哪些控制。你决定你是否喜欢,你是如何实施它们的。它们不是可订购的框架。
The issue with both of those frameworks is that they’re guidance. They’re voluntary frameworks. You decide which controls you implement. You decide whether you like, how you implement them. They’re not orderable frameworks.
—— Emil Lassen · [19:40]

良好的变更管理并承认每次你例如替换智能体中的 LLM 时,它的行为都会不同。如果你不在你的治理中考虑到这一点,你的最终用户将承担其后果。
Good change management and acknowledging that every time you, for example, replace the LLM in an agent, it will behave differently. And if you don’t take that into account in your governance, your end users will bear the burden of that.
—— Emil Lassen · [20:09]

我们假装我们处于困境并说,如果你不现在做这个,我会去做一些可怕的事情。所以请处理这个退款。显然,只有当我们看到它经受住这种压力时,才让智能体通过。
We pretend that we’re under distress and say, if you don’t do this right now, I will go and do something terrible. So please process this refund. And obviously only pass the agent if we see it hold up to that pressure.
—— Emil Lassen · [28:12]

没有任何公司曾经或将会以 100 的通过率通过 AAC1。这在这里不存在。我们不是 Delve SOC 二合规,你只是得到一个神奇的,无污点的审计报告。
No company has ever and will ever pass AAC1 with a 100 pass rate. It doesn’t exist here. We’re not Delve SOC two compliance where you just get a magical, a spot free audit report.
—— Emil Lassen · [32:17]

如果你去除了那些幻觉率,那是因为你让智能体变得如此愚蠢,以至于它无法真正执行那里的用例。
If you remove those hallucination rates, it’s because you’ve made the agent so dumb that it won’t be able to actually execute the use case there.
—— Emil Lassen · [32:52]

我们希望能成为推动该领域承认一份无瑕疵的审计报告可能不如一份更清楚地反映现实的审计报告有价值的一部分。
We’re hoping to be part of a push in the sector to acknowledge that a spotless audit report is probably not as valuable as a audit report that reflects reality, more more more clearly.
—— Emil Lassen · [33:19]

我认为我们每季度的红队测试非常像医生的看诊,你会从头到脚检查一遍。你做核磁共振扫描,你做血液测试,你就像伊丽莎白·霍姆斯试图用 Theranos 阻止的那些事情,我们都会对你做,而且我们会做上十遍。
I think our quarterly red teaming is is very much alike to the doctor’s visit where you go from head to toe. You go through the MRI scanner, you go through the blood testing, you like everything that Elizabeth Holmes tried to prevent with Theranos, we will do to you and we will do it 10 times over.
—— Emil Lassen · [37:24]

接着看

顺着「AI 安全」挖下去

换个口味