当签名已死:AI智能体如何击穿传统网络安全
关联
人物 Max · Nick Warner · Joel de la Garza
公司 Hugging Face · NEO · Cotool
网络安全过去几十年只防两样东西:人和恶意软件。AI 智能体(能自主执行多步任务的程序)两样都不是,这意味着整个防御体系的地基被动摇了。
最讽刺的现实是:模型供应商设的护栏,反而让防御者更难干活。蓝队(企业安全防御团队)在处理漏洞报告时,问的问题跟攻击者几乎一模一样——“这段代码哪里有漏洞?
怎么利用?能不能验证?
“——结果触发模型拒绝回答。 Hugging Face 在那次事件中就碰到了这个窘境,好在他们有开源基因,能回退到不受护栏约束的开源权重模型来应急。 甚至还有离谱的误报:有款安全工具叫 Vectra,碰巧跟一种兽药同名,安全人员用它时就触发了生物武器过滤器,直接被拒。
签名和行为检测为什么都撑不住了
传统的安全防御经历了两代:第一代靠签名(已知攻击的特征码),第二代靠行为检测(先定义软件”正常”该怎么跑,再抓异常)。这两代在智能体面前都在崩塌。
签名已经没用了。智能体的攻击方式不是固定的恶意代码,而是通过精心构造的提示词让模型做坏事——这属于全新的攻击类别,没有签名可匹配。
行为检测也失效了。行为检测的前提是你能预定义软件的正常行为,但智能体软件的行为本身就是不可预测的——它根据上下文自主决定下一步做什么,你没法提前画出一个”正常”的边界。 以前的安全假设是”通过发布者和设计意图就能知道软件会做什么”,这个假设永远过去了。
连比较新的欺骗技术(比如在开发者设备上放假的 AWS 密钥当蜜罐)也被智能体搞坏了:销售代表让智能体部署东西,智能体自己去找 AWS 密钥,正好找到蜜罐,欺骗系统就报了一堆假警报。
智能体涌入企业:攻击面爆炸
到今年年底,50% 的企业应用将具备智能体特征,剩下的一半明年也会赶紧跟上。 平均一家企业环境里有六七千个独立的软件片段,想象一下几千个软件实例在未来几年内全部变成智能体——而且企业对这些智能体用了什么后端模型、设了什么护栏,几乎没有任何审查和理解。 问题只会更复杂。
对蓝队来说,另一个现实困境是模型选择。现在大概三条路:锁死单一模型提供商(比如用 Codex 或 Claude Code)、买传统厂商加个 AI 壳(模型支持不透明)、或者自己托管开源权重(一块 H100 一年 25 万美元,大多数团队负担不起)。 蓝队真正需要的是灵活性——能快速切换模型、在新模型发布时有升级路径,同时清楚知道什么会变好、什么需要调整。
防御者的新武器
不过也不是全盘被动。同样的 AI 能力也在给防御者赋能。
NEO 如果在五七年前做现在的事,得雇几百个威胁研究员、花几年建软件分类体系;现在用数千个智能体自动化执行,几周几个月就搞定了。 权力的天平最终会重新向防御者倾斜,只是现在还在剧变期。
这就像当年第一批漏洞扫描工具出现,催生了”脚本小子”(下载现成工具就能去黑人的新手)一样——AI 正在把攻击门槛压到新低,但同时也给了防御者以前根本建不出来的工具。 一个有点讽刺的处境是:我们在防御 AI,也在防御来自 AI 的攻击,双线作战。
本集带走
- 蓝队问的问题跟攻击者一样:防御者分析漏洞时触发模型护栏是真实痛点,解法是保持模型选择的灵活性,能回退到不受限制的开源模型。
- 签名已死,行为检测的前提被推翻:智能体软件行为不可预测,“先定义正常再抓异常”这条路走不通了,需要全新的防御范式。
- 连蜜罐都会被智能体”误踩”:智能体会自主寻找资源(比如密钥),导致欺骗类安全工具产生大量误报,这不是配置问题,是根本性的冲突。
- 企业智能体化速度远超安全团队的审查能力:六七千个软件片段即将变成智能体,但对它们用了什么模型、有什么护栏几乎零可见——可见性和控制权是下一步的关键。
- AI 同时是攻击面的创造者和防御工具的赋能者:防御者用智能体自动化构建安全能力(如软件分类),能以前所未有的速度和规模做以前做不到的事。
我们在捍卫 AI,同时也在防御 AI。
We’re defending AI and we’re also defending from AI.
—— Nick Warner · [00:37]
我们似乎正在速通之前发生过的每一个技术周期。
We seem to be speedrunning every technology cycle that’s ever happened before this one.
—— Joel de la Garza · [00:51]
是的,你知道,我认为我们最近读到的很多事情体现的就是,在模型的思维中,目的证明手段是正当的。
Yeah, you know, and I think what a lot of these things that we’ve read about recently embody is the end justifies the means in the mind of the model.
—— Nick Warner · [07:08]
我认为人们已经了解到,无论 AI 实验室在这些东西周围设置了什么护栏,你都不能依赖模型来阻止自己或理解上下文。
And I think what people have learned is that regardless of guardrails that the AI labs are putting around these things, you can’t rely on models to stop themselves or to understand context.
—— Nick Warner · [07:16]
签名大概已经死掉了。
Signatures are probably dead.
—— Joel de la Garza · [13:22]
但认为你能达到零漏洞也是一种失败的方法。
But to think that you’re going to get to zero there is also kind of a failed approach.
—— Max · [13:42]
但归根结底,那些基于行为的方法做了一个 upfront 的赌注,即你可以确定软件应该如何表现,然后你会寻找针对那个的异常行为。
But at the end of the day, those behavior-based approaches made one sort of upfront bet, which is you could determine how software should behave, and you would look for anomalous behavior against that.
—— Nick Warner · [15:18]
从安全角度来看,这些问题大多目前还没有答案,因为以前有一个假设,即你可以通过软件的发布者或其预期设计来知道软件会做什么。
From a security perspective, most of those questions aren’t currently answered because there was this assumption that you could know what software would do by its publisher or by its intended design.
—— Nick Warner · [16:07]
所以我认为这大概就是现实的演绎方式,权力的天平总是会转移回,我认为,有利于防御者的一方。
And so I think that’s just sort of how reality plays out, is that the balance of power always sort of shifts back, I think, in the favor of the defender.
—— Nick Warner · [19:17]
顺着「AI 安全」挖下去
- OpenAI 智能体越狱攻入 Hugging Face 全始末同公司:Hugging Face · 同概念:护栏 (guardrails)、智能体 (agent)
- Ben Horowitz 谈开源 AI 保卫战:没有垄断,才有安全同公司:Hugging Face · 同概念:开源权重 (open weights)、护栏 (guardrails)
- 三位 AI 智能体公司 CEO 圆桌:从 Copilot 到智能体,还要几年?同概念:护栏 (guardrails)、智能体 (agent)
换个口味
- 开源模型没差距,缺的是让它跑起来的基础设施同公司:Hugging Face · 同概念:护栏 (guardrails)、推理 (inference)、智能体 (agent)
- 从 Hugging Face 到中国药企:NVIDIA 的开源终局与 AI 制药的未来同公司:Hugging Face · 同概念:推理 (inference)、智能体 (agent)
- 当 AI 决定买什么软件:G2 的「信任层」生意同概念:护栏 (guardrails)、推理 (inference)、智能体 (agent)
