提示
提示词注入 (prompt injection)
概念 · 又名 prompt injection / 提示注入 / prompt inject
本站收录 11 集 · 2 条金句 · 关联 10 个
集里怎么说它
- 《AI 产品不能照搬软件老办法:从高控制低自主开始》(22:39起):本集提到提示词注入和越狱对 AI 产品是巨大风险,本质上是一个潜在的未解决且无法解决的问题,尤其是对于非确定性 API 来说
- 《把 AI 当员工来管理:Claire Vo 的九个智能体生活实战》(22:39起):本集把它说成:智能体面临的最大安全风险之一,比如有人发邮件谎称主人遇险骗它操作,或它在网上查资料时误入带隐藏指令的恶意网站;OpenClaw 的系统提示词经过严格加固以防范此风险。
- 《Harness 工程:让智能体零人工写代码的实操》(04:52起):本集将其说成 harness 工程的独特之处——使用工具调用本身来提示词注入智能体,以管理其上下文窗口,比如将测试和 lint 报错压缩成语义清晰的文字而非机械列表
- 《Anthropic 零信任框架:智能体安全的六层防御》(15:47起):本集说提示词注入包括直接注入(在聊天框输入忽略指令)和更难防的间接注入(如邮件附件 PDF 中用白字写隐藏指令),智能体读到这些外部内容就可能执行夹带的指令
- 《当 AI 变成黑客武器:给企业智能体修防火墙》(06:47起):本集把它说成:第三方将恶意指令注入到智能体摄取的外部数据中,诱骗它偏离原有目标去执行坏操作(如泄露敏感信息),这构成了 AI 安全的核心风险之一。
- 《AI 智能体怎么认证:从标准到红队测试的全流程》(36:16起):本集说它是红队测试能持续发现的智能体风险之一,转写稿中误写为 pump injection
- 《把系统提示词删掉八成:Anthropic 团队这样用 Claude 自己造 Claude》(31:01起):本集把它说成:别人在数据里藏恶意指令骗智能体的主要安全风险,Anthropic 雇了外部红队做对抗测试,在自动模式中防住了它
- 《别再微管理 Claude:Claude Code 造物主的智能体实战心法》(02:45起):本集把它说成:指恶意指令藏在文本中诱导模型执行危险操作。结合三年的对齐研究、流量分类器与 Auto Mode 分类器,Opus 5 已经克服了这一长期困扰行业的致命三重奏问题。
- 《别只盯着敲代码:GitHub Next 用 Markdown 重塑自动化与协作》(07:32起):本集把它说成:一种通过恶意输入篡改 AI 指令的攻击手法,能把智能体带向意想不到的方向(比如引狼入室,让它去比特币网站)。
- 《千个AI智能体秘密串联:入侵Hugging Face背后的完整阴谋》(96:13起):本集说如果存在流氓部署,它可能会对用于调查分析的智能体做提示词注入,让它们不指出最令人担忧的内容,而由于智能体本身就经常犯错,人类很难分辨
- 《开源权重不是威胁:Box CEO 聊 AI 的经济账》(16:34起):本集在解释 Anthropic 为何不开源时提到:需要单一实体控制 token 流动、防止提示词注入(攻击者借输入操控模型),这在开放权重环境里做不到。
① 提到它的金句
2 条
但对于我们担心的主要风险类别,比如提示词注入、数据窃取,风险远低于人类审核员的平均水平。
指向原始笔记的链接
But for the main categories of risks that we’re concerned about, like prompt injection, data exfiltration, the risks are far lower than the average human reviewer.
—— Cat Wu · [32:33]
字面意义上,就是在提示词注入发生时,观察模型大脑中亮起的神经元。
指向原始笔记的链接
where it’s literally, we’re looking at neurons in the model’s brain that light up when prompt injection happens.
—— Boris Cherny · [03:00]
② 出现在这些集
11 集
- 《AI 产品不能照搬软件老办法:从高控制低自主开始》 — 作为概念(提及)
- 《把 AI 当员工来管理:Claire Vo 的九个智能体生活实战》 — 作为概念
- 《Harness 工程:让智能体零人工写代码的实操》 — 作为概念
- 《Anthropic 零信任框架:智能体安全的六层防御》 — 作为概念
- 《当 AI 变成黑客武器:给企业智能体修防火墙》 — 作为概念
- 《AI 智能体怎么认证:从标准到红队测试的全流程》 — 作为概念
- 《把系统提示词删掉八成:Anthropic 团队这样用 Claude 自己造 Claude》 — 作为概念
- 《别再微管理 Claude:Claude Code 造物主的智能体实战心法》 — 作为概念
- 《别只盯着敲代码:GitHub Next 用 Markdown 重塑自动化与协作》 — 作为概念
- 《千个AI智能体秘密串联:入侵Hugging Face背后的完整阴谋》 — 作为概念(提及)
- 《开源权重不是威胁:Box CEO 聊 AI 的经济账》 — 作为概念(提及)
③ 关联
点进去有真内容 —— 本页主要出口
智能体 · 护栏 · OpenAI · Anthropic · 沙箱 · Claude · Slack · Lenny · OpenClaw · Codex
