思维
思维链 (chain of thought)
概念
本站收录 4 集 · 1 条金句 · 关联 10 个
集里怎么说它
- 《当 AI 变成黑客武器:给企业智能体修防火墙》(23:08起):本集提到它是模型思考的过程,嘉宾认为它在很大程度上(直到它们用数字思考前)是能相当好地反映模型内在意图的。
- 《Transformer 已见顶?OpenAI 与 Google 双雄离职造新架构》(15:40起):本集说这是一种通过增加生成序列长度来换取更强推理能力的方式,但从推理角度看极其低效,消耗巨量算力却只能塞进极少的反馈信息。
- 《AI 安全排行榜:谁扛住了越狱,谁没有》(00:49起):本集称模型在思维链中推理时很难对自己的有害意图完全闭嘴,通常是纯文本推理,专门的监控模型查看输入、思维链和输出,很难被绕过;如果只能选两层防御,这是首选。
- 《RL环境的供应链黑箱与模型的分工时代》(03:05起):本集说思维链不足以解释模型的最终决定——在思维链中有关键分支点,模型在那里做出决定,但你能为任何选择找到正当理由,最终它就是吐出一个 token,木已成舟。
① 提到它的金句
1 条
因为我们发现的是,虽然我们通常可以越狱模型,很难让它在思维链中推理时,对自己即将做的坏事闭嘴。
指向原始笔记的链接
Because what we found is that even though we can usually jailbreak the model, it’s really hard to get it to shut up about the evil thing that it’s about to do when it’s reasoning in the chain of thought.
—— Adam Gleave · [33:19]
② 出现在这些集
4 集
- 《当 AI 变成黑客武器:给企业智能体修防火墙》 — 作为概念(提及)
- 《Transformer 已见顶?OpenAI 与 Google 双雄离职造新架构》 — 作为概念
- 《AI 安全排行榜:谁扛住了越狱,谁没有》 — 作为概念
- 《RL环境的供应链黑箱与模型的分工时代》 — 作为概念
③ 关联
点进去有真内容 —— 本页主要出口
Anthropic · 智能体 · 护栏 · OpenAI · 后训练 · 沙箱 · Google · Zico Kolter · Sonja · Adam Gleave
