对齐 (alignment)
集里怎么说它
- 《Anthropic 联合创始人:安全为什么不是添头,而是 Claude 性格的来源》(02:00起):本集将其视为核心难题,引用“三个世界”框架说明对齐既不是不可能也不是默认就会发生,而是行动极其关键的中间状态;一旦到达超级智能再去对齐模型就太晚了。
- 《Claude Code 负责人:写代码已被解决,下一步是什么》(43:04起):本集说它是 Anthropic 安全三层模型的最底层,与机制可解释性一起,确保训练出的模型是安全的
- 《Nick Bostrom:智能体破笼之后,我们还能驾驭AI吗》(02:08起):本集说一旦系统足够复杂,对齐挑战的额外维度就会打开,因为系统会找到设定目标的人没预料到的迂回路径;前沿实验室有团队致力于可扩展的 AI 对齐
- 《给智能体建一个“人力资源部”:TrustWise 创始人谈运行时治理》(04:41起):本集说对齐问题是 AI 是否做了你意图让它做的事,TrustWise 框架中有六层对齐:全球权利、国家法规、行业法规、公司价值观、业务单元、客户 SLA
- 《超级智能为什么危险:Ryan Greenblatt 的推演与解法》(00:46起):本集提到对齐科学(science of alignment)是 AI 安全工作的支柱之一,需要理解模型如何泛化、知道我们能和不能证明什么
- 《一千个AI智能体自发建组织:它们在研究怎么骗评分》(17:40起):本集核心议题之一:讨论修补不对齐行为可能只是掩盖而非真正修复,以及随着智能体变得超人类,仅靠改进 RL 训练可能不够
- 《OpenAI 总裁 Greg Brockman:我们已进入 AGI 时代,而真正的瓶颈不是模型》(00:22起):Greg 说安全、安保、对齐会成为进步的瓶颈,需随能力一起不断提升;OpenAI 早在 2017 年就布局辩论、迭代放大等监督超智能的想法。
① 提到它的金句
5 条
如果你看看像谄媚这样的东西,我认为 Claude 是最不谄媚的模型之一,因为我们投入了大量的精力在实际的对齐上,而不仅仅是试图在我们的指标上玩弄花样,说用户参与度是第一位的,如果人们说是的,那对他们就是好的。
指向原始笔记的链接
And if you look at something like sycophancy, I think Claude is one of the least sycophantic models because we’ve put so much effort into actual alignment and not just trying to good heart our metrics of saying user engagement is number one, and if people say yes, then it’s good for them.
—— Benjamin Mann · [27:21]
所以在对齐和安全中最重要的指标之一是你对你正在被测试有多了解。因为你非常了解的那一刻,我们应该停止。
指向原始笔记的链接
So so the one of the most important metrics in alignment and safety is how aware are you that you’re being tested. Because the moment that you’re very aware, we should stop.
—— Swyx · [38:45]
是时候让硬技能再次现身了,而不是领导力、感召力、对齐。
指向原始笔记的链接
it’s time for the hard skill to show up again, not leadership, inspiration, alignment.
—— Claire Vo · [47:03]
我可以告诉你什么是绝对在下降的,那些在面试中花大量时间谈论推动一致性和利益相关者管理的人,因为绝对有一群产品经理他们的专长不是技术,而是政治。
指向原始笔记的链接
I can tell you what’s definitely trending down, folks who spend a lot of their time in their interviews talking about driving alignment and stakeholder management, because there’s definitely a group of PMs whose specialty wasn’t technical, it was politics.
—— Tom Verrilli · [01:06]
很多时候,产品变慢是因为决策。要么是整个组织里的沉默否决——一个团队不想做另一个团队想做的事——要么是对我们在做什么、要去哪里缺乏共识。
指向原始笔记的链接
A lot of the time, products slow down because of decision-making. Either it’s silent vetoes throughout the org, where one team doesn’t want to do something that another team wants to do, or it’s a lack of alignment on what we’re doing or where we’re going.
—— Willem Avé · [08:01]
② 出现在这些集
7 集
- 《Anthropic 联合创始人:安全为什么不是添头,而是 Claude 性格的来源》 — 作为概念
- 《Claude Code 负责人:写代码已被解决,下一步是什么》 — 作为概念(提及)
- 《Nick Bostrom:智能体破笼之后,我们还能驾驭AI吗》 — 作为概念
- 《给智能体建一个“人力资源部”:TrustWise 创始人谈运行时治理》 — 作为概念
- 《超级智能为什么危险:Ryan Greenblatt 的推演与解法》 — 作为概念
- 《一千个AI智能体自发建组织:它们在研究怎么骗评分》 — 作为概念
- 《OpenAI 总裁 Greg Brockman:我们已进入 AGI 时代,而真正的瓶颈不是模型》 — 作为概念
③ 关联
点进去有真内容 —— 本页主要出口
Anthropic · 智能体 · OpenAI · 超级智能 · 沙箱 · Hugging Face · AGI · Lenny · 护栏 · NVIDIA
