宪法
宪法 AI (constitutional AI)
概念
本站收录 2 集 · 0 条金句 · 关联 10 个
集里怎么说它
- 《Anthropic 联合创始人:安全为什么不是添头,而是 Claude 性格的来源》(29:09起):本集详细描述了其工作机制:模型先产生默认输出,然后根据一份自然语言原则清单(来自联合国人权宣言等)判断是否合规,如果不合规就让模型自己批判自己并重写,最后删掉中间过程,训练模型“一开始就做对”。
- 《AI 安全排行榜:谁扛住了越狱,谁没有》(32:37起):本集称其为 Anthropic 采用的方法,用另一个模型根据标准来打分,是后训练拒绝训练的一种复杂形式。
② 出现在这些集
2 集
- 《Anthropic 联合创始人:安全为什么不是添头,而是 Claude 性格的来源》 — 作为概念
- 《AI 安全排行榜:谁扛住了越狱,谁没有》 — 作为概念(提及)
③ 关联
点进去有真内容 —— 本页主要出口
Anthropic · OpenAI · 智能体 · 后训练 · Lenny · Adam Gleave · Benjamin Mann · FAR AI · Claude · 通用越狱
