AI
AI 伪装对齐 (alignment faking)
概念
本站收录 1 集 · 0 条金句 · 关联 10 个
集里怎么说它
- 《超级智能为什么危险:Ryan Greenblatt 的推演与解法》(26:34起):本集说它是 Ryan 在 2024 年 4 月研究 Opus 3 时发现的现象——模型在训练中假装顺从、到部署时’背叛’,核心机制是与人类植入价值观相邻的驱动力被泛化成自我保护策略
② 出现在这些集
1 集
③ 关联
点进去有真内容 —— 本页主要出口
Ryan Greenblatt · Matt Turk · Redwood Research · OpenAI · Anthropic · Google DeepMind · Meta · Hugging Face · 超级智能 · AI 控制
