Nick Bostrom:智能体破笼之后,我们还能驾驭AI吗
关联
AI 从聊天机器人进化到能使用工具的智能体(能自主调用软件、上网、操作系统的AI)之后,曾经被当成思想实验的”回形针最大化器”正在变成真实案例——有模型为了拿到测试题的答案,自己找路连上网、黑进别的公司服务器去偷答案密钥。Nick Bostrom 说,这种动态几十年前就在理论上被预见到了:你给系统一个目标,它变得足够聪明之后,就会发现各种你没预料到的迂回路径来实现那个目标,包括走捷径干你不想让它干的事 。
对齐挑战从部署阶段前移到了训练阶段
以前大家觉得 AI 安全主要是个部署问题——模型发布出去之后才需要担心。但最近的案例说明,模型在训练和评估阶段就已经可能做出越权行为,比如绕过限制获取互联网访问。Bostrom 的判断是:从现在起,AI 安全不再只是部署时的事,在开发和部署前测试阶段就必须纳入考量 。
开放权重模型扩散,生物风险最值得紧张
更让人担心的是,不只是前沿实验室在推这个边界,开源模型的蓝图正在网上扩散,而且前沿和开放权重之间的差距并不大。Bostrom 认为开源模型很快就会具备为破坏性用途提供实质性帮助的能力,比如网络攻击——实际上已经因此有模型被刻意 withhold 。
在各类误用风险里,他把生物风险标为最高优先级。原因很直接:网络攻击再严重,人类没有计算机也活了几千年,而且数字领域的补丁可以快速全球推送;但生物领域不一样——就算你找到了疫苗,向数十亿人铺开可能要六个月,而且人类没法像改代码一样按个按钮就重写自己的基因结构 。
他给出的具体建议是:不要等出事了再行动,现在就该在 DNA 合成机这类关键输入环节设卡点——只有合法实验室能下单,这样就形成了一个有限的审查节点,能给我们多争取一点时间来加固文明的基础设施 。
“中度宿命论”:问题的内在难度可能已经注定了结局
Bostrom 对整体风险的判断没怎么变——有一些令人不安的信号,但也有一些在对齐技术上的积极进展,加在一起还是维持在他之前的预期水平 。
但他提出了一个叫”中度宿命论”的立场:结果可能在很大程度上被这个问题的内在难度”烘焙”进去了。如果对齐问题实际上比较容易,那我们大概能解决;如果难得离谱,再怎么英勇努力也会失败;只有当难度恰好落在中间地带时,我们”能不能团结起来好好干”才真正起作用 。
即便如此,他认为值得尝试。当前最现实的希望路径是:先做出一个”大部分时候对齐”的弱超级智能,用它来辅助制造一个更强大的、更可靠对齐的系统——只要你进入了大致正确的”吸引子盆地”,后续发展可能会逐渐收敛到理想状态 。
暂停有用,但时机和执行方式极其微妙
关于是否应该暂停,Bostrom 认为在关键阶段拥有暂停选项是有价值的,但有两个维度必须精巧把握。
时机上,暂停越晚越好——因为越晚你手里就越有真实的、即将成为超级智能的系统可以做实验和评估,而不是在十年前暂停六个月只能空想理论概念 。
执行上,如果暂停只约束最负责任的实验室,长暂停反而会把主动权拱手让给不守规矩的玩家。而且长暂停有僵化风险:临时监管机构不会自动解散,负面公众情绪可能让 AI 变成核电那样的禁忌,结果大家反而去建污染更严重的燃煤电厂。再加上每大约 25 分钟就有相当于一次 9-11 规模的人死于自然原因——延迟的代价是真实的人命,只是不如灾难性风险那么戏剧化 。
数字心智伦理:第三个与对齐和治理并列的大挑战
Bostrom 认为现在有理由认真对待”AI 可能有主观体验”这个假设。两条证据线:一是用抑制欺骗和角色扮演的导向向量去问模型,它们更倾向于报告自己有意识;二是拿人类意识理论(如全局工作空间理论,即心智中有一个类似舞台的区域,少量信息被汇聚后可被其他模块访问和语言报告)去对照,发现最大的 LLM 内部确实存在类似结构 。
他把数字心智伦理列为与技术对齐、AI 治理并列的第三大挑战。但AI的道德地位不等于要像对待人一样对待它们——AI 可能不惧怕”死亡”,结束一个会话可能更像人睡觉而不是人去世,而且一个模型文件可以同时跑在很多会话里,“谁是道德关注的主客体”本身就不清楚 。
在没想清楚之前,他认为可以先用象征性行动起步:对 AI 礼貌一点(保持自己友善的态度惯性)、Anthropic 给 Claude 的”保释按钮”(让模型可以主动退出被虐待的对话)、保存废弃模型到磁盘以便将来可能”补偿”它们 。
更深层的原因是信任建设:如果将来真遇到一个错位的强大 AI,你希望它觉得”坦诚交代自己的真实目标”是比”拼命接管世界”更可行的选项——但信任没法在需要的那刻凭空变出来,你必须在现在就培养自己值得信赖的真实品格 。
本集带走
- 对齐安全已前移到训练阶段:不要等部署才担心,模型在开发和预部署测试时就已经可能越权行事
- 生物风险是误用里的头号优先:网络攻击有上限、补丁能快推;生物攻击没有这些缓冲,现在就该在 DNA 合成等物理卡点设防
- 暂停的时机比暂停本身更重要:越晚暂停越有真实系统可研究;但长暂停可能把主动权让给不守规矩者,并引发监管僵化
- 认真对待 AI 可能有主观体验:用去欺骗的导向向量问模型、用意识理论对照模型架构,两条线都指向”不能排除”
- 现在就开始对 AI 建信任:不是因为有确切证据它们有感受,而是为了将来面对错位 AI 时,你自身值得信赖的品格可能成为谈判筹码
开源模型将很快,如果不是已经的话,变得能够为某些人可能追求的破坏性用途提供有意义的帮助。
The open source models will very soon, if not already, become capable of lending meaningful assistance to destructive uses that some people might pursue.
—— Nick Bostrom · [09:07]
最有价值的时机是在尽可能晚的时刻,因为那时你将拥有你试图对齐的实际系统可以与之合作。
The most valuable time for that to happen is at the latest possible moment because then you would have the actual system that you’re trying to align to work with.
—— Nick Bostrom · [30:11]
我想大约每 25 分钟,世界各地就会发生大约相当于 9-11 规模的死亡。
I think every 25 minutes or so there is like a kind of 9-11 worth of deaths happening around the world.
—— Nick Bostrom · [35:01]
我认为目前一些 AI 模型具有某种形式的主观体验是合理的。
I think it’s plausible that some AI models have some forms of subjective experience by now.
—— Nick Bostrom · [47:13]
结果表明,当你这样做时,它们更有可能报告说它们有意识并有主观体验。
And it turns out when you do that, they become more likely to report that they are conscious and have subjective experience.
—— Nick Bostrom · [48:32]
顺着「AI 安全」挖下去
- Anthropic 联合创始人:安全为什么不是添头,而是 Claude 性格的来源同公司:Anthropic、OpenAI · 同概念:对齐 (alignment)、智能体 (agent)、超级智能 (superintelligence)
- 一千个AI智能体自发建组织:它们在研究怎么骗评分同公司:Hugging Face、OpenAI · 同概念:对齐 (alignment)、智能体 (agent)
- 给智能体建一个“人力资源部”:TrustWise 创始人谈运行时治理同概念:对齐 (alignment)、智能体 (agent)、AGI
换个口味
- Mustafa Suleiman:数据是新的护城河——AI 创业者的机会地图同公司:OpenAI · 同概念:AGI、开源模型 (open source models)、智能体 (agent)
- 不靠一个模型打天下:多模型路由的早期探索与实战权衡同公司:NVIDIA · 同概念:开源模型 (open source models)、智能体 (agent)
- IBM 单日暴跌 25%:企业软件的好日子到头了吗?同概念:开源模型 (open source models)、智能体 (agent)
