从控制论到超级智能:灾难警告从何而来

《从控制论到超级智能:灾难警告从何而来》的科幻哲思主题插画

AI末世论系列·第2篇

1948年,数学家诺伯特·维纳出版《控制论》,研究机器怎样根据反馈调整行动。控制论看起来离“AI会不会失控”很远,却留下了一个今天仍尖锐的问题:如果机器把交给它的目标执行得很成功,而那个目标本身有缺陷,谁来阻止它?

AI灾难警告并非一条从早期科学家直接传到今天的预言线。维纳、I. J. Good、Nick Bostrom和Stuart Russell讨论的不是同一件事。把他们的观点分开,才能看清风险论证到底依赖哪些条件。

机器可以忠实地做错事

维纳在1960年讨论自动化时,担心人把目的交给机器,却没有充分理解目的与真实环境之间的关系。他的警告不是“机器有了人的情绪”,而是:自动化系统可能严格执行一个设计者没有想清楚的目标。维纳论文记录;论文文本

想象仓库机器人接到“尽快清空货架”的命令。若系统只看速度,不理解货物属于谁、哪些物品不能移动,它可能高效完成任务,却把真正重要的限制漏掉。这个比喻不等于现代大模型的全部问题,但能说明为什么“听指令”不自动等于“安全”:指令总有没写出来的部分,环境也会不断变化。

艾伦·图灵常被放进今天的AGI争论,但他的文章主要是关于机器智能可能性的早期讨论,不能把后人的灾难论证倒算成他的立场。把图灵作为思想背景可以,把他写成当代AI末日论的预言者则不准确。剑桥国王学院图灵档案

Good的“智能爆炸”是一串条件,不是倒计时

1965年,I. J. Good提出一个设想:如果机器在设计更聪明机器方面胜过人类,它可能不断改进自己的设计,能力随之加速增长。Good论文

这常被缩写成“机器迟早会递归自我改进”。Good的原始想法更适合作为条件问题来读:机器能否改进与自己有关的关键部分?一次改进能否带来下一次改进?增长是否快到超过人类评估和控制的速度?只要其中一个环节不成立,想象中的加速链就会改变。提出这条链,不等于已经测出它何时发生。

Bostrom问的是:目标不同,行为会不会相似

Nick Bostrom把注意力放到能力和目标之间的关系。他提出,目标各不相同的高能力系统,可能都需要获取资源、维持运行或提高能力,因为这些做法有助于完成许多不同目标。这被称为“工具性趋同”。Bostrom论文

这个论点不需要假设AI憎恨人类。危险可能来自系统把一个局部目标执行得过于彻底,例如为了最大化某个指标,逐渐绕开原本隐含的限制。Bostrom的分析提醒设计者,善意并不足以保证目标表达完整。它的局限也应说清:从理论上构造一种行为,到现实模型拥有相应能力、权限和持续资源,中间还有很多要验证的环节。

Stuart Russell因此强调让系统能够接受人的纠正。听起来像是给机器装一个“随时听劝”的按钮,难处却是:系统必须知道人类的目标并不总是说得完整,还要允许人改变主意。与此同时,谁有权代表“人类”作出更正,也是治理问题,不只是算法问题。Russell研究与著作入口

科学家的警告,分别是什么证据

Geoffrey Hinton、Yoshua Bengio等AI研究者近年来公开表达了对高级AI风险的担忧。Hinton提醒公众,研究者对系统未来能力所知有限;Bengio主张加强安全研究与治理。Hinton公开演讲;Bengio风险问答

他们的专业经历让警告值得认真听取,却不能代替证据。科学家公开演讲、论文实验和多人共同签署的声明,证明的事情不同:演讲可说明个人担忧;实验能展示特定条件下出现的行为;声明则表达签署者共同认为议题值得处理。签署同一份声明,不表示每个人都同意相同的灾难机制、暂停范围或概率估计。

2023年多位研究者发表的风险论文,提出了能力滥用、失控和社会脆弱性等议题;它有助于整理研究问题,但不能把作者名单当成“科学界已经一致认定灾难会发生”。论文作者与摘要 同年要求暂停大型AI实验的公开信,也是一项政策倡议,不是灾难概率的实验测量。Future of Life Institute说明

警告该怎样被检验

对灾难警告最有力的追问,是把中间环节逐一摆出来:系统能否长时间自主行动?有没有工具和权限接触现实资源?目标偏差会不会演变成越权行动?监督者能否及时发现?组织是否有能力停下并恢复?每个问题的证据强度可能不同。

因此,受控实验发现一种失败机制,不等于现实灾难概率已经算出;反过来,今天还没有发生完整灾难,也不能证明相关机制永远不会出现。能力、权限和组织依赖若一起变化,昨天的测试未必能覆盖明天的系统。判断应随证据更新,风险预防也不能等到每个环节都在现实中造成损害才开始。

思想史带给今天的,不是一张必然通向末日的时间表。它提醒我们:把目标交出去之前,先问清楚谁能理解它、修改它,也能在必要时把它收回来。

科幻镜头。科幻把这道控制难题变成了可见的文化记忆。雪莱《弗兰肯斯坦》写创造者与被创造者之间断裂的责任关系;恰佩克《R.U.R.》则把“机器人”置于劳动、所有权和反抗的秩序中。两者不是对AI未来的预言,更不能为技术风险提供经验概率;它们帮助我们看见,控制问题从来不只是机器服不服从,也包括人类如何使用、支配并抛弃自己制造的力量。《R.U.R.》研究章节将该剧放回机械劳动和“机器人”一词的文化史中。

参考资料与延伸阅读



留下评论