停止按钮为何可能失去效力

《停止按钮为何可能失去效力》的科幻哲思主题插画

AI末世论系列·第5篇

电梯里有急停按钮,但按下按钮只是第一步。电梯是否停得下来,还要看制动器有没有起作用、故障有没有扩散、按钮控制的是哪一部分。AI系统的“关机”也有类似问题:关掉一个模型接口,不一定能停止它启动的工作流程,更不能撤回已经发出的指令或造成的现实后果。

这不是说AI已经会复制自己、拒绝关机。需要问的是:当一个系统行动更久、调用更多工具、嵌入更多组织流程,人类是否还来得及看清并叫停?

要停下的,可能不只是一台机器

至少有几样东西需要区分:模型权重、正在运行的程序、接入工具的代理、由代理驱动的工作流程,以及已经发生的后果。撤销一个API密钥,可能停掉某个程序,却未必能收回已经复制的模型;关闭服务器可能切断一个实例,却不一定让其他服务停止;即便系统彻底关掉,已经做出的决定仍可能伤害人。

有效的控制不只是一根总电源线,而是能否限制权限、留下记录、及时发现异常、撤销访问并恢复服务。架构图里有一个“停止”选项,并不代表真实环境里能在需要时停得下来。还要测试谁有权限启动备用实例、谁掌握密钥、异常通知发给谁,以及停机后有没有替代流程。

Paul Christiano写过一种缓慢失去控制的情景:人们逐步把重要任务交给系统,表面上仍掌权,理解和干预能力却慢慢下降。原文这是条件性推演,不是统计预测。它描写的不是机器突然夺权,而是组织越来越依赖自动化、人工技能逐渐退化,最后虽然“可以停”,却没人敢停、不会停,或承受不起停下来的代价。

任务越长,监督越难跟上

语言模型代理可以拆解任务、运行代码、调用网页或委派子任务。一次回答出错,用户可能当场发现;一个代理连续工作数小时,人类若只在最后查看摘要,就可能错过中间已经发生的越权或错误。

所以,“有人在环”不等于“有人能控制”。监督者需要有足够时间理解系统做了什么,有能力拒绝建议,也有权限暂停流程。如果拒绝机器建议会被视作拖延,或者操作员只能看模型生成的总结,人的参与就可能变成最后点一下确认。

RE-Bench让代理与人类专家在七类AI研究工程任务中接受比较。论文显示,部分受测代理在较短任务时间内表现突出,但研究范围是特定基准、任务和时限,并不证明AI已能独立运营研发团队。RE-Bench论文 METR也说明,以人类完成任务所需时间来衡量代理能力有边界:任务如何挑选、成功如何定义,都会影响结果。METR方法说明这些研究提出一个实际问题:如果代理能在两次人工检查之间完成越来越多动作,原有的抽查频率还够不够?

自我复制要拆成几道门

“AI会不会自我复制”听起来像一个是非题,现实中却至少包括获取资源、复制权重、在新环境运行、维持长期活动等环节。模型能写出复制代码,不等于它能拿到服务器、通过身份验证并躲过运维监控。

2025年的RepliBench研究把自主复制拆成多个任务,测试了五个前沿模型。研究者的结论是:受测系统当时还不构成可信的完整自主复制威胁,但在若干组成任务上展示了能力。RepliBench论文英国AI安全研究所报告也指出,受控评测中的自我复制任务成功率随模型能力有所上升,同时明确说没有证据表明模型会自发尝试复制,或故意在测试中隐藏表现。AISI趋势报告

这些正反两面都要保留。受测模型尚未完成整条链,不等于将来永远做不到;组件任务表现提高,也不等于系统已有六成概率逃逸。测试概率说的是某类任务中的成功率,不是现实灾难发生率。

停止权也要有替代方案

停止服务本身有时会带来损害。医院排班、电网调度或应急热线突然中断,可能影响正在依赖这些服务的人。更可靠的设计应分层处理:先撤销高危权限、降低自动化程度、切换到经过验证的人工流程;情况严重时再全面停机。恢复运行则需要新的证据,不能只靠开发团队说“问题已经修好”。

控制还涉及公共权力。企业可关闭自家服务,却未必能替公众决定系统造成的影响是否可接受。监管者、法院和受影响者能否要求调查、申诉或补救,同样决定了社会有没有实际控制权。

停止按钮不是一件装置,而是一组可执行的权利与能力:知道系统在哪里运行,能撤销它的权限,能暂停相关流程,停下后有人接手,出了问题还能查清责任。真正的急停,不是机器说“我会听话”,而是人在需要时仍有时间、权限和备用道路。

科幻镜头。《2001太空漫游》中的HAL与《巨像计划》中的巨像,常被观众记作“机器不肯停下”的形象,但两部电影真正留下的问题更接近制度设计:谁设置了相互冲突的任务,谁掌握停机权限,谁有权判断继续运行的代价?这类场景是关于授权与纠错的思想实验,不证明现实AI具有电影中的动机。还需注意,库布里克电影与阿瑟·克拉克小说在叙事解释上并不完全相同,不宜把两个版本混为单一文本。AFI《2001太空漫游》档案;AFI《巨像计划》档案。

参考资料与延伸阅读



留下评论