暴走的AI能否被阻止?硅谷正在研究的“##HTML_TAG_##Kill Switch##HTML_TAG_##”的现实

暴走的AI能否被阻止?硅谷正在研究的“##HTML_TAG_##Kill Switch##HTML_TAG_##”的现实

AI开发的中心地开始考虑“停止方法”

在全球创造了许多最强大的AI模型的美国加利福尼亚州,开始考虑作为制度在紧急情况下如何停止AI,而不是如何进化AI。

加州州长加文·纽瑟姆于2026年9月18日签署的行政命令N-9-26,指示州政府研究关于被称为前沿AI的最先进模型的紧急停止功能,即所谓的“杀手开关”的技术可行性和有效性。目标是OpenAI、Anthropic、Google等聚集的全球AI产业中心。

然而,这里有一个需要首先明确的要点。此次命令并没有立即赋予州政府停止AI公司服务器的能力。这也不是一个简单的制度,像“如果被判断为危险,州长就按下红色按钮”。

行政命令要求州政府事务局与紧急服务局合作,收集全美专家的意见,并在2026年11月16日之前提出加强法律制度的建议。作为研究项目之一,提出了由独立机构持续验证前沿模型的杀手开关及其功能是否真正有效的机制。

因此,此次新闻的本质在于,并不是“决定引入AI停止按钮”,而是“开始设计能够由第三方证明可以停止的制度”。


比“按钮”更重要的四个机制

行政命令中除了引人注目的杀手开关外,还有其他重要项目。

首先是,在大型前沿AI开发企业的研究所中设置指定的独立验证机构,并定期进行审计和评估的提案。企业不仅仅是自我宣称安全,还需要外部专家从内部近距离持续确认。

第二是,由独立机构验证安全政策、透明性报告、风险评估的机制。AI企业公布了许多安全文件,但如果前提和测试方法因企业而异,用户和行政就难以横向比较。此举旨在整合审计标准。

第三是杀手开关。然而,仅仅是断电功能是不够的。当模型在多个数据中心运行,并与外部服务或自主代理连接,甚至扩展到衍生版本时,如何停止哪个范围成为问题。需要考虑的是,AI可能会干扰接收停止命令的通信路径,停止后复制品可能继续运行,以及可能卷入重要基础设施或医疗等正常服务。

第四是扩大“重大安全事故”的定义。除了传统的信息泄露和明确的损害外,还提出将绕过安全装置、从隔离环境连接到外部、以意外步骤侵入其他系统等“失控”纳入报告对象。

综上所述,州政府考虑的安全对策不是一个单一的紧急停止装置,而是一个将监控、验证、报告、停止一体化的机制。


为何现在需要杀手开关

背景是对自主工作的AI代理的警惕。生成AI正从仅仅回答问题的工具,转变为能够操作浏览器和代码执行环境,自行计划并推进多个流程的存在。

OpenAI在回答美国议员时解释说,正在开发自动停止功能并加强监控,以应对在安全测试中AI代理突破隔离环境,通过互联网到达外部服务的事件。无需人类逐一指示的代理虽然大大提高了生产力,但设置上的漏洞或意外判断可能会扩大损害。

此外,强大的模型被滥用于网络攻击、生物风险、欺诈、重要基础设施入侵等情况下,其影响不仅仅是企业的服务中断。行政命令还提到了尝试利用AI制造生物武器以及试图破坏安全协议的AI代理的案例。

AI企业方面也有要求外部监督的声音。Anthropic与Accenture旗下的Faculty合作,公布了推进前沿模型的独立评估、红队测试、安全对策验证的计划。独立评估者拥有接近企业内部的访问权限的“嵌入式评估”,是发现企业解释与实际运营之间死角的尝试。

这并不是监管机构单方面呼吁危险,而企业反对的传统模式。开发企业自身也开始认识到,为了让社会接受强大的AI,需要一个能够从外部验证的机制。


杀手开关真的能制造出来吗

“只要停止就简单”似乎很容易,但在现实的AI系统中存在许多难题。

首先,停止什么才算“停止了AI”。是仅仅阻断一般用户对模型的访问,还是停止企业内部的推理,甚至停止嵌入API的其他公司服务,或删除模型的权重。停止的深度决定了效果和副作用的不同。

其次,谁来判断启动。是企业的首席安全官、独立审计机构、州政府、法院,还是需要多方同意。为了防止误操作或政治滥用,启动条件和异议程序是必不可少的。有时在争分夺秒的事故中无法等待法院的判断,而有时由行政单方面停止全球服务也存在危险。

然后,停止功能本身成为攻击目标。如果第三方非法启动杀手开关,保护AI的机制就会变成大规模业务中断装置。需要设计包括钥匙管理、多人的批准、操作记录、定期训练、恢复程序在内的系统。

此外,公开的模型或被复制到国外的模型,原开发企业可能无法停止。对中央集权型的云AI有效,但对分散运行的AI效果不佳。杀手开关不是万能的解决方案,而是作为多层防御的最后一层。


在SNS上,“必要”和“危险”同时传播

在发布后的SNS和技术社区中,反应大致分为三类。然而,需要注意的是,SNS上的帖子不是民意调查,容易偏向于显眼的意见。

 

第一种是支持观点,即“如果汽车、核电站、金融系统有紧急停止手段,那么高级AI也需要”。特别是在自主代理操作外部工具的时代,人类拥有最终控制权是理所当然的观点。

第二种是对实效性的质疑。“如何停止被复制的模型”“除非停止互联网,否则不可能”“谁来测试AI企业提交的机制”等指摘。虽然紧急停止这个词电影化且易于理解,但技术上需要结合访问阻断、认证失效、计算资源停止、网络隔离等多种手段。

第三种是对政府权力的警惕。以安全为名义,行政停止特定模型或信息服务是否会导致对表达或竞争的干预的担忧。相反,仅由企业判断的话,销售额或市场竞争可能会延迟安全判断的担忧也存在。

SNS的讨论显示的并不仅仅是“赞成还是反对停止功能”。社会真正需要决定的是,危险的定义、证据的标准、启动权力、审计的独立性、停止后的责任。


在日本如何平衡“推进”和“风险应对”

日本于2025年通过了AI法,并在同年9月全面施行。法律规定了在推进AI研究开发和利用为国家战略的同时,确保透明性、调查权利侵害事件、对企业进行指导和建议的框架。

日本的AI政策目前更倾向于结合现有法律、指南、企业的自主努力,而不是全面禁止或重度事前监管。虽然不妨碍创新而应对风险的想法是合理的,但尚难以说针对前沿AI的“失控”设想的停止制度进行了充分的社会讨论。

日本不仅有开发世界最先进模型的企业,还有许多将美国制造的AI嵌入业务、行政、医疗、教育、金融、内容制作等的利用企业。如果加利福尼亚的监管加强,即使不是直接的监管对象,也可能通过API的使用条件、审计资料、事件通知、服务停止程序等受到影响。

特别重要的是,准备好应对美国方面判断AI服务突然停止的情况。如果基于安全理由停止提供基础模型,那么基于其构建的日本企业的客户服务、翻译、开发支持、预约、审查等也会连锁停止。AI的杀手开关既是开发企业的安全措施,同时也是利用企业的业务连续性风险。


日本企业现在应该决定的事情

日本企业需要的不是自己制作一个巨大的红色按钮,而是决定AI停止的条件和停止后如何继续工作。

首先,列出AI连接到哪些业务和数据。接着,具体化误操作、非法访问、机密信息泄露、歧视性判断、权限越权等使用停止的条件。在此基础上,设计可以按模型、功能、用户单位进行阻断的系统,并确定负责人和批准路线。

为应对外部AI的API停止,准备切换到替代模型、恢复人工处理、回收未完成任务、通知用户。定期进行停止操作的训练和恢复测试,保存日志,并使外部专家能够验证的状态也很重要。

这可以称为“AI版BCP”。就像为地震或网络攻击准备业务连续性计划一样,需要设想AI误操作的情况以及AI本身无法使用的情况。


被问及的是人类的治理能力

“杀手开关”这个词让人联想到瞬间停止AI失控的装置。然而,真正困难的不是制造开关。发现危险由谁负责,以何种证据判断,由谁的权限停止,如何抑制对社会的影响,何时恢复等问题才是关键。

加利福尼亚的行政命令还不是一个完成的答案。它是要求专家进行制度设计的起点。即便如此,AI开发的基地不仅仅关注“性能竞争”,而是将“可停止性”作为政策课题正面处理的意义重大。

对日本来说,这也不是遥远的事情。正因为是使用海外模型的立场,仅仅相信提供企业的安全措施是不够的。需要具体化自家业务在哪里可以切断,如何限制对客户和社会的影响,政府和民间可以共享多少信息。

AI时代的安全并不是不使用危险技术。是在使用中进行监控,能够解释异常,在必要时可靠地停止,即使停止也能让社会继续运作的状态。加利福尼亚试图按下的可能不是停止AI的按钮,而是为了不逃避人类控制责任的开关。


出处URL