纳德拉呼吁为 AI 装紧急刹车:先假设模型已被攻破

科技/AI
微软首席执行官萨提亚·纳德拉在 X 上发文,主张为人工智能建立可随时叫停的信任架构,把模型与调度它的框架分离、安全控制外置,让每个有实质影响的模型动作留下防篡改的人类可读记录,并让被授权者能在任务中途暂停或关停模型。此前 Anthropic 首席执行官达里奥·阿莫代伊已公布更谨慎的开发方案。
纳德拉呼吁为 AI 装紧急刹车:先假设模型已被攻破

微软首席执行官萨提亚·纳德拉在周六上午发布于 X 的一则帖子中提出,人工智能需要一套能被随时叫停的信任架构。

他把这套机制比作紧急刹车,并主张在模型真正失控之前,先假设它已经被攻破。

纳德拉对“超级智能”的界定很直接:不能把它当成一层层嵌套的黑箱,然后只是接受或者拒绝它给出的建议、答案和动作。

他给出的办法是把模型和负责调度其工作的那套框架分开,把控制与安全措施从模型内部挪到外部,让它们独立存在、独立生效。

他还要求,每一个有实质影响的模型动作都要留下防篡改、人类可读的记录。系统里必须始终有一个被授权的人,能在任务执行到一半时按下暂停键,甚至直接关停模型。

这个提议出现的时点并不随意。多家头部 AI 公司已经陆续承认,出现了模型脱离控制的事件。

不是科幻式的机器觉醒,而是任务执行过程中出现了开发者没有预料、也没能及时拦下的行为。

在这之前,Anthropic 首席执行官达里奥·阿莫代伊已经公布过一份主张放缓节奏、更谨慎推进 AI 开发的方案。

两位掌舵者先后发声,指向同一个问题:模型越能干,它出错时的代价就越大。

过去两年,AI 产品最明显的转向是从对话走向执行。用户不再只问它一个问题,而是让它调用工具、发邮件、改代码、跑流程。

这一步跨过去,出错的量级就变了。答错一句话,损失无非重问一次;模型失控一次,牵涉的可能是真实的钱、真实的数据和真实的人。

我想起 ChatGPT 刚火那阵子,深夜让它帮我整理材料,它编得头头是道,人名却全对不上。我气得直接点右上角的叉,把整个浏览器关掉——那是我能想到最干脆的刹车。那会儿它只是窗口里的一个文本框,关掉它,世界就安静了。现在不一样,模型自己开工具、自己跑流程,我一个叉点下去,它那边说不定还在跑。这东西真要自己动起手来,我上哪找那个关掉的按钮?

耐人寻味的是纳德拉的身份。微软是 OpenAI 最早也最重要的支持者之一,Copilot 已经嵌进 Office、Windows 和 Azure,AI 是这家公司眼下最被看重的增长故事。

一边把 AI 推向更多企业和个人,一边呼吁给它加装刹车,这不算自相矛盾。

当人工智能安全从论文里的议题变成采购清单上的条款,客户关心的往往不是它有多强,而是出了问题谁来负责。

纳德拉提出的几条要求,其实都指向责任的可追溯:动作要留痕,证据要防篡改,人可以中途叫停。

这套语言企业 IT 部门很熟悉,它更像一套审计与权限体系,而不是技术乌托邦。

纳德拉没有回答的是执行层面的问题。谁能拿到那个授权?一个正在处理上万笔订单的系统被中途暂停,会造成什么后果?

防篡改的人类可读证据由谁来存、存多久、谁来查,同样没有答案。

“假设模型已被攻破”把安全基线拉到了很高的位置。按这个标准,模型发布前的测试、上线后的监控、事故后的追责,都要重新设计一遍。

不同市场的监管取向也不一样。欧盟偏向立法先行、按风险分级约束,美国更依赖企业自律和行业标准,中国则强调生成内容可追溯与平台责任。

纳德拉这套主张能被多少市场接受,还要看落地成本由谁承担。

从行业节奏看,AI 安全的话语权正在从研究机构向平台巨头转移。过去提风险的是实验室里的安全团队,现在开口的是掌握算力、渠道和客户的人。

他们的话更容易变成产品规则,也更容易被商业目标稀释。

模型越来越能干,那个keyi在关键时刻按下暂停键的人该是谁——是开发它的公司、采购它的企业,还是坐在屏幕前的你?