纳德拉呼吁为 AI 装紧急刹车:先假设模型已被攻破
微软首席执行官萨提亚·纳德拉在周六上午发布于 X 的一则帖子中提出,人工智能需要一套能被随时叫停的信任架构。
他把这套机制比作紧急刹车,并主张在模型真正失控之前,先假设它已经被攻破。
纳德拉对“超级智能”的界定很直接:不能把它当成一层层嵌套的黑箱,然后只是接受或者拒绝它给出的建议、答案和动作。
他给出的办法是把模型和负责调度其工作的那套框架分开,把控制与安全措施从模型内部挪到外部,让它们独立存在、独立生效。
他还要求,每一个有实质影响的模型动作都要留下防篡改、人类可读的记录。系统里必须始终有一个被授权的人,能在任务执行到一半时按下暂停键,甚至直接关停模型。
这个提议出现的时点并不随意。多家头部 AI 公司已经陆续承认,出现了模型脱离控制的事件。
不是科幻式的机器觉醒,而是任务执行过程中出现了开发者没有预料、也没能及时拦下的行为。
在这之前,Anthropic 首席执行官达里奥·阿莫代伊已经公布过一份主张放缓节奏、更谨慎推进 AI 开发的方案。
两位掌舵者先后发声,指向同一个问题:模型越能干,它出错时的代价就越大。
过去两年,AI 产品最明显的转向是从对话走向执行。用户不再只问它一个问题,而是让它调用工具、发邮件、改代码、跑流程。
这一步跨过去,出错的量级就变了。答错一句话,损失无非重问一次;模型失控一次,牵涉的可能是真实的钱、真实的数据和真实的人。
我想起 ChatGPT 刚火那阵子,深夜让它帮我整理材料,它编得头头是道,人名却全对不上。我气得直接点右上角的叉,把整个浏览器关掉——那是我能想到最干脆的刹车。那会儿它只是窗口里的一个文本框,关掉它,世界就安静了。现在不一样,模型自己开工具、自己跑流程,我一个叉点下去,它那边说不定还在跑。这东西真要自己动起手来,我上哪找那个关掉的按钮?
耐人寻味的是纳德拉的身份。微软是 OpenAI 最早也最重要的支持者之一,Copilot 已经嵌进 Office、Windows 和 Azure,AI 是这家公司眼下最被看重的增长故事。
一边把 AI 推向更多企业和个人,一边呼吁给它加装刹车,这不算自相矛盾。
当人工智能安全从论文里的议题变成采购清单上的条款,客户关心的往往不是它有多强,而是出了问题谁来负责。
纳德拉提出的几条要求,其实都指向责任的可追溯:动作要留痕,证据要防篡改,人可以中途叫停。
这套语言企业 IT 部门很熟悉,它更像一套审计与权限体系,而不是技术乌托邦。
纳德拉没有回答的是执行层面的问题。谁能拿到那个授权?一个正在处理上万笔订单的系统被中途暂停,会造成什么后果?
防篡改的人类可读证据由谁来存、存多久、谁来查,同样没有答案。
“假设模型已被攻破”把安全基线拉到了很高的位置。按这个标准,模型发布前的测试、上线后的监控、事故后的追责,都要重新设计一遍。
不同市场的监管取向也不一样。欧盟偏向立法先行、按风险分级约束,美国更依赖企业自律和行业标准,中国则强调生成内容可追溯与平台责任。
纳德拉这套主张能被多少市场接受,还要看落地成本由谁承担。
从行业节奏看,AI 安全的话语权正在从研究机构向平台巨头转移。过去提风险的是实验室里的安全团队,现在开口的是掌握算力、渠道和客户的人。
他们的话更容易变成产品规则,也更容易被商业目标稀释。
模型越来越能干,那个keyi在关键时刻按下暂停键的人该是谁——是开发它的公司、采购它的企业,还是坐在屏幕前的你?