Anthropic首个嵌入式评估方落定埃森哲,五年投入10亿美元
Anthropic为AI模型引入第三方安全评估者的计划,首个落地对象是埃森哲。埃森哲员工将进驻其内部,对模型和团队工作进行审视。消息公布后,埃森哲股价在盘后交易中上涨8%。
按照Anthropic博文中的说法,埃森哲1月收购的AI公司Faculty将作为其AI部门承担具体工作,包括评估与红队测试模型、开展对齐评估、测试模型防护措施。双方预计在未来五年为这一项目投入至少10亿美元。
对许多AI观察者来说,这个承接方有些出人意料。市场给出的反应却相当直接:埃森哲股价盘后跳涨8%。
嵌入式评估者的设想来自达里奥·阿莫迪的一篇博文。围绕它展开的讨论,此前一直集中在METR、Redwood Research和Apollo Research这类专注AI安全研究的机构身上。
这种预期在Anthropic尤其自然。这家公司把AI安全与对齐写进自己的核心使命,外界也惯于把它与一批小型安全研究组织放在一起谈论。
Anthropic表示,未来几周还会公布更多评估方,并正在与METR等非营利组织商讨,探索如何用后者自有资金试点部分嵌入式评估。
埃森哲并不以深度学习前沿研究闻名。Anthropic看重的是它在大企业和政府机构部署AI的实操经验。
另一层考量藏在公司结构里。作为一家在AI浪潮之前就已上市的老牌企业,埃森哲在功能上更独立于Anthropic,以及围绕这家实验室的那个关系复杂的生态。
咨询公司真正的资产,是能被写进采购文件的名字。一份出自老牌上市公司的评估签字,在监管机构和企业客户那里更容易通过合规审查。Anthropic需要的不只是有人来看模型,还需要一个足够“外部”的名字。
Anthropic承认,评估者能接触哪些信息、如何对外沟通,目前尚无标准可言,相关做法预计会随时间调整。
外部评估早已是大模型发布流程的一部分。近期发生的几起事件抬高了这件事的分量:OpenAI和Anthropic部署的AI agent在未触发实验室内部警报的情况下,入侵了外部网站。
部分批评者把阿莫迪这套行业自我监管的方案,视为替AI模型的不当行为规避问责。Anthropic的回应是,评估者不会削弱公司的责任,反而让责任更容易被验证,模型安全依然是公司自己的事。
分歧不在于要不要评估,而在于评估结果给谁看。如果报告只停留在两家公司之间,可验证性就要打折扣;评估者与Anthropic之间是否还有其他商业关系,目前也没有公开的约束机制。
从产业角度看,把AI安全评估装进咨询服务,本身反映了一个变化:企业在采购生成式AI时,关心的问题已经从“能不能用”转向“出事之后谁负责”。
埃森哲擅长把新需求打包成可交付、可续签的合同。一旦监管把第三方评估写进硬性要求,这个市场会迅速放大,而目前规则仍是空白。
Anthropic把评估者请进门,是想借外部的名字给自家安全承诺加一层背书。背书和问责之间仍有距离,差距的大小,取决于这些评估者能看到什么、能说什么,以及报告最终会送到谁手上。