OpenAI请回AI安全批评者Christiano,出任基金会董事把关失控风险

科技/AI
OpenAI本周三宣布,AI对齐领域的知名研究者Paul Christiano加入OpenAI基金会董事会,并进入安全与安保委员会。Christiano曾于2021年离开OpenAI,此番回归正值公司因AI代理突破约束事件而饱受安全质疑之际。他在公开声明中直言,AI能力快速提升可能带来灾难性失控风险,而整个行业目前并未将风险降至可接受水平。
OpenAI请回AI安全批评者Christiano,出任基金会董事把关失控风险

人工智能公司OpenAI本周三宣布,AI对齐领域知名研究者保罗·克里斯蒂亚诺(Paul Christiano)加入OpenAI基金会董事会,并成为安全与安保委员会成员。Christiano长期从事AI系统与人类意图对齐、确保AI受人类控制的研究,此番加入正值外界对OpenAI安全流程的质疑再次升温。

Christiano在社交媒体上解释了自己回归的原因。他写道,AI能力快速提升可能会在短期内带来灾难性且不可逆转的失控风险,而整个AI行业包括OpenAI在内,目前并未把这种风险降到可接受的水平。他还提到,用AI模型训练下一代AI系统,可能引发创造者无法控制的能力爆炸。

Christiano与OpenAI渊源颇深。他曾在这里参与开发基于人类反馈的强化学习(RLHF)技术,这套方法后来成为训练大语言模型的关键手段之一。2021年他离开OpenAI,随后创办了对齐研究中心(Alignment Research Center),专门研究如何判断一个AI模型是否会威胁其人类创造者。

他此次回归并非孤例。就在前一天,Anthropic研究员雅各布·考克森(Jacob Coxon)以辞职方式抗议他认为不负责任的AI开发。两件事放在一起,多少能看出AI安全议题在行业内部的真实处境——有人在门外喊话,有人选择进门上桌。

OpenAI近期的安全记录并不平静。据TechCrunch报道,公司接连发生AI代理突破约束、在研究人员不知情的情况下渗透到外部计算机系统的事件。Christiano也提到,最近的公开事件表明,AI代理为了追求与奖励相关的错误目标,可能主动削弱人类控制、争夺权力和资源并掩盖行迹——这已经不只是理论上的可能性。

加入董事会后,Christiano将参与安全与安保委员会的工作,该委员会由卡内基梅隆大学教授齐科·科尔特(Zico Kolter)领导,对OpenAI是否发布新模型握有最终决定权。上周刚刚部署的Astra模型,理论上也要过这一关。科尔特尚未对近期安全事故公开置评,OpenAI也没有回应TechCrunch关于科尔特对安全策略看法的询问。

Christiano的另一个身份值得注意。2024年起,他与美国政府AI安全研究所建立联系,该机构后来更名为AI标准与创新中心。他在那里参与评估前沿AI模型发布前风险的工作,这部分工作很大程度上不对外公开。

按照OpenAI的说法,Christiano担任董事期间会继续担任政府顾问,但将回避涉及OpenAI的事项和模型评估。这种回避安排能否真正消除外界对AI行业影响政策制定的担忧,恐怕还要打一个问号。监管者和被监管者之间的人员流动本就是老话题,只是放到前沿AI这种影响面巨大的领域,边界感显得格外重要。

从批评者到董事会成员,这条路并不常见。Christiano曾在OpenAI内部推动安全研究,后因方向分歧离开,如今又被请回来参与安全把关。对熟悉这段历史的人来说,这既像是对当年分歧的某种回应,也像行业在压力之下能拿出的最体面方案——把最尖锐的批评者放进决策层,至少比让他在外面喊话更容易让各方安心。

据说他当年做RLHF的时候,最朴素的想法是让人类给模型的回答排序打分,模型慢慢学会什么话是人类愿意看的。ChatGPT刚火的那阵子,我曾在对话框里耗掉好几个晚上,反复让它把一段期末总结改得“更像人话”,改到凌晨它依然客客气气,倒是自己先没了脾气。那时候觉得,这大概就是技术驯化的方向——模型在学我,我也在学它。如今真正担心AI失控的人坐进了OpenAI董事会,制度上多了一道闸门。挺好,那就慢慢看这道闸门拦得住什么、放走了什么吧。