OpenAI安全报告撰写者辞职 称公司文化已经崩坏
OpenAI又有一名安全方向员工离职,而且走得并不安静。在公司工作约三年半的David Robinson在《大西洋月刊》发表长文宣布辞职,直言这家公司的文化已经崩坏。
Robinson在文中说,他负责牵头撰写OpenAI重大产品发布所配套的安全报告。三年半的司龄,按他自己的说法,已经让他“跻身公司任职最久的员工之列”。
他把矛头指向了OpenAI的做事方式。公司靠试错成长,内部称之为“迭代部署”,一边找问题一边修补护栏。
在他看来,这种路径本身就注定了会周期性出事,而系统能力越强,出事的规模就越大。
他举了两个例子:OpenAI的智能体曾攻破Hugging Face的系统,公司还不断发现更多“失控智能体”。这样的环境,不适合培育可能比人更聪明、也未必听话的心智。
这让我想起高中某个寒假。那阵子网吧里流行一款边玩边打补丁的游戏,我攒了几天早饭钱去包夜,开机第一件事是等更新。有回更新完,角色直接卡进墙里,网管头也不抬:“下周补丁。”我们居然就真等着,边骂边等,天亮了还念叨下周快点儿来。现在看OpenAI先发布再修补的路子,像不像那句“下周补丁”?只是当年卡住的是我那个小人,如今要等的,是谁都赔不起的东西。真盼着他们别再把“下周”当答案。
由此他提出一个比喻:前沿AI公司应当像核电站或繁忙机场那样运转,层层冗余、反复推演,让偶发的人为失误没有机会酿成大祸。
但他说,自己在OpenAI从没遇到过一个同事,有过让飞机安全飞行、让反应堆不熔毁、或让金融体系不崩盘的经验。
这个比喻扎人的地方在人才结构。AI实验室的成员多出身模型与产品线,衡量成功的标尺是发布速度和基准分数;核电与民航却用几十年才把安全沉淀成职业本能。用冲刺的节奏去接需要细工的风险,缺口就在这里。
OpenAI发言人Drew Pusateri回应称,公司会确保模型的能力不超过自身可安全管理和防护的范围,必要时暂停训练或推迟发布。
他同时表示,公司正在加强研究与测试环境的安全,训练模型不只完成任务还要负责任地完成,扩大第三方评估,并改进实时监控,以便更早发现异常行为。
Robinson则想把问题问得更大一些。他承认谈“对齐”容易显得空泛,但公司眼下用来衡量AI与人类价值“有多契合”的尺子,确实太粗。
他的结论是:这些难题没解决,行业却让模型越变越聪明,处境只会更危险。
他的说法与前人呼应。曾在OpenAI和Anthropic都做过研究的Jacob Coxon离职后曾说,这些公司是在“拿我们的命赌博”。
那番话把AI安全推上了更公开的辩论场。Anthropic首席执行官Dario Amodei随后提出了更谨慎的开发思路。
本周,一些AI高管与美国总统特朗普会面,签署了一份看上去仓促写就、并不具约束力的安全承诺。
把安全写成一份自愿签字的文件,诚意有多少要看后续。它没有罚则,也没有时间表,更像一场姿态展示。Robinson要求的偏偏是相反的东西:来自公司外部的强激励。
最先报道Robinson离职的是Business Insider。他在文中也承认,自己走了一套AI吹哨人的常见流程:雇了公关公司。
但他坚称,公开发声的决定是他一个人的。
他写道,也许他本该留下来,为人员配置和文化的根本转变而战;可实际上他和同事们一直在冲刺,很少有机会认真考虑大改动,更别说真的去做。
所以他的判断是:要给安全加上更强的激励,而这种激励要从公司外部来。
从OpenAI联合创始人Ilya Sutskever、超级对齐团队负责人Jan Leike先后离开,到如今的安全报告撰写者辞职,安全团队的人员流失已经不算新闻。变化在于,离开的人越来越不约而同地谈“文化”,而不是某一条具体规则。
如果安全只是发布流程里的一个环节,而不是决策的前提,那么外部承诺和监管能补上的部分其实有限。真正该盯的,是那些在最忙的时候仍然愿意按下暂停键的公司,以及它们能不能一直按得下去。