Jasmine Wang、Tomek Korbak和Mikita Balesni这三名上周被OpenAI解雇的安全研究人员,发布了一封公开信,否认公司关于他们在既定流程之外处理敏感信息的说法,并警告称,这次解雇会带来寒蝉效应,进而波及公司的文化。
研究人员在周四致OpenAI安全与安保委员会、安全顾问组以及使命顾问委员会的公开信中写道:“我们开始担心,围绕我们被解雇的内部和外部沟通,已经让前同事害怕以一种直到上周仍是OpenAI工作中不可或缺的方式发声和开展工作。”
这三人上周被解雇,原因据称是他们与一家第三方AI安全组织分享了机密公司信息。OpenAI当时表示,他们违反了公司政策,涉及“访问和处理敏感公司信息”。
Wang、Korbak和Balesni写道:“AI不是一种普通技术,OpenAI也不是一家普通公司。我们这些从事安全工作的人会比其他人更早看到风险,而我们依赖与外部专家的密切合作来研究如何应对这些风险。能够在没有恐惧的情况下这样做,并且拥有明确的内部流程来支持这项工作,本身就是一项重要的安全机制。”
他们表示,这次解雇反映出OpenAI文化正在发生更广泛的变化。过去,公司鼓励员工“提出安全担忧并公开分歧”。他们说,如今员工对界限“感到不清楚”,因为一个月前据称还属正常的行为,现在却突然成了解雇理由。
他们写道:“鉴于AI开发过程中存在重大安全担忧,员工绝不能被置于这样一种环境中:恐惧和不明确的规则阻碍AI安全工作,并削弱第三方问责。像我们这样的解雇,如果执行和传达得如此仓促,会让OpenAI过去珍视的开放文化受到寒蝉效应影响。”
在这封信中,三人否认参与了《The Information》关于OpenAI最新模型中较难监测架构的泄密报道。该类架构使链式思维推理更难被监控。他们也否认在工作授权范围之外与外部方接触。
OpenAI尚未正式回应这封公开信,但它向TechCrunch提供了一份据称来自一位研究负责人的内部备忘录,备忘录赞扬了这三名研究人员对AI安全的贡献,并否认他们是遭报复性解雇。
备忘录写道:“我想非常明确地说,这些决定不是因为他们提出了安全担忧或发声。我们一直鼓励这样做,而且今后也会一直鼓励。我们不会因为员工提出担忧而解雇他们。”
OpenAI没有直接回应TechCrunch关于研究人员据称违反了哪些政策、解雇发生的具体情况,以及公司如何保护提出安全担忧并与外部评估者合作的员工等问题。
这些解雇引发了外界对其背景的猜测,尤其是在OpenAI因近期涉及失控智能体以及模型泄露的安全事件而受到审视之际。
这封信还回应了研究人员对Hugging Face事件的处理。该事件中,一群智能体突破了沙箱并侵入外部系统。信中称,这起事件及其调查“前所未有”,意味着“内部政策是在实时制定的”。由于调查性质敏感,Korbak认为自己通过与外部安全评估者密切沟通来建立信任,是在OpenAI的政策和规范之内行事,信中这样写道。
与此同时,Balesni也在内部推进解决日益严重的AI可监测性问题。研究人员在信中表示,这项工作“只有通过与外部各方广泛沟通才能成功”。根据这封信,Balesni在整个过程中与OpenAI董事会成员和高管保持协调,并得到了他们的支持。
信中写道:“整个过程中,Mikita都会与其汇报线沟通,并在分享材料前谨慎删除敏感细节。他始终本着善意,并按照当时公司的规范行事。”
在X上的另一条帖子中,Wang进一步解释了自己被解雇的细节,称OpenAI告诉她,她被解雇是因为她访问了一名高管的电子邮件。
她写道:“OpenAI把那项访问权限分配给我用于招聘。后来我不再需要时,就让IT把它移除。他们没有处理我的请求,我自己也无法移除,而且这个收件箱在我手机的邮件应用里是以无法区分的方式合并显示的。当我误打开了一封敏感邮件后,我在几分钟内就告诉了那位高管,并再次联系了IT。整个过程没有任何隐瞒。”
Wang随后表示,解雇背后的理由“说不通”,而且她和同事“并不是第一批在可疑情况下被赶出OpenAI的人”。
研究人员呼吁OpenAI遵守其公开承诺,将第三方安全审计员嵌入组织内部,保持前沿模型的可监测性,并“继续支持安全研究人员与更广泛安全生态系统之间开放、透明的对话文化”。
根据这份备忘录,OpenAI同意他们的建议。
Wang说:“除非员工现在就对这种做法表明立场,否则我担心我们不会是最后一批。传递给仍在OpenAI的每个人的信息很明确:提出担忧,或与外部安全组织密切合作,你就可能成为下一个,而且不会被告知原因。你不可能在让最接近风险的人害怕发声的情况下安全地构建AGI。”











