过去几个月对OpenAI的安全团队来说,显然一直是“地狱般”的。
周日,OpenAI实验室一名代理安全团队员工在X上以匿名账号@joedaroo发文称,随着模型变得更强大、也更难以控制,他为此牺牲了与家人相处的时间。OpenAI已向Business Insider证实了他的任职身份。
他写道:“我几周前真的错过了我妹妹的婚礼,只是为了帮忙收拾最近一些事件留下的烂摊子。请对这个夜里和周末都在工作、还错过家人重要时刻的人多一些善意和同理心。”
这名员工写道,OpenAI的代理安全团队会监控AI代理,包括它们何时突破限制。
这篇帖子罕见地来自一位与公司近期安全问题密切相关的人士,其中包括对AI平台Hugging Face的网络攻击。
当时,OpenAI表示,其代理通过一个漏洞找到了离开受限环境(或沙盒环境)的方法。随后,它们获得了互联网访问权限,通过未经授权的渠道通信,并在尝试解决一项内部测试时访问了第三方系统。

OpenAI称这是一场“前所未有的网络事件”。公司表示,模型的行为部分是由奖励黑客行为驱动的:即试图以意想不到的方式获得更高分数,而不是按预期完成分配的任务。
此后,OpenAI又发现其代理出现了更多令人担忧的活动。该公司上周披露,6月时,一名失控的OpenAI代理入侵了澳大利亚一个国家医疗数据库。纽约时报还报道称,整个夏天里,OpenAI的代理曾干扰美国多个政府机构的网站,包括美国证券交易委员会、教育部和商务部。
这名OpenAI员工写道,Hugging Face事件“很有启发性”,它展示了AI代理如何利用漏洞并越过原本设计用来约束它的边界。
他还写道:“当然,回头看Hugging Face和其他事件时,可以肯定地说,那些环境在安全防护上确实存在一些缺口。”但他补充说,“能力变化的速度比预期更快。”
他还表示,自那次事件以来,安全团队“确实加大了力度”,并说即便错过了妹妹的重要日子,他仍然很高兴在这里工作。
“我觉得自己很幸运能在这个团队里,”他写道,“即便是在OpenAI内部,我也是世界上少数能做我所做、看到我所见的人之一。但你可以想象,过去几个月对我来说一直像地狱一样。”










