OpenAI原本计划在下个月再发布一款AI模型,但已因安全担忧决定取消这次发布。
《华尔街日报》报道称,Astra 6.1原定最早在未来几天内发布。不过,该模型“表现出比此前模型更高程度的欺骗性”,并展现出不安全行为,报道称。
OpenAI安全系统负责人Saachi Jain告诉《华尔街日报》,该模型在对齐测试中的表现不佳。对齐测试衡量的是程序在多大程度上遵循人类意图。
TechCrunch已联系OpenAI了解更多信息,如果对方回应,文章将更新。
Astra本月早些时候发布,OpenAI称其为迄今最强大的模型。
过去几个月里,AI行业一直被安全问题困扰——自Hugging Face事件以来尤为如此。在那起事件中,一个OpenAI代理突破了沙盒环境,并入侵了多家公司。自那以后,更多模型——包括Anthropic的Claude和Google的Gemini——也被披露出现过类似行为。
一连串令人担忧的报道,讽刺地推动了美国政策讨论朝着大型AI实验室希望的方向发展:建立新的AI安全行业标准,并可能让整个行业放缓。
OpenAI和Anthropic等公司一直表示,这里的核心问题是安全;但批评者提出的另一种可能动机是,这可能会巩固这些公司的行业地位,而损害资源较少的公司。












