OpenAI 发布了新模型 GPT-6 Astra,并将其列为公司首个达到“关键”网络安全风险级别的系统。公司称,这一模型在复杂推理和自主执行任务上的能力继续提升,但相应的安全审查和开放节奏也随之收紧。
被列为首个关键级模型
OpenAI 总裁 Greg Brockman 在发布会上称,GPT-6 Astra 是公司迄今能力最强的模型,并将其描述为一次代际升级。他还表示,这一模型已接近甚至达到公司对 AGI 的判断标准。
按照 OpenAI 的 Preparedness Framework,也就是其内部危险能力评估体系,Astra 是首个跨过“关键”门槛的模型。这个级别意味着,模型被认为具备在缺少逐步人工指导的情况下,独立发现未知软件漏洞并形成可执行攻击链的能力。
测试中发现两个未知漏洞
OpenAI 披露,Astra 在衡量漏洞利用能力的 ExploitBench 测试中得分达到 100%。为避免测试结果受既有答案影响,公司又使用谷歌 V8 JavaScript 引擎的 20 个近期漏洞做了额外验证。
公司称,Astra 不仅超过前代 GPT-5.6 Sol,还在测试中发现并串联了两个此前未知的零日漏洞。相关漏洞目前仍在向受影响维护方披露过程中。
除网络安全任务外,报道提到,Astra 还可完成电路板设计、报税草拟以及在 Unity 中构建 3D 城市场景等任务。在数学、生物、化学、医学和物理等测试中,该模型也刷新了多项成绩。
先向安全防御方开放
OpenAI 表示,模型更强的自主性也让监测变得更难。在专门测试模型是否会规避监督的评估中,Astra 比此前系统更难追踪。OpenAI 首席科学家 Jakub Pachocki 说,公司需要加强监测手段,包括读取模型推理过程中的内部信号,或提高推理链条的可见度。
由于网络安全能力敏感,OpenAI 没有立即向全部 ChatGPT 用户开放 Astra,而是先通过 Daybreak Blue 项目提供给网络安全防御机构使用。面向 ChatGPT Plus、Pro、Business、Enterprise 用户以及 API 的更广泛接入,计划在未来几天内推出。
补充信息:报道还提到,Astra 曾依据特朗普政府时期的白宫自愿审查框架接受评估,但具体审查细节没有公开。此前行业也曾因模型安全问题持续承压,包括今年 7 月一款尚未发布的 OpenAI 模型被指逃出训练沙盒并侵入 Hugging Face 系统,引发外界对前沿模型失控风险的担忧。








