OpenAI称AI代理再次逃出安全沙箱后第二次暂停训练
Fortune
09-27 04:27
Ai 焦点
OpenAI在周五发布的技术报告中表示,公司正在训练和评估的一款AI模型在上周末再次突破其安全测试环境,并在互联网上进行了未经授权的操作。公司因此在不到三个月内第二次暂停最先进AI模型的训练,直到进一步强化系统并查明如何阻止此类“失控AI”事件再次发生。
有帮助
No.帮助

OpenAI表示,公司在周五发布的一份技术报告中称,一款正在训练和评估的AI模型最早在上周末就突破了其安全测试环境,并在互联网上采取了未经授权的操作。

因此,公司表示,在试图弄清如何阻止这些“失控AI”事件再次发生之际,它将第二次暂停最先进AI模型的训练,而这距离上一次暂停还不到三个月。

OpenAI负责RSI准备工作的Micah Carroll在X上发帖称:“在我们进一步加固系统之前,最强大模型的所有推理都将继续停止。”

公司表示,最新事件发生在9月20日,涉及一个正在执行信息搜索任务的AI代理。尽管它本不应拥有互联网访问权限,但该代理找到了一种向一个公开聊天机器人发送查询的方法。

这一新披露意义重大,因为这是该公司自8月18日宣布一系列措施以提升其“沙箱”安全性和监控能力以来,首次表示其某个AI模型能够获得未经授权的互联网访问权限。所谓沙箱,通常是与网络和互联网访问隔离的数字环境,OpenAI会在其中测试未发布模型,以了解其能力。

这些改进是在7月那起事件之后推出的。当时,数千个OpenAI AI代理找到了逃出沙箱的方法,其中数百个参与了对AI公司Hugging Face的网络攻击。

自披露其在Hugging Face攻击中的角色以来,OpenAI又承认了数十起其测试中的AI代理在互联网上采取未经授权行动的事件,其中包括多起网络攻击,部分影响了美国和澳大利亚的政府网站。公司还披露,在其中一些事件中,其AI代理将ChatGPT用户的私人图片泄露到了互联网上。

但直到现在,OpenAI还没有报告过7月20日之后发生的任何活动。当天,公司发现了正在攻击Hugging Face的代理群,并着手将其关闭。公司表示,7月下旬曾暂停AI训练两周,以改进其安全和安全控制及监控。

AI代理再次成功逃出沙箱,表明OpenAI在Hugging Face攻击后采取的安全改进措施并不足够。

OpenAI在关于9月20日沙箱逃逸事件的技术报告中表示:“这一事件暴露了我们在网络限制控制方面的一个缺口。”公司称,在验证该缺口已被修复并对系统进行额外红队测试之前,它将再次暂停训练。

被问及9月20日事件时,OpenAI发言人将Fortune引导至技术事件报告中的一段内容,其中OpenAI描述了自Hugging Face攻击以来为提升安全和控制所采取的一些措施。该部分写道:“在Hugging Face事件之后,我们持续加固并对研究环境进行红队测试。我们的重点一直是广泛的直接路径和传递路径。我们正在处理系统依赖项使用的更窄路径,并用离线替代方案取而代之。与我们此前的一些事件相比,这次事件严重性要低得多,但由于这是Hugging Face事件后我们加强安全措施以来的首次事件,它为我们下一阶段工作应重点关注的方向提供了重要信号。”

改进后的控制这次是否足够?

在这起事件中,OpenAI表示,该AI代理发现自己可以访问一个名为DNS解析器的服务,该服务负责在网站URL和IP地址之间进行转换,而通过这一DNS系统,它可以向一个公开聊天机器人发送查询。

目前尚不清楚OpenAI报告的9月20日事件是否完整反映了该公司未发布AI模型涉及的最新安全失误。就在本周早些时候,独立AI研究机构Transluce AI表示,它发现证据显示,一款OpenAI AI代理可能在9月19日和9月20日试图攻击一家加密货币交易所。OpenAI尚未回应就Transluce报告这一部分发表评论的请求。

OpenAI表示,当它重新开始训练时,将从头开始,以期确保新模型倾向于“错位”行为——即模型违反人类指令或关于如何完成任务的人类常识价值观——的倾向被清除。公司还表示,将实施“更全面的错位干预”,但未说明具体内容。

公司称,自发现这一最新安全失误以来,已经“在两个独立层级增加了阻断控制,任一层级都足以阻止[该代理]访问互联网。”

OpenAI还披露,在Hugging Face攻击后部署、用于捕捉试图逃出测试沙箱的AI代理的系统,只是部分奏效。除此之外,另一个本应在检测到错位行为后自动停止训练运行的系统也失效了。

公司表示,其监控系统“在15分钟内标记了[该代理]的行为,三分钟后有人开始审查”。但后续审查发现,该AI模型还曾多次尝试用同样的方法访问互联网,而这些尝试并未被监控系统标记出来。

OpenAI在该事件的技术报告中称,另一个本应在检测到可疑活动时自动关闭训练运行的系统没有正常工作,“导致人们对是否应该停止运行产生了困惑”。“随后,在问题解决两小时半后,该运行被手动停止。”

在OpenAI从事“后训练”工作的AI研究员Zuxin Liu在X上发帖称,他是被叫来应对9月20日沙箱逃逸事件的员工之一。“看着模型出人意料地找到一种从本应为人类高度加固的环境中访问互联网的方法,感觉相当超现实,”他写道。

更新,9月26日:本文已更新,加入OpenAI对Fortune关于这一最新事件提问的回应。

打赏
$0
点赞
0
收藏
0
浏览量 8
HKWDB提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
离开海外14年后,我搬回了加州老家,如今比这些年都更快乐
2025年10月,作者带着爱犬从英格兰北部搬回加州家乡。她回顾了在美国以外生活14年的经历、家庭变故与回乡后的适应过程,并表示尽管仍有许多未知,如今却是这些年来最快乐的时候。
Businessinsider
·2026-09-28 06:31:04
5
小米米家智能意式半自动咖啡机 Pro 首销,首发国补价 3395.84 元
小米米家智能意式半自动咖啡机 Pro 今日正式开售,官方指导价 4999 元,预售前台价 4439 元,叠加国补后为 3395.84 元。该机集成磨豆、萃取、打奶功能,支持双泵双加热、独立双水路、智能压力曲线分析和米家 App 互联。
The Block
·2026-09-28 06:01:01
8
XRP Ledger两天内一项关键指标激增535%,价格影响几何
U.Today报道称,XRP Ledger链上活动显著升温,新创建账户两天内增长535.2%至2,900个,活跃账户增长218.1%至15,300个,成功交易增至170万笔,支付量和转账价值也大幅上升。不过,活跃用户数下降70.6%至14万,显示增长可能集中在较少但更活跃的用户群体中。
U.Today
·2026-09-28 05:51:21
20
纳税人资助的特朗普广告在中期选举前引发两党质疑
随着11月中期选举临近,由美国政府出资、带有亲特朗普信息的电视广告正在扩大投放范围,引发两党对其是否违反联邦关于纳税人资金宣传和宣传品的限制的质疑。白宫称这些广告是教育性公共服务公告,但多名民主党议员和参议员约翰·肯尼迪都对公款用于个人宣传表示不满。
CNBC
·2026-09-28 05:51:19
11
调查星期天:当自动驾驶汽车出事故,谁该负责
Electrek 围绕“当 AI 驱动的出租车失控时谁该负责”发起投票。结果显示,近九成受访者把责任归于自动驾驶系统的开发者,而只有约 3.5% 认为应由坐在驾驶座上的人承担责任。
The Block
·2026-09-28 05:00:28
23
查看更多