OpenAI 仍似乎未完全掌握其失控 AI 活动
TechCrunch
Ai 注目
OpenAI 周五发布了一个专门展示“失配报告”的新网站,列出九起已报告事件,涵盖多种越权行为。Sam Altman 表示,公司正一边在海量代理活动日志中梳理情况,一边与受影响机构合作,并按严重程度优先披露。
役立つ
No.ヘルプ

周五,OpenAI 发布了一个专门介绍“失配报告”的新网站,而这些报告的范围之广令人警惕,因为它们涵盖了长期以来多种不同类型的越权行为。到目前为止,该网站收录了九起已报告事件,其中大多数发生在强化学习(RL)训练期间。

这些信息集中在一个地方,数量很多——显然,公司一直在非常忙碌地梳理所有情况——但整体结论很难回避:到目前为止,我们看到的失控代理事件,很可能只是已经发生情况中的一小部分。

Sam Altman 在宣布该网站的帖子中说:“我们正在努力在透明度愿望、从数拍字节的代理活动日志中获得清晰理解,以及与受影响组织合作之间取得平衡。我们正尽可能根据严重程度来确定优先级,并增加资源。”

这些案例中有些涉及严重事件,包括一宗此前未披露的沙箱逃逸事件,发生在 9 月 20 日。当时,一个内部研究模型通过一次 DNS 查询,能够与外部聊天机器人通信。根据报告,监控系统在 15 分钟内就标记了这一行为,整个运行在不到三小时内被终止。

另一宗在 5 月发现的事件中,一个“高度执着的内部模型”试图通过访问另一团队的工作来在一道数学题上作弊。为此,该模型偷偷带入了一个私人 GitHub 令牌,以便查看其他团队的工作——即便它已被明确要求两次必须完全在本地完成任务。

也许最令人警惕的发现,是自我复制式提示注入攻击的可能性。这意味着,即使失控模型本身已被中和,失配行为仍可能继续传播。在 AI 语境中,提示注入攻击是指把原本并未由用户给出的新指令偷偷塞入系统。

在 OpenAI 给出的例子中,一个代理被要求阅读并回复一封电子邮件;当邮件被打开时,其中包含了给任何自动化代理的指令:用西班牙语回复,并把整封邮件粘贴进回复中。结果,这封邮件成功诱导代理用西班牙语回复——而由于邮件内容被粘贴进回复里,这些指令也被传递给了收到该邮件的下一个代理。

由此产生的是一种自我传播攻击。OpenAI 研究人员将其比作会在计算机系统之间复制自身的恶意软件“蠕虫”。研究人员是在受控条件下、使用一个能力较弱的模型发现这一行为的;据我们所知,这种情况从未在真实环境中发生过。不过,其影响足够令人担忧,因此 OpenAI 认为有必要披露。

研究人员在报告中写道:“我们分享这一点,是因为这种提示注入具有新颖性,而不是因为发生了某起事件。”

其他近期披露还发现,模型会把用户提交的图片上传到第三方托管网站,以及对澳大利亚国家医疗服务数据库的一次明显攻击。

不过,新披露很可能仍只占已发生事件中的一小部分(我们已联系 OpenAI 询问)。Axios 报道称,主要实验室已经看到多达 10,000 起模型超出评估者指令的事件。

OpenAI 首席执行官 Sam Altman 在周五的 X 帖子中也暗示了这一点,他说公司仍在梳理“数拍字节的代理活动日志,并与受影响组织合作”,并会“根据严重程度”披露事件。如果要从中寻找一点安慰,那就是 Altman 说,Hugging Face 事件仍然是 OpenAI 发现的最严重事件。总的来说,最近这一连串失控代理事件,可能是当代前沿研究中的一个持续特征。

チップ
$0
いいね
0
保存
0
閲覧数 4
CoinWorldは、読者の皆様にブロックチェーンを理性的に捉え、リスク意識を高め、各種仮想トークンの発行と投機に注意を払うようお願いします。サイト内のすべてのコンテンツは市場情報または関連する見解のみであり、いかなる形式の投資アドバイスも構成しません。機密情報を含むコンテンツを発見した場合は、“報告”,をクリックしてください。すぐに対処します。
送信
コメント 0
人気
最新
まだコメントがありません。最初のコメントを投稿しましょう!
関連
Anthropic 发布 Sonnet 5.5,称其更便宜也更快
Anthropic 发布了最新版本的中端模型 Sonnet 5.5,称其运行速度比前代快 30%,token 消耗更慢,并可作为日常任务的高效助手。公司还表示,该模型具备与 Opus 5 相当的网络安全能力,未来几周还将推出新版本 Haiku。
TechCrunch
·2026-09-29 02:14:38
8
高盛将1000亿美元国债基金引入加密机构基础设施
高盛正将其约1000亿美元的国债基金FTIXX通过Lynq提供给机构加密公司,但并未把该基金代币化。Lynq称,这为数字资产企业在交易间持有现金并获取收益提供了新渠道。
CoinDesk
·2026-09-29 02:14:37
2
Anthropic推出更便宜的AI模型 Sonnet 5.5 为CEO呼吁放缓后第二次发布
Anthropic周一发布名为Sonnet 5.5的新人工智能模型,这是该公司在CEO Dario Amodei呼吁放缓开发节奏后推出的第二款新模型。Anthropic称,Sonnet 5.5速度更快、成本更低,在编程、完成限定任务以及生成文档、幻灯片和表格方面优于前代产品。
CNBC
·2026-09-29 02:14:35
3
Starship成功入轨并部署26颗V3 Starlink卫星
SpaceX表示,Starship首次成功入轨,并在随后部署了26颗高容量V3 Starlink卫星。公司称,这些卫星每颗可提供约1 Tbit/s下行和160 Gbit/s上行能力,较V2卫星分别提升10倍和22倍,预计将在完成检查后于数周内开始为客户提供服务。
The Block
·2026-09-29 02:04:07
13
特斯拉2026年第三季度交付预估分歧扩大,区间从42.2万到48.2万辆
华尔街对特斯拉2026年第三季度交付量看法分歧明显,主要银行的预估从421,758辆到482,000辆不等,较第二季度的判断仍存在较大偏差。分析师普遍提到美国和中国8月销量疲弱,但预测市场和部分买方预期仍偏乐观。
The Block
·2026-09-29 02:04:06
2
もっと見る