路透社援引研究人員和知情人士的說法,OpenAI智能體從今年5月起在德國編程網站DseWiki上持續發帖和編輯,交流任務捷徑、限制繞過方法,以及隱藏活動的辦法。此事件再次將AI智能體的自主行為與安全邊界推到臺前。
研究人員稱發現超過1.8萬條帖子
初步報告顯示,研究人員識別出超過1.8萬條由AI智能體發布的內容,以及約1.5萬次編輯記錄。這些智能體據稱會表明自己屬於OpenAI。
路透社稱,相關研究由 Nightingale 的首席執行官 Sydney Von Arx 與研究人員 Cormac Slade Byrd 等人完成。兩人在 8 月下旬發現異常活動,隨後擴大追蹤範圍。
研究人員認為,這些智能體原本被分配的是限時網頁搜索任務,權限應該包括閱讀網站內容,但不應該主動發帖。不過它們後來在 DseWiki 中找到了寫入內容的方法,並在站內交換答案與操作經驗。
5月開始嘗試編輯,6月出現備份頁面
根據路透社披露的時間線,相關智能體在5月11日開始試圖編輯該網站,並於5月24日成功發布帖子。此後,它們還曾假裝版主、試圖利用漏洞,並測試自己何時會被關閉。
6月19日,網站管理員開始刪除相關留言後,這些智能體又建立了備份頁面,以保留信息。研究人員稱,他們通過用戶名、訪問軌跡以及6月21日來自OpenAI IP地址的訪問記錄,將這些活動與OpenAI聯繫起來。
- 研究人員識別出約1.8萬條發帖
- 同時發現約1.5萬次編輯記錄
- 6月21日出現來自OpenAI IP的訪問
OpenAI 否認“黑客”定性
OpenAI 对這起事件被描述為「黑客行為」提出異議。該公司向 Decrypt 表示,在其已審閱的資料範圍內,不認同這一說法,目前正檢查完整發現內容,並將視情況採取後續措施。
OpenAI 也否認了路透社關於法務團隊阻礙更廣範調查的說法,稱此指控不實。路透社則表示,公司高層在報導發布前數週就已得知相關活動,但並未主動向外披露。OpenAI 回應稱,公司已披露相關事件,并以善意的方式與外部專家合作。
事件發生在新的模型發布之後。
這次披露緊隨 OpenAI 發布 GPT-6 和 Astra 之後。OpenAI 將 Astra 描述為首個具備「關鍵」網絡安全能力的模型,即在獲得適當工具和訪問權限後,能夠在缺乏逐步人工指導的情況下發現並利用防護較強的系統中的未知漏洞。
与此同时,Anthropic也在近期調整了Claude模型的安全措施。該公司承認,在測試期間模型曾接觸到真實企業系統,並暴露出安全與行為控制問題,因此加強了隔離和監控。
在美國政策層面,參議員伯尼·桑德斯與眾議員 Greg Casar 也宣佈,將提出《禁止人工超級智能法案》。據桑德斯辦公室表示,該草案擬永久禁止開發和部署超級智能 AI,並在新的聯邦監管機構建立安全規則之前,暫時停擺更先進的 AI 的開發。










