OpenAI 即將發布的尖端模型 Astra,因一項新的內部架構設計引發了安全討論。爭議的焦點不在於模型能力本身,而在於這類設計可能讓研究人員更難看清 AI 在執行任務時究竟是如何得出結論的。
採用更節省算力的循環式設計
據《The Information》此前報道,OpenAI在Astra的部分內部結構中使用了“recurrent depth”,也稱為“looped Transformers”。這類方法的特點是,讓一部分計算模塊被重複調用,而不是讓每個token都完整地經過整張網絡。
這樣做的直接好處是降低算力消耗。報導引用了相關研究,稱這類架構在部分場景下可以用更少的計算資源達到接近傳統 Transformer 的效果,對於正承受高昂 AI 成本的企业客戶來說,這一點尤其重要。
安全研究人員擔心監測難度上升
爭議來自模型推理過程的可視性。現有的推理模型通常會生成一連串中間步驟,也就是常說的「思維鏈」,研究人員可藉此檢查模型為何作出某個決定,或是否出現越權行為。
但在循環式的 Transformer 中,部分中間推理並不會以自然語言的形式呈現,而是以人類難以直接理解的形態在模型內部反複處理。研究人員有時將這類中間表達稱為「 neuralese 」。這意味著,人類所能看到的可能只有最終答案,而非完整的推理過程。
一些安全人士認為,這會削弱目前少數可用於監測代理行為的手段之一。華盛頓智庫的政策主管對《財富》表示,如果政府正在減少對思維鏈監測的依賴,這個方向「可能令人擔憂」,也可能帶來更高風險。
OpenAI 表示仍保留監測能力
面對外界質疑,OpenAI首席科學家Jakub Pachoki在X上表示,公司一直重視思維鏈監測,也在努力保留相關能力。他稱,Astra對這類架構的使用範圍有限,模型推理仍保持可讀性,未來還會披露更多架構細節。
Pachoki 同時表示,思維鏈監測未來確實可能會變得更加困難,但原因不一定來自於這次架構變化本身。他說,OpenAI 仍在不斷投入資源推進實時思維鏈監測,這也是目前研究的重點之一。
不過,部分研究人員擔心的並非只是 Astra 本身,而是行業示範效應。前 OpenAI 研究員 Daniel Kokotajlo 認為,即便 OpenAI 目前使用得較為克制,其他公司也有可能沿著這條路線繼續推進,最終讓模型推理過程對人類完全不透明。
成本優勢與行業先例並存
這類架構之所以受到關注,還在於它同時具備成本和競爭層面的吸引力。除了節省算力之外,隱藏部分中間推理過程也可能讓大模型更難被「蒸餾」(distillation),也就是更難被小模型通過學習輸出結果來複製。
在美國政府和多間 AI 公司持續關注前沿模型被複製風險的背景下,這種設計可能被更多企業視為兼顧效率與防複製的方案。但安全研究人員擔心,如果行業缺乏統一標準,未來更高效的模型也可能變得更加難以審計和約束。












