Anthropic 訓練 AI 檢查 AI:不給予正常案例,誤報率直接衝到97%
2026-08-27 18:49:49
幣界網消息,Anthropic研究人員訓練了一種專門調查其他AI的agent。他們在目標模型中植入偏見、欺騙等隱藏行為,讓Haiku在最多15輪中反複測試。訓練時,研究人員不會告訴Haiku是否抓對了。每次調查後,系統會將其與舊版Haiku的記錄進行比較,再由Sonnet4判斷哪次查得更好。如果訓練題都是有問題的模型,Haiku會默認所有模型都有問題,導致誤報率接近97%。研究人員隨後將一半訓練任務換成正常模型,只有正確判斷目標模型沒有問題才能獲得獎勵。訓練後的Haiku開始主動換场景、控制變量,最終綜合審計得分從44.2提高到48.7,接近Opus4.6的48.4。換到更難的auditbench,檢測率從11.5%提高到最高28.1%。
利好 0
利空 0
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。