Anthropic 在9月18日宣布與埃森哲合作開展前沿的AI獨立評估。該項目由埃森哲旗下的專業AI業務Faculty牽頭,計劃評測和紅隊測試模型、進行對齊評估並檢查安全措施。雙方預計未來五年各自至少投入10億美元,用於建設相應能力。金額很大,但這筆錢不是一次性支付的收購價,也不是已經完成的投资,而是兩家公司對五年能力建設的預期投入。
這項合作的特殊之處在於「嵌入式評估」。傳統的外部評測者通常在模型發布前後只能獲得有限的接口、文檔或測試環境,觀察範圍受到企業提供的資料的限制。嵌入式評估員將進入 AI 公司內部,獲得接近員工的系統和流程的訪問權限,希望能夠看到訓練、部署與風險管理的更多環節。Anthropic 表示,這是落實其讓第三方進入實驗室的承諾的一步。
不過官方也明確承認,嵌入式評估仍屬於新做法,許多運營細節仍在制定中。誰來決定測試範圍、報告能否公開、發現問題後誰有權阻止發布、評估員如何避免利益衝突,目前都無法從一份合作公告中得到完整答案。將評估員“請進門”只不過是增加可見性,並不能自動產生獨立性。
接近員工的權限擴大了證據範圍,也擴大了治理與保密壓力
前沿模型的風險並不僅存在於最終的聊天接口中。訓練數據處理、內部代理、算力分配、安全分類器、工具權限以及部署流程等都可能影響最終結果。如果外部人員只能看到成品,就很難判斷風險是來自模型本身還是系統設計。嵌入式團隊更接近於這些環節,他們有機會檢查企業內部的評估是否遺漏了重要的場景,並驗證安全聲明是否與實際流程一致。
更深的訪問也意味著更高的泄密和權限風險。評估人員可能接觸到模型權重、未公開的能力、客戶數據或安全漏洞。合作雙方需要劃定最小權限、審計訪問、隔離項目並明確數據留存。否則,原本為提高透明度而設定的通道,反而會成為敏感信息的新入口。評價體系必須同時證明「看得夠多」和「不會拿走不該拿的东西」。
埃森哲的優勢在於了解企業和政府如何部署AI。實驗室基準通常關注模型是否能夠完成任務,但真正的風險還取決於模型連接到哪些數據和工具、用戶如何批准行動、組織是否有回滾機制。評估者熟悉生產環境,能夠設計更貼近業務的攻擊場景。不過,埃森哲同時也是大型AI的諮詢與實施商,它與模型供應商及客戶之間存在商業關係,其獨立性需要通過結構化規則而非品牌聲譽來保障。
雙方各投入至少10億美元,但也可能引發另一層疑問:在評估業務規模擴大後,誰是付費客戶?誰將擁有最終結果?負面結論是否會影響後續合約?真正可信的制度應該公開評估方法、衝突管理機制、重大問題升級流程以及報告邊界。金額固然能購買到人力和基礎設施,卻買不到公眾對結論的信任。
紅隊測試本身並非萬能保險。攻擊者可以不斷發明新的方法,模型更新也會改變行為。一輪通過並不代表長期的安全性。嵌入式評估的價值在於,它能持續觀察版本、部署和事故,而不仅仅是在發布前進行一次測試。要實現這一點,評估員需要穩定的權限、重測的權力,以及對整改結果的追蹤能力。
合作已宣布,真正成效要看評估員能否公開說「不」
Anthropic 将合作與對控制的掌控力 AI 發展速度聯結起來。若評估發現模型能力或監督機制超出安全邊界,制度是否允許推遲訓練、縮小部署或增加限制,將決定這是否構成實質性的約束。只有提供建議而沒有升級權,嵌入式評估可能會變成更深入的諮詢服務,而非獨立的監督。
第三方也不能只由一家機構代表。不同團隊在網絡安全、生物風險、欺騙行為和社會影響上的專長不同,方法也會產生偏差。Anthropic 此前表示計劃引入多個獨立組織。埃森哲的合作可以是一部分,但不應排除學術機構、非營利評測者和監管部門的驗證。
公開透明存在合理的邊界。漏洞細節、模型權重和客戶信息不適合全部披露,但完全保密又無法讓外界判斷評估是否嚴格。可行的做法包括發布方法概要、重大風險分類、整改狀態和第三方簽名結論,同時對敏感技術細節設定延遲或受限訪問。公告目前沒有給出完整的報告制度,因此不能把合作寫成已經建立了透明審計體系。
投資計畫同樣需要按階段來看待。「未來五年各至少10億美元」是預期,並非今天就已經有20億美元到賬,也不代表全部用於單一模型的審計。人員培訓、工具、計算資源、企業部署評估與研究等都可能被計入其中。後續應關注年度投入、團隊規模、完成的獨立評估數量以及公開成果。
這次合作說明,前沿實驗室開始承認,僅靠內部安全團隊難以獲得充分的社會信任。將第三方置於更接近研發現場的位置,是比遠端黑盒測試更強的一步。但評估是否獨立,並非由辦公地點決定,而是由權限、資金、報告權和否決機制決定。未來最關鍵的證據,不是雙方宣佈投入多少,而是當評估結論與商業發布時間發生衝突時,評估員能否完整記錄問題、推動整改,並在必要時讓外界知道。










