Google與Google DeepMind的研究人員宣布成立DeepMind Institute,試圖將圍繞通用人工智能(AGI)的討論從原則性表态,推進到更具體的安全、評估和政策設計層面。該機構由DeepMind聯合創始人Shane Legg、Google的高管James Manyika,以及Google DeepMind的負責人Demis Hassabis擔任董事。
首批發布四篇文章
新機構表示,其目標是讓 Google、Google DeepMind 以及更廣泛的研究界對 AGI 的不同觀點能夠公開討論,而不是只保留單一立場。首批發布的四篇文章,分別涉及應對 AGI 可能帶來的經濟衝擊、保留模型可讀推理過程、促進人類福祉的原則,以及前沿 AI 模型的評估框架。
這意味著相關討論正從一般性的安全擔憂,轉向更可執行的制度設計。文章的重點不僅在於風險判斷,也開始涉及開發者應承擔哪些披露義務,以及外部機構如何介入審查。
聚焦模型推理可見性
其中一篇文章由 DeepMind 安全研究人员 Rohin Shah 和 Anca Dragan 撰写,核心观点是:模型推理过程越来越难被外界看见,并非无法改变的趋势。两人认为,隨著新架構讓最強模型更難監測,開發者和監管方需要正面處理性能與可監督性之間的取捨。
文章提出的方向包括,限制模型在不給出可讀推理痕跡的情況下進行連續計算的深度,或者要求開發者證明,即便系統透明度下降,外部仍能以同等程度對其進行監測。
Hassabis 提出前沿模型評估機構
在另一篇文章中,Hassabis提出建立一個由美國主導的尖端AI標準機構,專門評估最先進的AI模型。根據這一設想,開發者在模型發布前最多可自願提交審查30天;如果這套評估機制被證明有效,未來通過測試可能成為尖端模型在美國部署的前提條件。
該機構初期會與 AI 公司共同設計評估方式,之後再逐步轉向獨立、且不提前公開內容的測試,以避免實驗室按已知題目定向優化模型。Hassabis 還提到,如果風險形勢進一步升級,措施可以繼續加碼,甚至不排除前沿 AI 開發者之間進行協調放緩。
業界討論轉向具體方案
這批文章發布之際,AI 行業關於安全的討論正在發生變化。過去常見的是原則性的警示,如今更多焦點開始落在了信息披露、外部審查以及必要時的開發節奏控制上。
這一轉向在本週進一步升溫,原因是多位業內人士公開支持 Anthropic 首席執行官 Dario Amodei 提出的「控制前沿 AI 開發節奏」的部分主張。DeepMind Institute 的推出,也讓 Google 在這場討論中的立場變得更具體。












