Meta 首席 AI 官 Alexandr Wang 驳斥 SemiAnalysis 「刷榜論」:老測試早已飽和
2026-09-08 16:23:28
幣界網消息,Meta首席AI官Alexandr Wang駁斥了AI研究機構SemiAnalysis的「刷榜論」,稱老測試早已飽和。SemiAnalysis指出,Gemini3.8和Muse Spark1.3是目前最明顯的「benchmaxxed」模型之一,分别在Terminal-bench2.1中获得89.4%和88.8%的成績,接近GPT-6BJWKEEP_00014__和Claude Fable5.1。然而,在剛發布的Terminal-bench4.0中,這兩款模型的成績僅為19.1%和33.3%。Wang認爲,Terminal-bench2.1已經飽和,無法有效區分頂尖模型,而4.0仍未飽和,且刪除了部分飽和任務並調整了測試條件。
利好 0
利空 0
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。