Google 在9月2日發布了 Gemini 3.8 版本,以及專為網絡防禦設計的3.8版本。距離3.7版本的推出僅有三週時間,這也是六週內第三次對 Flash 系列進行更新。Google 將3.8版本定位為目前最強的推理與編碼模型,普通版本已推廣至 Gemini API、Google AI Studio、Android Studio、Gemini Enterprise 以及部分消費者產品;而 Cyber 版本則通過新的 Fairwind Program 途徑,優先向可信的政府機構、關鍵基礎設施運營者及軟件維護者開放。兩者共享基礎智能,但部署權限與安全防護措施並不相同。
普通3.8 Flash 的介紹價格仍然是每百萬輸入 Token 0.75美元、輸出3.75美元,與3.7相同。不過這個價格只持續到2026年12月31日;從2027年1月1日起,官方列出的價格將上升至輸入1.50美元、輸出7.50美元。更容易被忽略的是,模型在複雜任務上會執行更多推理步驟並反複調用工具,Google 明確提醒高努力等級可能消耗更多 Token。單價沒有上漲,不等於一項任務的總費用一定不變。
Flash 開始爭奪長任務,速度之外更看重完成率
Google 提供的证据涵盖了长周期编码、专业分析以及多步骤推理。在 DeepSWE 的 v1.1 长周期软件工程评估中,该模型超越了大多数更先进的前沿模型;在 HLE-Verified 上获得了54.9%的评分。该公司还引用了金融代理和法律代理的基准测试,表明其试图将 Flash 从低延迟问答模型提升为能够持续规划、调用工具并交付完整结果的工作模型。通过硬件拆解可视化、单提示生成 DOS 版地图以及3D游戏等演示,进一步强调了该模型不仅能输出代码片段,还能在循环中不断检查和修改成品。
但基準分數不能直接兌換成企業生產力。長任務的成功率往往受到代碼倉庫規模、依賴環境、測試品質、工具權限和重試預算的影響。3.8「更勤奮」的策略在提高完成率的同時,也會增加執行時間和 Token 的使用量。開發團隊需要同時記錄單次調用價格、一次任務總 Token、工具調用次數、成功前的重試次數和人工返工時間,才能知道升級是否真的更便宜。對於延遲或預算優先的工作負載,仍建議降低努力等級,或繼續使用3.7 Flash;舊版本並未因為新產品的發布而立即停止支持。
普通版本已面向開發者和企業開放,Google AI Pro與Ultra用戶也可在Gemini應用中,搜索AI Mode以及Gemini、in、Sheets中使用。不同入口的功能、配額和地區開放範圍可能不同,因此「模型已發布」並不代表所有用戶、所有產品都能獲得完全相同的功能。尤其是帶有自治工具的工作流,能否上線還取決於應用是否為模型提供相應的工具、權限和可恢復的執行環境。
Cyber 版本更強大但也更窄,47.2%並非自動修復的承諾
Gemini 3.8 Flash Cyber 重點放在漏洞發現和補丁生成上。Google 指出,其在覆蓋20種編程語言的內部漏洞發現評測中成功率超過70%;在外部 CWE-Bench 补丁評測中,pass @1的成績為47.2%,接近某領先前沿模型的47.8%,但成本更低。Chrome 安全團隊的內部使用結果顯示,3.8 Flash Cyber 生成的正確漏洞補丁數量是最佳大型商業模型的2.6倍。Wiz 也報告其內部滲透測試基準的召回率提高了7.5至9.7個百分點,成本降低了2.3至5.2倍。
這些數字具有參考價值,但也存在一定的界限。內部基準的樣本、提示和人工判定方法並未在公告中完整展開;47.2%的 pass @1 同時意味著一次生成並不能保證過半數問題都能被正確修復。 Google 將「修復」優先於「利用」,並為普通的 3.8 加入化學、生物、放射、核以及網絡濫用防護。 Cyber 版本為滿足專業防禦需求採用了更鬆鬆的網絡安全限制,因此沒有全面公開,只提供給 Fairwind 計劃中的可信防禦者。
這次發布真正改變的是 Flash 系列的取捨:它不再只依靠低價和速度來吸引大量請求,而是通過更長的推理循環來追求複雜任務的完成率。企業如果直接將 3.7 替換為 3.8,最容易犯的錯誤就是只比較百萬 Token 的標價。更穩妥的辦法是對真實任務進行分層測試:簡單請求限制努力級別,長任務允許更多循環,安全任務則保持人工審批和隔離環境。3.8 Flash 已經可用,Cyber 也已經進入受限計劃;至於它是否能以更低的總成本完成更多生產任務,還需要每個團隊自己的端到端數據來回答。











