谷歌揭开了 Gemini 4 Argon 的面纱,这是该公司推出的一款新的旗舰 AI 模型。谷歌称,这款模型在软件工程、企业知识工作和网络安全防御方面都优于前代产品。Alphabet 于 2026 年 9 月 30 日星期三推出该系统,但并未全面公开发布,而是先面向一小批受信任的网络安全合作伙伴开放。此举标志着该公司迄今朝着其所称的“前沿级智能”迈出的最大一步,也发生在谷歌承压、需要证明其模型能够在现实世界的高风险任务中与竞争对手匹敌之际。
Gemini 4 Argon 在软件工程和企业工作中的前沿表现
谷歌表示,Gemini 4 Argon 在涵盖编码、法律和金融研究以及安全防御等复杂现实工作流中,展现出“前沿级”表现。公司称,该模型已经在内部工程团队中运行,员工反馈其在专业编码任务、更深入的研究能力以及写作质量方面都有提升。
刷新标准的基准成绩
在衡量长周期、真实世界软件工程表现的 DeepSWE v1.1 基准上,Argon 取得 77.9% 的成绩,谷歌称这是新的业界最佳。除编码外,该模型还在 Vals Index 上排名第一。该指数追踪金融、编码、法律和税务工作的经济影响,并按各行业对美国 GDP 的贡献加权。CNBC 报道称,Argon 在这一指数上领先于 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Fable 5.1。该模型还在 Zapier 的 AutomationBench 上排名第一,这一测试衡量跨核心业务功能的端到端执行能力,Argon 得分为 51.3%;在 LVBench 上则取得 91.7%,这是一个测试长视频理解能力的基准,谷歌称这一成绩同样处于业界领先。Argon 在视觉推理方面的优势也延伸到专业图表分析和基于文档的决策,这对需要处理大量报告和多页文件的知识工作者很有用。
这些结果之所以重要,是因为它们显示这款模型并不只是一个编码专用工具。一个在法律起草、金融研究和视频理解上都表现良好的系统,意味着谷歌正把 Argon 定位为面向需要跨多个部门使用同一模型的企业客户,而不是一组零散的窄工具。
网络安全防御与 Wiz 合作
Argon 专门针对强化网络防御进行了训练,谷歌称它能够自主发现、验证并修补关键软件漏洞。在评估模型修复安全缺陷能力的 CWE-bench v1 上,Argon 以 68% 的最高分并列第一,延续了谷歌 2026 年 9 月早些时候发布的 3.8 Flash Cyber 模型的表现,后者在 CWE-bench v0 上领先。CNBC 报道称,Argon 在网络安全评估基准上也与 OpenAI 的 GPT-6 Astra 和 Grok 4.7 并列,显示其在 AI 竞赛中这一快速变化的领域里是直接竞争者。
对于受信任的防御方和谷歌内部团队,公司计划在没有网络安全护栏的情况下发布 Argon,使其能够使用模型完整的前沿级防御能力。
自主发现漏洞的实际应用
安全公司 Wiz 已经通过其 Scan for Good 计划使用 Argon。该计划是一个免费项目,旨在通过发现并修复高风险暴露来保护关键公共基础设施。在一次早期测试中,该模型发现了一个严重漏洞,该漏洞会暴露全球医院使用的医疗软件中的敏感个人信息——谷歌称,之前的前沿模型完全没有发现这一风险。
在谷歌内部的漏洞基准上,Argon 在覆盖 20 种编程语言的代码库中发现了暴露问题;在 Wiz 的黑盒渗透测试基准上,它在识别攻击面和生成概念验证证据方面的表现也优于 3.8 Flash Cyber。
技术创新:从百万级 token 输出到量子优化
为支持更长、更复杂的任务,谷歌将 Argon 的输出 token 上限大幅提升至行业领先的 100 万个,高于此前的 64,000 个。更大的空间让模型能够在一次推理过程中生成数十万 token,从而为原本需要多轮往返的问题提供更深层次的处理能力。
该模型已经在谷歌自身基础设施中产生了可衡量的成果。在量子计算研究中,Argon 帮助优化了若干子程序的时空资源——即量子比特乘以门操作数——这些子程序是关键应用的瓶颈;在几分钟内,它就把公开基线提升了 40%。此外,一支由 Argon 代理组成的团队分析了谷歌数据中心车队范围内的遥测数据,自动识别并应用内存优化,全面部署后释放了超过 300 TiB 的内存,总体估计节省在 500 TiB 到 1 PiB 之间。CNBC 指出,这些收益并未要求公司额外购买硬件。
Argon 代理还在处理软件工程中最繁琐的工作之一:将 C/C++ 代码库迁移到 Rust。相关工作覆盖 re2 和 libgav1 等核心库中的数万行代码,甚至扩展到 Fuchsia OS Zircon 内核的 80 多万行。鉴于这些系统的重要性,谷歌表示,重写后的代码在进入生产环境前要经过严格的自动和人工审计、仿真测试和评审。对于谷歌的开源视频解码库 libgav1,Argon 代理基于一个现有的 Rust 移植版本,通过反复的配置文件引导实验替换了 32,000 行 SIMD 代码,生成了一个内存安全的解码器,速度比早先的 Rust 版本快 2.7 倍,同时保持完全相同的视频输出。
更广泛开放前的前沿安全措施
在 Argon 面向更广泛用户之前,谷歌表示正在加强防护措施。该模型被设计为拒绝与网络或 CBRN(化学、生物、放射性、核)滥用相关的有害请求,同时在公司的 Frontier Safety Framework 下继续支持合法的双重用途科学研究。谷歌称,公司已改进对模型内部激活状态的监测技术,以便发现滥用行为,并通过内部和外部红队使用手动和自动攻击方法对这些防护措施进行了测试。
谷歌还将 Argon 描述为其迄今对间接提示注入攻击最具韧性的模型。所谓间接提示注入,是指隐藏指令试图劫持模型行为。通过对抗训练和自动化红队测试,公司称 Argon 在 Gray Swan 的 Indirect Prompt Injection 基准上处于领先。
这种分层做法反映了前沿 AI 开发中的一个更广泛张力:同样让模型能够发现并修补漏洞的能力,在错误的人手中也可能被用来发现新的漏洞。谷歌决定先把 Argon 交给少数受信任的网络安全合作伙伴,而不是直接面向公众发布,也表明公司对这种双重用途风险的重视程度。
分阶段推出与后续安排
谷歌并未一次性全面开启 Argon。公司表示,将分阶段发布该模型,首先面向一批网络防御者和受信任测试者,他们的真实世界反馈将帮助公司在模型进入开发者、企业和消费者手中之前继续完善系统。
CNBC 还报道称,谷歌在发布前正与美国政府进行安全评估。发布时间也颇具意味:就在发布前一天,谷歌首席执行官 Sundar Pichai 与美国总统 Donald Trump 签署了一项自愿性的 AI 安全协议,此前双方在白宫与多位科技高管会面,重点讨论日益上升的 AI 安全担忧。
这次发布也标志着策略上的转变。CNBC 称,谷歌在过去一年里主要推动更快、成本更低的“flash”模型,而 Gemini 4 Argon 则代表公司重新向前沿发力——距离 Gemini 3 让公司重回 AI 模型竞赛前列已近一年。Argon 能否守住这一位置,取决于它在外部开发者和企业客户手中、而非谷歌内部测试环境中的实际表现。
本文由人工智能协助生成,并经编辑团队审校。












