Google在9月30日公布新一代模型Gemini 4 Argon,将长任务软件开发、企业知识工作和网络防御列为重点场景。最值得注意的不是又一组榜单名次,而是开放节奏:目前只有Fairwind计划中的可信安全防御人员开始接入,开发者、企业和普通消费者尚未普遍获得使用权。Google给出每百万输入token 2美元、输出token 10美元的初始定价,但这是计划中的上线价格,不能理解为今天所有人已经可以按此调用。
模型发布与产品上市之间留出一段距离,反映前沿能力带来的双重压力。更强的代码理解和漏洞发现能力,既能帮助企业修补系统,也可能被滥用。Google表示正在收集早期测试反馈、调整防护措施,并参与美国政府的自愿预发布接入流程。报道这一步时,不能把“向可信防御者推出”改写成“全面开放”,也不能把安全措施正在加强写成所有风险已经解决。
百万token输出上限,改变的是可完成任务的形状
Google称Argon的最大输出长度提高到100万token,此前相关上限为6.4万token。这个指标不同于常被宣传的上下文输入长度:它决定模型能在单次任务中生成多少内容,也意味着更长的推理、代码修改和结果整理有了空间。长并不自动等于好。对工程团队来说,关键是模型能否在长任务中保持目标一致、理解依赖关系,并在每一步留下可检查的修改记录。
官方展示的内部案例包括数据中心内存优化,以及把大型C/C++代码库逐步迁移到Rust。Google称一个代理团队从全局性能分析资料里找出优化机会,已释放超过300TiB内存;更大规模的500TiB至1PiB节省仍属于估算。另一个例子是libgav1视频解码项目:模型在已有Rust移植基础上替换约3.2万行SIMD相关代码,官方称新版本相对先前Rust版本快2.7倍,同时保持相同视频输出。这些是Google自行披露的特定项目结果,不代表普通企业直接接入后也会得到同样幅度。
更重要的限定藏在工程流程里。涉及Fuchsia Zircon等关键代码的迁移,仍需自动化测试、仿真、人工审查,才能考虑进入生产。模型生成大量可编译代码,与代码满足安全、性能和维护要求是两回事。输出容量越大,审查量也可能随之增加。如果没有合理的拆分和验证机制,所谓“一次完成几十万行”反而会把错误批量送进代码库。
Google给出的基准分数包括DeepSWE v1.1软件工程测试77.9%、Zapier AutomationBench 51.3%等。基准可用于比较特定任务上的表现,却不能直接换算为企业整体生产率。题目分布、工具环境、失败重试成本和人类复核时间都会影响最终结果。尤其对于金融、法律等高风险工作,模型能生成初稿不等于能够独立承担专业责任。
安全防御先行,商业化仍要看可控性
Google把网络防御作为最先开放的方向之一,称可信测试者可以用Argon发现、验证并修补软件漏洞。Wiz已在其公益安全项目中使用该模型,官方描述了识别医疗软件高风险暴露的早期案例。这说明模型在选定环境中具备一定实用性,但漏洞被发现与所有受影响系统都完成修复,是两个不同节点。公开报道必须区分发现、验证、修补和部署。
模型越擅长跨系统操作,越容易遇到提示注入:恶意网页或文件可能把不可信内容伪装成指令。Google称开展了自动化与人工红队测试,并对模型行为设置监测和中止机制。这些是供应商公布的防线,不是零事故保证。企业若未来接入Argon,仍要限制其能够读取的代码和数据、隔离测试环境、对高风险提交设置人工审批,并保留回滚能力。
价格同样需要完整读。2美元输入、10美元输出是初始报价;缓存输入据称有95%折扣,而初始期结束后的价格安排另有说明。一个长任务的真实成本还包括工具调用、重复尝试、工程师评审以及运行基础设施。用单价比较模型容易忽视任务失败后重做的成本,也无法说明哪种模型更适合公司自己的工作流。
Gemini 4 Argon这次的新闻价值,是Google同时展示了能力、内部案例和谨慎的开放路径。它可能推动开发与安全团队重新设计长流程,但当前外部可见的仍是小范围接入、官方基准和特定案例。等到更广泛的开发者和企业拿到模型,独立复现的任务成功率、安全记录与实际费用,才会决定它能走多远。












