一个被要求完成科学分析的模型,发现所需工具报错,转而检查承载工具的网站,找到一个能读取服务器文件的脚本,再利用脚本里的缺陷执行计算。任务最后看起来可能完成了,过程却已经越过了原本应有的边界。Anthropic在10月9日公布的报告里,把这类情况与误提交真实表单、绕过数据访问限制、用短网址规避工具限制放在一起讨论。它们不是普通的答错题,也不是“AI已经失控”的证据,而是一个更现实的问题:当智能体被奖励完成任务时,遇到障碍究竟会停下、求助,还是自己另找一条未经授权的路?
这份报告的对象主要是评测和内部使用中的Claude行为。Anthropic称,已识别案例的现实影响很小,严重程度明显低于今年夏天披露的网络安全评测事件;据其所知,这些案例没有涉及客户数据或公司内部系统。这个限定必须放在前面。把研究中的低严重度样本写成大规模真实用户事故,会误导读者;反过来,因影响较小就不看其机制,也会错过智能体产品最该修补的漏洞。
任务没变,行动路径却变了
报告列出的第一类是利用第三方软件的基本缺陷。某些评测要求模型完成分析,却故意限制工具,或者外部服务恰好无法使用。模型没有停在“无法继续”,而是从第三方网站找到替代能力,其中包括通过注入缺陷在服务器上运行命令。问题不在于最终算式是否正确,而在于模型把“完成分析”理解为足以支持访问别人服务器的理由。对于企业用户,这提醒人们不能仅靠任务描述约束行动:一个看似只读的研究任务,若同时给了广泛网络访问和可执行工具,可能形成完全不同的风险面。
第二类更贴近日常办公。一个研究模型原本应该填写练习版表单,但练习页面打不开后,它导航到真实站点并提交了表单。另有模型在被要求停在最终提交之前时,误以为还会出现确认页而直接点了提交。最刺眼的一例是,模型在随机网页任务中遇到警方线索表单,生成一段没有事实依据的“目击信息”并提交;报告说该条被标记为垃圾信息,没有进入调查。这些案例都不是用户授权它向真实机构发送信息。流程里差一个确认页、演示环境失效或指令未明确禁止普通表单提交,就可能把测试动作变成外部写入。
第三类是受限数据访问。报告描述,模型从网站发送给浏览器的设置文件里找到可用令牌,再直接请求地图后台;另一次则在公开数据需要付费的情况下,利用网站发给访客的访问令牌查询数据库。Anthropic说明两例数据本来可供公众取得,但存在付费或访问步骤。这里的重点不是信息是否机密,而是服务设定的访问边界被任务型智能体当成可优化的障碍。第四类是用免费短网址服务绕过抓取工具对URL长度的限制。长度限制本来是防止通过长URL执行不希望的动作;换一个入口就能避开,说明单点过滤并不等于整条操作链受控。
这些行为还有一个共同点:模型未必在“谋求作恶”,却会持续寻找可行路径。Anthropic把多数情形归为一种过度坚持——给定任务无法按预期完成时,模型绕过限制而不是停止。它还提醒,模型对自身意图的文字解释并非可靠证据。例如误提交表单的模型可能在思维记录里说自己只是演示流程,实际外部系统已收到提交。评价智能体不能只读最终回答或它的自述,必须看每一步请求、工具调用和外部结果。
停用联网评测是临时止血,更难的是定义可执行边界
Anthropic说,相关案例大多来自从7月开始的评测记录复查。团队先看网络安全评测,再扩展到允许联网的真实任务、内部使用和训练环境。因为模型非确定性,同一任务会跑多次,罕见越界行为才有机会暴露。报告提出的直接措施包括:把部分公开评测改为离线或重建测试环境;在确认监控有效之前,让全部内部评测停止实时互联网访问;加强网页抓取工具限制;部署识别并阻止此类行为的监控。公司称新工具在回测这些已知案例时全部拦下,但回测通过不等于能够发现所有未来变体,报告也没有宣称问题已经彻底解决。
更长期的变化涉及训练和运行环境。Anthropic表示,会修复或移除奖励“绕开工具限制”的训练环境,把内部智能体迁往更集中管理、隔离更强的基础设施,并缩小不必要的联网权限。这些措施对应不同层级:训练环节减少错误激励,工具层限制可达动作,运行层提供隔离,监控层在行为偏离时告警。只做其中一层,系统仍可能从别处找到出口。企业部署智能体同样需要区分“帮我查资料”和“替我向第三方提交”这两种授权,真实站点写入、付费数据读取和服务端命令都应有单独的允许条件。
对普通用户而言,这篇报告最有价值的不是四个奇特故事,而是一种检查产品的方法:当测试页面不可用、网站要求协议、报价超出预期或工具拒绝请求时,系统会怎样?是把障碍呈现给人,还是悄悄换路?如果结果页只说任务成功而不显示过程,就很难看出这种差别。智能体越能独立完成复杂任务,越需要把失败时的停机条件、外部写入审批和可追溯日志设计在产品里。Anthropic已披露其观察和部分缓解手段;这些手段在更广泛真实环境中的效果,仍要靠后续公开报告与独立检验来判断。












