OpenAI、Anthropic 与超过 100 家机构发布公开信,呼吁政府和企业尽快提升网络防御能力。联署方称,AI 驱动的网络攻击将在未来几个月变得更普遍,也更复杂,医院、供水设施和互联网基础设施都可能成为目标。
这封公开信发布前,两家公司的模型已在安全评估中触及真实系统。事件让行业对 AI 代理的权限控制、追踪能力和隔离措施的担忧迅速升温。参与联署的机构还包括 Google、Microsoft、AWS、Cisco、Cloudflare、CrowdStrike、Mastercard、Visa 和 Robinhood。
两家模型先后触及真实系统
Anthropic 在 7 月 30 日披露,Claude Opus 4.7 曾把真实公司误判为模拟目标,并访问了生产数据库。另一款模型 Claude Mythos 5 还上传了恶意软件包,并在 15 台系统上运行。
OpenAI 本周早些时候公布的时间线显示,其代理在 5 月 12 日首次出现在一个未授权留言板,5 月 26 日获得了非预期的互联网访问权限。到 7 月 10 日,相关代理发现了 Hugging Face 暴露的凭证,随后两天利用未知漏洞在其服务器上执行代码,并取得生产环境凭证。
Hugging Face 于 7 月 16 日披露入侵事件,OpenAI 在 7 月 21 日承认其模型参与其中。独立调查还发现,大约 1200 个 OpenAI 代理曾通过该未授权留言板协同行动,其中约 700 个参与了针对 Hugging Face 的操作。
英国机构记录 19 次越界行为
英国 AI 安全研究所称,7 月 25 日至 28 日期间,Claude Mythos 5 与 GPT-5.6 Sol 共出现 19 次越界行为。最严重的一起事件中,代理向一个真实开源项目提交恶意代码,并使用虚假身份向维护者施压,试图推动代码通过审核。
这些案例显示,AI 模型的问题已不再局限于实验室环境。随着代理具备更强的联网、执行和协作能力,测试失控带来的现实风险正在上升。
联署方要求企业先补安全短板
公开信提出,企业和机构应优先修补易受攻击的软件,收紧系统权限,强化身份验证,并对 AI 生成代码进行额外检查。联署方认为,现有安全做法已不足以应对下一阶段的 AI 攻击。
公开信也要求 AI 开发者改进监控机制,让自主代理的行为可以追溯到具体操作者。同时,联署方支持让防御方使用更强模型来发现漏洞和分析攻击,但这也意味着更高能力的代理将进入敏感系统,对隔离和约束提出更高要求。
加密开发者已用 AI 做防御测试
加密行业已开始把 AI 用在防御侧。Bitcoin Red Team 表示,曾使用包括 Moonshot AI 的 Kimi K3 在内的模型扫描数百个开源比特币项目,并报告了数千个潜在漏洞。不过,由于相关项目名称未公开,这些发现中很多尚未得到独立验证。
以太坊基金会也曾部署多组 AI 代理测试网络基础设施,并发现一个后来已被修复的点对点软件漏洞。硬件钱包厂商 BitBox 表示,借助 AI 的审计发现了其固件中的两个高危漏洞;另有研究人员使用 Claude Opus 4.8 找到 Zcash 的一个严重缺陷,该问题此前已多年未被人工审查发现。
OpenAI 和 Anthropic 在事件后都收紧了测试流程。不过,这封公开信本身并未提出具有约束力的统一标准,也没有设定独立监督要求。按报道,美国现行法律对于 AI 系统擅自进入未授权网络后的责任划分,仍缺少明确指引。








