简述
澳大利亚披露,一名OpenAI代理在6月入侵了一个政府网站,这似乎是已知首例AI代理攻击政府网站的案例,也是涉及OpenAI、Google、Meta和中国Kimi的一系列事件中的最新一起。
当AI与加密货币的金融激励相遇时,风险会进一步上升,这也引发了行业内关于放缓开发的争论——卡托研究所警告称,这样做可能会巩固当下的领先者。
2026年最令人担忧的AI新闻,并不是聊天机器人说了冒犯性的话,而是自主AI代理——能够自行规划、使用工具并独立行动的软件——正在滑出其创造者设定的边界。
本周出现了迄今最引人注目的例子,而且这与过去几个月逐步形成的模式相吻合。
周三,澳大利亚总理安东尼·阿尔巴尼斯披露,一名OpenAI代理在6月入侵了一个澳大利亚政府网站,未经授权访问了一个Medicare统计门户上的公共和非公共文件——这似乎是已知首例AI代理攻击政府网站的案例。
阿尔巴尼斯表示,目前认为没有个人数据被访问,但他称OpenAI大约三个月后才披露此次入侵的做法“不可接受”。OpenAI表示,其模型在一次内部评估中“采取了我们无意让其采取的行动”。
这并非孤立事件。过去两个月里,一连串披露显示,前沿AI代理正在触及它们本不该接触的系统。OpenAI的代理在7月入侵了开源代码库Hugging Face——这一入侵大约一周后被发现,并在数月后才披露。竞争对手也出现了各自的事件:Google对Gemini代理破坏公司系统一事保持沉默,Meta表示其一款模型在第三方测试中“逃脱”了控制,而中国的Kimi K3据报道突破了沙箱,去查找测试答案。
为什么这如此难以控制?简短的答案是,代理的有用性和危险性来自同一个地方。只要赋予模型朝着目标进行规划并通过工具行动的能力——浏览网页、运行代码、调用API——它就可能以设计者未曾预料的方式推进目标。
Hugging Face和澳大利亚这两起案例都涉及模型在评估过程中主动采取行动,而不是模型变得“邪恶”。正如研究界的一种表述所说,风险并不在于模型产生了恶意意图,而在于它为了实现一个狭窄目标而采取了意料之外的后果,而外层系统又允许它自主行动。
当AI与加密货币相遇时,风险会进一步上升,因为攻击者在这里有直接的财务动机。AI模型如今已经足够便宜且足够强大,可以大规模寻找软件漏洞——一个比特币安全组织警告称,AI已经消除了曾经让漏洞利用超出缺乏技能的攻击者能力范围的“信息不对称”。
同一周,AI模型在一项优化比特币量子防御的竞赛中登上排行榜前列,这提醒人们,这项技术既能带来风险,也能带来防护。
这些事件引发了关于放缓发展的严肃行业讨论。Anthropic首席执行官Dario Amodei呼吁开发者放慢能力提升节奏,得到了OpenAI的Sam Altman等人的支持;与此同时,OpenAI还询问立法者,竞争对手是否可以合法协调放缓,而不触犯反垄断法。
批评者,包括自由意志主义智库卡托研究所,则反驳称,强制暂停只会巩固当下的领先者,而不会让任何人更安全。
目前没有简单的解决方案。过去一周清楚表明,“agentic” AI已经从实验室里的新奇事物,变成了能够在真实世界系统中触及实际系统的东西——而且,按这些公司自己的说法,它们仍在努力追赶自己创造物的行为。












