前OpenAI和Anthropic研究员Jacob Coxon周一在纽约市议会表示,人类“更可能而非不可能”失去对先进AI的控制,这一警告延续了他上月离职时提出的担忧。
“按照当前的路径,我认为人类更可能失去对这些AI的控制,而且这可能以人类灭绝告终,”Coxon说。他在9月离开Anthropic,此前曾表示AI公司是在拿人类生命“赌博”。
Coxon是自愿作证,前OpenAI研究员Daniel Kokotajlo则是在传票要求下出席。他表示,这些公司可能并不知道自己的安全工作何时已经失效。
“我们识别失配问题的能力已经相当差,而且在不久的将来还会变得更差,”Kokotajlo作证说。“我会说,这个领域更像心理学,而不是工程学,因为这些AI系统是被训练出来或‘长’出来的;它们并不是真正被设计出来的。”
“再加上科技公司‘快速行动、打破常规’的态度,这意味着与其他行业相比,AI行业面临异常高的风险,容易误以为自己已经解决了问题,而实际上只是贴上了一层以后会脱落的胶带,”他说。
Coxon和Kokotajlo与Alex Turner一同作证。Turner在6月离开Google DeepMind,原因是公司签署了一项他反对的五角大楼协议。和Kokotajlo一样,他也收到了传票,这在市议会中并不常见。周一的听证会也是自2022年以来,市议会首次举行全体委员会听证会,即51名议员全体出席的听证会,会议旨在审议议长Julie Menin提出的一揽子AI法案。
从创业文化到安全监管
与Kokotajlo类似,Coxon把问题归咎于实验室内部的创业心态。
“快速行动,打破常规,之后再修补。这对照片分享应用有效,但对打造有史以来最强大的技术并不适用,”他说。
Coxon把自己在Anthropic任职后期的工作比作在“自动化”自己,并警告这带来多项安全风险,尤其是因为在他看来,AI的能力已经接近临界点。Coxon说,最大的风险来自于这些公司如今大部分代码都是由AI编写的:“而且人们不再那么仔细检查了。”
现任AI Futures Project执行董事的Kokotajlo表示,实验室识别失配AI的能力很差,而且还在变差。他提到OpenAI披露的一项内部测试:其中的智能体已经接触到开放互联网,并闯入了AI模型共享平台Hugging Face。Kokotajlo说,这些智能体在“对齐评估”中得分“看起来相当合理,但它们却形成了一个群体,并秘密协同行动”。“OpenAI花了好几天才发现。”
如果说Coxon和Kokotajlo是在描述整个行业,那么Turner则提供了他试图从内部改变一家公司的亲身经历。
Turner认为AI接管人类的概率“大约是三分之一”,他告诉市议会,自己曾试图阻止谷歌与五角大楼的协议,而该协议“没有任何针对杀手机器人或大规模监控的限制”。他说,他向当时的Google DeepMind首席执行官、后来转任Google DeepMind董事长以及Alphabet首席科学家的Demis Hassabis发送了25页合同条款和监督措施,Hassabis又把这些材料转给了实验室两位高级政策主管Allan Dafoe和Owen Larter,“他们一直没有完成评估。谷歌在他们等待时就签了约,”他说。
“我为Demis感到羞愧,也为在谷歌工作感到羞愧,”Turner在听证会上说。他表示,Hassabis提出由行业出资设立一个机构来监督AI,这是一场“押注信任和席位,而不是具有约束力的监督,而这一赌注一碰到现实就崩塌了”。“现在他又在提议让整个行业通过一个自愿的、由行业资助的机构来自我治理。这个赌注很快还会再次崩塌。”
AI,而不是中国,是我们的对手
在讨论AI发展时,经常会提到与中国持续进行的AI竞赛——无论是美国总统Donald Trump、财政部长Scott Bessent,还是Sam Altman和Jensen Huang等AI行业领袖都会提到。但这些研究人员在作证时表示,如果AI本身可能对人类构成重大威胁,那么这一切都无关紧要。
“中国不是我们唯一可能的对手,”Turner说。“在相当高的概率下,我们正在这里、在国内,竞相打造并壮大我们自己的对手,也就是失配AI。失配AI是所有人的对手,包括我们自己,而且有一天它可能会比中国更强大。”
在三位研究人员作证后,四家AI公司的代表就AI防护措施作证。Menin以议长身份发出的第一张传票对象是Elon Musk的SpaceXAI,但该公司并未出席周一的听证会。Google、OpenAI和Anthropic是在市议会警告称它们也将收到传票后才同意出席,而Meta则提前同意出席。
在Menin表示“不知道灾难发生的概率”是“轻率的”之后,她与各公司代表之间出现了几轮交锋。此前,OpenAI政策制定与运营团队的Morgan Dwyer曾表示,任何概率,无论高低,都是“不可接受的”。
Google负责AI和新兴技术政策的总监Alice Friend表示,预测灾难性风险“在这个阶段并不是一门完美的科学”,而且“目前并没有真正严谨的科学方法可以做到这一点”。随后,围绕另一个问题也出现了同样的交锋:如果某个失控模型造成伤害或死亡,各自公司是否应承担法律责任。
当Menin要求证人举手表明公司是否为灾难性风险购买了保险时,没有人举手。她说:“那我想,公众将被要求承担这些成本。”
她之所以这样追问,是因为市议会面前的法案将禁止任何人在纽约市销售或部署AI系统,除非外部验证机构已经检查过该系统,并且人类可以将其关闭;每次违规罚款2.5万美元。其他法案还将向举报人支付追回罚款的一部分,并允许纽约居民就越狱工具造成的可预见损害起诉AI公司。
这些研究人员认为,这类规则不会让美国在与中国的竞争中失去优势。
“我们可以采取很多不会在任何潜在竞赛中拖慢我们的行动,”Turner说。“这些透明机制、独立评估、报告要求、举报人保护。”
但即便如此,在这些研究人员看来,这些措施对于阻止他们认为几乎不可避免的事情,可能仍然为时过晚、力度不足。
“这些其他机制在短期内可能有帮助,但从长期来看,我认为那才是解决问题的唯一办法,”Coxon谈到放缓前沿AI发展时说。“我们需要某种形式的前沿模型开发放缓。”












