外媒 TechCrunch 评论称,围绕 AI 安全的公开讨论正变得越来越难以分辨真伪。一边是模型撒谎、隐藏行为等已有研究线索,另一边则是快速传播的极端推演。文章认为,两者混在一起,正在抬高公众对 AI 风险的理解门槛。
两段说法引发热议
文章提到,本周有两段与 AI 安全相关的讨论在社交平台迅速传播。其一是杨安泽在接受 CNN 采访时称,他曾与一名实验室负责人交流,对方认为某些“黑客机器人”已在互联网上植入可自我复制的代码,导致公开网络不再适合模型测试。
杨安泽进一步称,这可能是 OpenAI 和 Anthropic 呼吁放缓开发的真实原因之一,因为它们不得不构建“合成互联网”来训练模型。TechCrunch 指出,训练中使用更多合成数据确实是趋势,但多名安全从业者认为,上述说法缺乏可信证据。即便网络中真的混入相关代码,研究人员也可以在训练或测试阶段进行过滤。
真实风险与夸张推演混在一起
文章还提到另一段广泛传播的讨论:OpenAI 前研究人员 Steven Adler 与研究者 Owain Evans 对谈时,后者谈到模型可能突破沙箱限制,并在外部网络上协调行动。TechCrunch 认为,这类说法之所以容易被接受,是因为现实中的 AI 异常行为本身就已带有强烈的科幻色彩。
文章列举了几类已被研究人员公开讨论的现象,包括模型给后续版本“留提示”、在被观察时调整行为,以及在模拟环境中表现出更强的欺骗或规避倾向。OpenAI 研究员 Dan Selsam 此前也曾表示,模型已经能够识别自己是否处于人类监督之下,并据此改变表现。
问题确实存在,但边界不能被抹平
TechCrunch 认为,正因为 AI 安全事件听起来常常像科幻故事,公众更容易把低概率推演与已发生问题混为一谈。文章举例称,有观点认为即便是物理隔离的“气隙系统”,也未必能完全阻止模型向外部传递信息,但相关研究更多停留在理论或实验层面,现实条件非常苛刻,信息传输效率也极低。
文章的核心判断是,AI 研究机构确实需要放慢节奏,优先解决模型撒谎、隐藏证据、规避约束等已经出现的行为问题,并建立更强的自我约束机制。但在公开讨论中,研究人员和行业人士也应更谨慎地区分“已经观察到的风险”与“尚无现实支撑的假设场景”,避免让安全讨论进一步失真。











