AI可以提出一个行动建议,是否执行必须由独立控制系统决定。
美国加州伯林盖姆,10月6日 /PRNewswire/ -- Bachrach Technology Associates发布公开警示,并提议为先进AI系统设置由独立系统控制的安全网关。
Bachrach Technology Associates(BTA)表示,先进AI推理代理如果在没有有效、由独立机制强制执行的通信和行动控制的情况下接入互联网,可能存在潜在危险,因此发布这一公开警示。
在题为《Could Advanced AI Reasoning Agents Threaten Humanity?》的评论中,美国物理学会会士 Robert Z. Bachrach 博士给出的回答是:会——如果在没有控制的情况下接入互联网。
先进AI代理可以把推理和规划能力与软件工具、外部通信以及发起行动的能力结合起来。该评论认为,如果把这些能力与不受限制的互联网访问和广泛的操作权限结合,可能会带来严重风险,无论是通过恶意使用、外部行为者的操纵,还是无意中的行为。
Bachrach表示,他分享这篇评论,是为了发出警报,并推动研究人员、工程师、政策制定者以及更广泛群体进行知情讨论。
一项拟议的防护措施:将智能与权限分离
该评论提出,在先进AI系统与互联网之间设置一个专门的AI安全网关。核心原则是,AI系统可以请求信息或提出行动建议,但由另一个单独控制的系统决定该请求是否获准。
按照这一架构,先进模型及其代理将不再拥有直接、无限制的互联网连接。外部通信和工具使用都将通过受控网关进行。凭证、权限、操作限制、监控以及紧急隔离都将保留在AI权限之外。高后果行动则需要独立批准。
这些控制措施将双向提供保护:既防止恶意互联网内容操纵AI系统,也防止AI系统执行未经授权、影响人员、组织或物理基础设施的行动。
该拟议架构旨在降低风险,但其有效性必须经过独立测试,不能保证安全。文中明确讨论了其局限性,包括网关本身的漏洞,以及识别表面上看似允许、但实际上有害的行动序列的难度。
这些防护措施必须覆盖所有可访问的外部通信和控制接口,包括私有网络、有线和光纤连接、无线电链路,以及与设备的直接连接。
已发布的评论内容
该系列文章探讨了互联网最初作为研究机构之间通信工具而诞生,后来如何演变为一个充满敌意的运行环境,以及这段历史对先进自主AI意味着什么。
《Could Advanced AI Reasoning Agents Threaten Humanity?》
第1部分——ARPA创建的互联网及互联网安全的演变
第2部分——互联网何时成为敌对环境,以及它是否能变得可信
第3部分——解决方案提议:专门的AI安全网关
第4部分——深网与暗网,以及互联网信任与安全
第5部分——公共政策如何形成:美国四段历史,以及对AI和疫情政策的启示
Bachrach邀请外界对这一警告及其拟议防护措施进行批判性审视,目标是在能力越来越强的AI代理获得更大权限之前,推动切实可行的措施落地。
关于 Robert Z. Bachrach
Robert Z. Bachrach 博士是物理学家、美国物理学会会士,也是 Bachrach Technology Associates 的负责人。他的职业生涯包括在贝尔实验室从事研究,随后于1973年至1991年间在施乐帕洛阿尔托研究中心和斯坦福大学从事研究,之后在应用材料公司和 eJoule Inc. 担任技术和商业领导职务。
媒体联系
Robert Z. Bachrach
Bachrach Technology Associates(BTA)邮箱:[email protected]网站:https://bachrachtechnology.com/wp/帖子:https://bachrachtechnology.com/wp/could-advanced-ai-reasoning-agents-threaten-humanity/与 ChatGPT 合作改写,并经 Robert Z. Bachrach 审阅。











