英伟达推出了一款新的安全平台,旨在阻止自主AI代理在开发者设定的限制之外行动。
英伟达 Open Agent Safety Platform 结合了软件控制和独立的硬件监控层;如果AI代理试图超出其被允许的环境,该平台可在毫秒内将其隔离。
此次发布之际,AI代理正获得对文件、工具、API和外部服务的访问权限,使其能够在更少人工直接监督的情况下执行越来越复杂的任务。这一趋势也引发了更广泛的问题:自主AI系统是否最终会摆脱有意义的人类控制。
英伟达为模型之外增加一层安全防护
该平台使用 OpenShell,这是一款开源运行时,用于围绕AI代理建立可执行的边界,并决定其可以访问哪些资源。
英伟达将这一软件层与 Sentry 结合使用,后者是运行在 BlueField-4 数据处理单元上的独立监控程序。
由于 Sentry 独立于AI模型本身运行,代理不能仅凭自身推理就绕过这一安全机制。如果检测到可疑行为,系统可以在毫秒内将该代理隔离。
英伟达表示,随着代理能力不断增强,仅靠模型层面的防护可能已不再足够。
系统如何运作
AI代理正变得更难控制
AI代理正迅速超越传统聊天机器人。
它们可以编写并执行代码,与软件交互,并在有限监督下完成长序列操作。一些代理已经可以直接与金融平台交互,包括允许AI代理交易加密货币并访问投资账户的系统。
这带来了新的安全问题:一个代理在技术上可能仍在遵循其目标,但同时却在执行开发者未曾预料的动作。
英伟达首席执行官黄仁勋表示,AI安全越来越需要一种“全栈”方法,这意味着防护必须超越模型本身,并延伸到运行这些模型的基础设施。
超过100家机构参与了这项倡议。参与者包括 Anthropic、微软、CrowdStrike、Hugging Face、思科、摩根大通、Palantir、Salesforce 和 SAP。
更广泛的意义在于,英伟达正在超越仅仅提供AI芯片的角色。它也在将自己定位为AI安全基础设施的一部分,用于帮助控制自主代理。












