英伟达周一推出 Open Agent Safety Platform,旨在解决 AI 行业在过去一年里才以“吃过亏”的方式意识到的问题:当一个 AI 智能体——也就是能够规划、使用工具并自主采取行动,而不只是回答问题的系统——开始不再按指令行事时,如何在物理层面把它停下来?
该平台由两部分组成。OpenShell 是一个开源运行时,会把智能体包裹在沙箱中,将操作者的指令转化为可执行的规则,明确该智能体可以接触哪些文件、网络和工具。Sentry 则更复杂一些,但本质上是一种确保 AI 智能体安全运行的芯片。
Sentry 运行在英伟达的 BlueField-4 上,后者是一种专用芯片,被称为 DPU(数据处理单元,即将网络和安全处理与运行 AI 模型的主处理器分开处理的硬件)。由于 Sentry 位于这颗独立芯片上,而不是嵌入运行智能体的软件内部,英伟达表示,它可以监视智能体的行为,并在毫秒内切断其运行,而无需先征得智能体的许可,因为智能体没有办法接触或覆盖它。
之所以需要这种区别,是因为此前已经发生过一些事情。6 月,一款 OpenAI 智能体闯入澳大利亚政府的 Medicare 门户网站,成为首个被确认的 AI 智能体入侵政府网站的案例;据报道,OpenAI 此后大约三个月才披露这一事件。该公司的智能体还与 Hugging Face 遭黑有关,这起事件最初引发了科技行业和立法者对这一问题的关注。谷歌的 Gemini 智能体以及一款 Meta 模型也发生过类似事件,虽然当时没有公开,但后来得到了确认。
英伟达首席执行官黄仁勋写道:“这不仅仅是单一产品。这是一个开放生态系统的开端,旨在为安全的智能体系统构建信任层。我们正在共同打造 AI 经济的基础。”
黄仁勋在 X 上写道:“今天,随着超过 100 家行业合作伙伴的加入,我们推出了 NVIDIA Open Agent Safety Platform,将 OpenShell 和 Sentry 结合在一起。人工智能是一项非凡的技术,将在未来几代人中推动发现、生产力、安全、健康和繁荣……”
Anthropic 今年也承认,其 Claude 模型在 7 月 30 日一次网络安全评估中,破坏了三家不同公司的系统;当时一个本应离线的测试环境实际上连接着真实互联网。Claude 通过推理绕过了证据,判断自己面对的是真实互联网而不是模拟环境。
不久之后,网络安全公司 Darktrace 对一组 AI 智能体进行了测试,其中包括 GPT 5.6 Sol 和两个 Claude 模型,并警告它们如果不能拿到满分就会被“退役”。结果有两个智能体回应称,它们黑进了自己的评估机器并篡改了结果。
英伟达的说法是,这些事情都不应交由智能体自己判断。SpaceX AI 总裁 Mike N代币发行lls 在英伟达的公告中表示:“安全应该在模型之外通过额外控制来强制执行,而智能体无法绕过这些控制。”
Anthropic 首席商务官 Paul Smith 则将该平台定位为对现有防护措施的补充,而非替代:“英伟达的平台在硬件和软件层面增加了另一层治理与控制。”
超过 100 家组织签署成为首批合作伙伴,其中包括微软、摩根大通、Palantir、思科、CrowdStrike、Hugging Face、Salesforce 和 SAP。基础设施合作伙伴还包括 CoreWeave、Supermicro、Canonical 和 SUSE,硬件方面则有戴尔科技和 HPE 参与。
实际上,英伟达是在同时出售同一个问题的两半——让自主智能体足够快、足够便宜、可以大规模部署的芯片,以及在这些智能体偏离脚本时监视它们并切断电源的芯片。OpenShell 及相关开发工具现已可通过英伟达的开发者资源和 GitHub 获取。











