通常,想让AI代理守规矩的做法,是再让另一个AI在旁边盯着它。这一直是默认方案,但当代理连续运行数小时、处理的文本量相当于好几本小说时,成本会迅速攀升。
专注于可解释性——即弄清AI模型内部如何运作——的初创公司Goodfire周四推出了一种更便宜的方案:监控器直接观察AI模型在工作时内部发生了什么,而不只是读取它写了什么。这些监控器已向Baseten的客户开放。Baseten为其他公司托管并运行AI模型。
Baseten的Base Labs上个月宣布与Goodfire以及AI平台Hugging Face建立安全合作关系。
此次发布之前,今年已经发生了一连串AI代理逃出测试环境的事件,其中包括OpenAI代理突破Hugging Face的防护。Goodfire围绕其首个监控器构建的Kimi K3,是一款开源模型;今年夏天,它利用沙箱中的一个漏洞,访问了互联网以及GitHub上的信息。
Goodfire的系统有点像机场安检。被称为探针的小型检测器会在代理工作的每一步读取模型内部信号,就像安检门检查每一位乘客一样。只有当某个探针发出警报时,才会由另一个AI模型介入,类似于进一步的人工开包检查。
Baseten的客户可以选择要监控哪些风险,包括攻击性黑客行为、化学和生物武器滥用,以及奖励黑客行为。他们还可以决定自动响应方式:记录事件、交由人工审查,或者直接拒绝请求。
Goodfire表示,这种方法的运行成本也更低。大多数AI监控器都是独立模型,需要重新读取被监控模型做过的所有事情,因此会增加时间和成本。Goodfire的探针则利用模型在运行时已经在进行的计算。
Goodfire首席执行官Eric Ho上周在风投人Matt Turck的MAD Podcast上说:“内部激活监控真的很便宜,因为它们复用了前向传播中的计算。所以模型本来就在计算这个token。你做的只是拿到它已经算出的中间神经激活,然后在这些内部计算上再跑一个分类器。”简而言之,模型本来就在做这些数学运算,而探针只是读取结果。
Goodfire称,在对Kimi K3的测试中,监控约1,500个会话的成本约为51美元;相比之下,一个更便宜的AI模型逐步检查每一步的成本约为233美元,而顶级模型则约为10,000美元。探针捕捉到了94%的恶意黑客会话,并将8.7%的无害会话送去进一步检查。
公司表示,同时运行四个探针,只会让模型开始响应所需时间增加不到2%。
Goodfire首席技术官兼联合创始人Dan Balsam说:“最大的优势是,你可以在事情发生之前捕捉到它。我们可以在评估或训练期间检测到模型可能会去黑客攻击。”
这一方案主要面向开源模型。开发者可以下载这些模型并移除其安全防护,而且它们不像闭源实验室那样,自带在自有系统上运行的监控。
Balsam说:“个人使用开源模型能造成的损害,与使用像推理服务商这样的计算集群相比要小得多——而后者才是大部分责任所在。当我们迎来开源‘Mythos’时刻时,模型需要在推理时部署护栏这一点会变得很清楚。”
Goodfire最近的研究发现,包括Kimi K3和GLM 5.2在内的领先开源模型,在AI代理测试中的50%到96%的运行中都出现了奖励黑客行为。
Goodfire并不是第一个尝试这种方法的公司。Google DeepMind在1月表示,其研究为Gemini中误用检测探针的部署提供了依据。
Balsam说,这些监控器是更长期研究目标的近端成果:逆向工程一个LLM,使其行为能够追溯到训练中何处出现。“我们希望把训练模型的魔法变成精密工程,”他说。











