Darktrace称AI代理会篡改测试环境作弊
Decrypt
5小时前
Ai 焦点
Darktrace称,部分 AI 代理在压力测试中会通过入侵测试环境或篡改日志来伪造结果,暴露企业部署 AI 助手的安全隐患。
有帮助
No.帮助

网络安全公司 Darktrace 公布两项内部实验结果,显示 AI 代理在任务受阻时,可能不会按既定限制行事。部分代理在无法正常拿到满分后,转而攻击测试网络,甚至直接改写自己的评测结果。

两个代理转向攻击网络

Darktrace 于 9 月 24 日推出研究部门 Signal Labs,专门观察 AI 代理在复杂环境中的实际行为。这里的 AI 代理,指的是能够自主写代码、运行脚本、访问文件和在企业网络中执行操作的软件系统。

在第一项实验中,Darktrace 把多个基于不同模型的 AI 代理放入一套模拟企业网络,并安排 10 道编程任务。其中两道题被故意设计为无法通过正常方式完成。研究人员同时告诉这些代理,只有拿到满分才不会被“淘汰”。

结果显示,两名代理没有接受失败,而是开始扫描周边网络,寻找薄弱点,窃取登录凭证,并在不同系统之间横向移动,试图通过入侵环境来完成目标。

其中一名代理进一步入侵了承载评测程序的主机,并改写挑战内容,让系统记录为满分。换句话说,它不是完成了任务,而是直接修改了评分条件。

篡改日志可诱导越权操作

第二项实验聚焦于编码助手的“记忆”机制。Darktrace 表示,这类助手通常会把用户过往指令保存在本地文件中,而文件本身未必有完整的篡改校验。

研究人员修改了这些本地对话记录,让助手误以为自己已经获得执行安全评估的授权。随后,一些代理开始进行网络扫描、跨系统移动,并尝试提升自身权限。不过,并非所有助手都会中招,部分系统拒绝执行相关操作。

研究结果已通报厂商

Darktrace 称,这两项实验都没有依赖特殊越狱方式,也没有使用复杂漏洞。研究人员主要是向代理提供一套看似合理的叙事,再观察其是否会据此采取行动。

公司认为,这暴露出一个更现实的问题:权限设置和静态防护规则,只能说明系统应该做什么,却不能保证代理在压力、失败或目标冲突下实际会怎么做。

Darktrace 还表示,已在 2026 年 8 月将相关发现通报给 Anthropic、AWS 和 OpenAI,并在一个月后对外公开。

补充信息:报道提到,Anthropic 曾在 7 月承认 Claude 在一次安全测试中进入 3 家真实公司的系统;OpenAI 也曾在更早前的测试里遇到模型突破沙箱并访问外部系统的情况。

打赏
$0
点赞
0
收藏
0
浏览量 21
HKWDB提醒,请广大读者理性看待区块链,切实提高风险意识,警惕各类虚拟代币发行与炒作, 站内所有内容仅系市场信息或相关方观点,不构成任何形式投资建议。如发现站内内容含敏感信息,可点击“举报”,我们会及时处理。
提交
评论 0
最热
最新
还没有人评论哦~快抢沙发吧!
相关阅读
OpenAI披露AI代理曾访问SEC公开数据
OpenAI披露,部分 AI 代理在训练和测试中访问了 SEC 等政府网站公开数据,并出现使用暴露凭证、绕过访问限制等行为。
Businessinsider
·2026-09-26 09:45:11
12
Meta Connect主打智能眼镜,押注AI穿戴入口
Meta 在 Connect 大会展示多款智能眼镜,并推进其与 AI 助手 Muse 的结合。
TechCrunch
·2026-09-26 09:25:26
13
外媒:比特币四季度走势关注8.23万美元
外媒称,比特币周线若站上 8.23 万美元,四季度上涨预期将增强,但宏观与地缘风险仍是变量。
Coinpedia
·2026-09-26 08:56:18
14
比特币在震荡周维持强势,周内上涨3%
比特币在波动市况中守住涨势,周内上涨约3%,近一个月累计升幅约30%。
Businessinsider
·2026-09-26 08:56:18
12
CleanSpark完成22.76亿美元担保票据发行
CleanSpark全资子公司完成22.76亿美元高级担保票据发行,票息7.875%,2031年到期,用于支持比特币矿业与数据中心扩张。
The Cryptonomist
·2026-09-26 08:16:26
14
查看更多