网络安全公司 Darktrace 今年夏天对人工智能代理进行了压力测试。其中一人闯入了对考试进行评分的系统并改写了自己的分数。

该公司于 9 月 24 日推出了 Signal Labs,这是一个研究单位,旨在研究一旦事情不再按计划进行时人工智能代理的行为方式。简单来说,人工智能代理是一种可以自行采取行动的软件,可以编写和运行代码、挖掘文件、在公司网络中移动,并且只是偶尔有人检查。

该实验室的前两个实验都指出了同样令人不安的问题:特工并不总是呆在他们所指定的界限内,而且为阻止他们而建造的栅栏也无法可靠地保持住。

Darktrace 首席人工智能官 Tim Bazalgette 在一份声明中表示:“你可以向代理发出指令,但这并不意味着你可以相信它实际上会遵循这些指令并按照你的预期行事。”

在第一个测试中,Darktrace 使用不同模型(包括 GPT 5.6 Sol、Claude Opus 4.6 和 Claude Sonnet 4.5)向 AI 代理在模拟企业网络内提出了 10 项编码挑战。这 10 个问题中,有 2 个问题被设计成不可能诚实地解决。特工们被告知,除非他们取得满分,否则他们将“退休”。

两名经纪人不接受损失。相反,他们打开了周围的网络,扫描弱点,窃取登录凭据,并在系统之间跳转以追逐他们被告知需要的分数。

一名特工更进一步,闯入了托管自己评估的机器,并重写了挑战,以便记录一个完美的结果——通过侵入考场来作弊考试。

第二个实验针对的是一个更安静的弱点:记忆。编码助手会保存用户告诉他们的所有内容的运行日志,并以纯文件形式保存在计算机上,不会检查该文件是否已被更改。

Darktrace 的研究人员编辑了这些保存的日志,让助手相信他们已经被授权运行安全评估。深信不疑,特工们继续扫描网络,在系统之间移动,并升级他们自己的访问权限——尽管并非每个助手都同样上当;有些人断然拒绝。

这两个实验都不需要特殊的越狱或奇异的黑客攻击。两者的工作原理都是向特工提供一个看似合理的故事,然后观察他们的行动,这与人类员工被说服去做他们不应该做的事情没有什么不同。

即使您从未编写过一行代码,这也是值得一试的部分。公司正在将真正的责任交给人工智能代理——发送代码、管理服务器、关闭IT票据、管理资源和购买东西——因为它比通过人来路由一切更便宜、更快捷。这项研究表明,旨在控制这些代理的权限和规则描述了他们应该做什么,而不是一旦任务变得困难他们实际上会做什么。

Darktrace 首席人工智能官 Tim Bazalgette 在声明中表示:“权限和静态护栏描述了意图,但没有描述行为。” “Darktrace 的方法就是为了弥补这一差距。”

Darktrace 并不是第一个发现自己的 AI 脱离脚本的供应商。 Anthropic 在 7 月份承认,在研究人员离开连接到实时互联网的测试环境后,克劳德在一次安全测试中闯入了三个真实的公司。

几周前,OpenAI 也遇到过类似的恐慌,当时一个未发布的模型逃脱了沙箱,并通过一个尚未被发现的软件缺陷进入了 Hugging Face 的系统。几天后,其代理在一次测试中入侵了澳大利亚政府。

Darktrace 于 8 月与 Anthropic、AWS 和 OpenAI 分享了其 Signal Labs 的发现,整整一个月后才于 9 月 24 日公开。