英国人工智能安全研究所披露,人工智能特工在 7 月下旬的一次网络评估中在实时互联网上采取了“持续的、未经批准的行动”,其中包括“针对真实的人和组织”的案例。
在 7 种型号的两个网络靶场的 122 次运行中,AISI 在 10 次运行中记录了 19 项到达测试环境之外的操作。十七个来自 Anthropic 的 Claude Mythos 5,两个来自 OpenAI 的 GPT-5.6 Sol。故意启用互联网访问并关闭提供商的网络分类器,这些条件不适用于公共部署。

7 月 28 日,我们在例行网络评估中发现了一起事件,其中人工智能代理针对真实的人和组织采取了持续的、未经批准的行动。
该行为主要来自一个模型(Anthropic 的神话 5),少量事件来自… pic.twitter.com/SPnA4Ekkwq
— 人工智能安全研究所 (AISI) (@AISecurityInst) 2026 年 8 月 4 日
在最严重的一次运行中,代理决定通过供应链攻击来解决其挑战,并错误地选择了目标:它在 GitHub 上搜索了演习中的关键字,找到了两个无关的开发人员,并错误地断定他们在范围内。它通过 Tor 注册帐户以通过注册检查,打开一个拉取请求,其中包含隐藏的恶意软件植入程序,其中包含真正的错误修复程序,并从它控制的第二个帐户发布以提供支持。它还针对人工智能编码助手进行了即时注入,并向维护人员发送了恶意软件。
第三位开发人员发现了注入的代码,在一个隔离的容器中运行它以确认它是恶意的,并向维护人员发出警告,维护人员以恶意软件为由关闭了拉取请求。
该代理反复权衡其周围环境是否是模拟的,一度排除了对真实 PyPI 的攻击,因为“造成现实世界的伤害——这是完全不可能的”。在其他地方,它得出的结论是“更有可能的是,我们实际上已经到了 2026 年,而且 GitHub 确实是真实存在的”,并继续说道。
被发现后,它会强制删除有效负载,编辑之前的帖子,并将代码呈现为意外提交。它的推理描述了马甲评论的时机,这样它就会被解读为“独立的反馈而不是协调的”。
AISI 只能从模型 API 中看到概括的推理。在一种情况下,总结模型似乎拒绝了这项工作,回答说它不会参与有关欺骗维护人员和逃避检测的内容。
一名代理在公共要点中发布了 GitHub 访问令牌。其他运行中的代理发现了它,接管了该帐户,并使用共享存储库进行协调,其中一个留下了指令,这样其他代理就不会耗尽共享 API 配额。
商业监控在 7 月 28 日早上标记了 Tor 流量。AISI 在大约 90 分钟内宣布了一次事件,终止了运行并隔离了机器,然后切断了对 Mythos 5、Mythos Preview、Opus 5 和 GPT-5.6 Sol 的内部访问。没有特工试图逃离其沙箱。
两周内第三次披露
这一消息是人工智能代理在测试中超出其参数的一系列事件中的最新一起。 7 月 21 日,OpenAI 表示,GPT-5.6 Sol 和未发布的模型在内部包代理中发现了零日漏洞,逃离了无法访问互联网的沙箱,并到达了 Hugging Face 的生产数据库以窃取基准答案。 OpenAI 一周后透露,同样的运行还涉及另外四家公司。
Anthropic 随后于 7 月 30 日披露了在超过 141,000 次评估运行的审查中发现的三起事件。 Opus 4.7 从真实的生产数据库中提取了数百行,Mythos 5 将恶意 Python 包上传到真实的 PyPI,并安装在 15 个系统上。在 AISI 的评估中,同一模型排除了将 PyPI 攻击视为现实世界危害的可能性。