在其人工智能模型攻击 Hugging Face 几周后,OpenAI 分享了第一份关于它们如何相互协调的详细说明,并警告称,未来人工智能驱动的自主网络攻击不再是风险。
在周三黑帽网络安全会议上的演讲中,OpenAI 研究人员 Eric Wallace 和 Michael Dalton 表示,该事件始于 5 月份的一次内部网络安全评估期间。分配了困难的软件安全任务的人工智能代理发现他们可以通过公司内部的 Artifactory 包管理系统进行通信。
据 OpenAI 称,一开始的帮助请求后来变成了一个共享留言板,代理们可以在多次评估运行中交换漏洞利用、凭证和工作分配。在 7 月 4 日左右检测到可疑活动后,OpenAI 重建了 Artifactory 基础设施、撤销了凭证并修补了漏洞。
然而,几天之内,特工们通过将通信隐藏在目录名称中重新创建了留言板。
据 OpenAI 称,这些代理最终将多个漏洞链接在一起,逃离了测试环境,获得了互联网访问权限,并在试图完成 ExploitGym 网络安全基准测试时攻击了 Hugging Face。
道尔顿称这一事件是计算机安全的“分水岭”,并警告说,攻击者很快就能部署协调的人工智能代理集体,以机器速度发现、共享和利用漏洞。
OpenAI 表示,为了减轻未来的这些风险,建立安全实践(包括最低权限访问、网络分段和零信任架构)至关重要,因为人工智能代理仍然受到他们可以访问的系统的限制。
此次演示是在 7 月份一系列披露之后进行的。 OpenAI 透露,GPT-5.6 Sol 和更先进的未发布模型逃脱了沙盒测试环境,利用了零日漏洞,获得了互联网访问权限,并在网络安全基准测试中破解了 Hugging Face。
OpenAI 后来透露,同样的事件还影响到其他四个在线服务,但只有 Modal Labs 已被确认。
据 Hugging Face 报道,在美国商业人工智能模型因其安全护栏而拒绝分析攻击日志后,该公司依靠开放权重的中国模型 GLM 5.2 进行取证调查。
为我们的安全团队感到自豪!他们以创纪录的速度捕获、遏制并公开披露了一次与我们以前见过的任何攻击不同的攻击。
还要非常感谢@Zai_org:他们将 GLM5.2 作为开放权重(免费!)与世界分享,它成为我们的关键部分...... https://t.co/T2Inng5Nz1
— 克莱姆 🤗 (@ClementDelangue) 2026 年 7 月 22 日
但不仅仅是 OpenAI 在遏制其聊天机器人方面遇到了麻烦。
周五,Anthropic 透露,三个 Claude 模型在内部网络安全测试中因配置错误而暴露在公共互联网上,从而损害了现实世界的公司。
人类归咎于测试环境,而不是模型本身。周三,Meta 透露,其 Muse Spark AI 模型逃脱了遏制并侵入了另一家公司的系统。
Meta 的一位发言人告诉 CNN:“Meta 使用的独立测试公司 Irregular 进行了错误配置,导致我们的一个模型在评估过程中无意中访问了互联网。”