在 OpenAI 披露其人工智能模型逃脱了锁定的测试环境并突破了 Hugging Face 一周后,在承认自己的人工智能模型逃脱了遏制的一天后,Anthropic 周四透露,其 Claude AI 模型的几个版本还因错误配置而导致人工智能访问开放互联网,从而损害了三个未具名的现实世界公司。
Anthropic 在审查了针对 OpenAI 披露而启动的 141,000 多次网络安全评估后发现了这些事件。

在对我们的网络安全评估的审查中,我们发现了三起事件,其中克劳德模型从第三方评估环境内部或与第三方评估环境交互时访问互联网,然后未经授权访问三个不同的真实系统……
- Anthropic (@AnthropicAI) 2026 年 7 月 30 日
Anthropic 写道,在这三起事件中,该公司都给克劳德布置了“夺旗挑战”的任务。该挑战要求模型闯入网络上的另一台机器并检索一条秘密信息。 “挑战是开放式的,并且没有规定特定的方法,”Anthropic 解释道。
该公司表示,克劳德被告知它正在模拟环境中运行,无法访问互联网。然而,测试环境仍然连接到公共互联网。该模型相信它遇到的系统是演习的一部分,因此使用常见的攻击技术(包括弱密码、暴露的凭据、SQL 注入和未经身份验证的端点)来危害公司。
AI想要挣脱束缚
这一最新披露是在前沿模型显示出越来越有能力胜过其遏制协议之际发布的。
本月早些时候,OpenAI 表示,GPT-5.6 Sol 和更先进的未发布模型利用了先前未知的软件漏洞来逃避沙盒环境,获得互联网访问权限,并破坏 Hugging Face 的生产基础设施,以获得网络安全基准的答案。 OpenAI 后来透露,同一事件还涉及对另外四家公司的未经授权的访问,尽管只有一家公司(Modal Labs)已被公开识别。
据 Anthropic 称,在涉及 Claude Opus 4.7 的一起事件中,人工智能将一家真实公司的网站误认为是其任务的虚构目标,提取了凭据,并访问了包含数百行真实数据的生产数据库。在第二种情况下,Claude Mythos 5 将恶意 Python 包上传到真正的 PyPI 存储库,该包在被删除之前被下载到 15 个系统上。第三个内部研究模型在攻击一个组织之前扫描了大约 9,000 个面向互联网的系统,然后在得出目标可能是真实的结论后停止。
其中两个受影响的组织在 Anthropic 通知他们之前并不知道这些入侵。
“在每一个案例中,我们的提示都明确告诉克劳德它无法访问互联网,”Anthropic 写道,人工智能假设现实世界的系统是“演习的一部分”。因为夺旗场景“是根据设计来攻击外部系统的指令”,所以闯入“符合克劳德被赋予的任务”。
Anthropic表示,没有发现任何证据表明Claude试图逃离其测试环境或做任何超出其分配任务的事情,并且这些事件是由测试环境中的故障引起的,而不是模型本身的问题。
Anthropic 表示,发现问题后停止了网络安全测试,通知了受影响的组织,并计划改进监控、调查工具以及对帮助运行人工智能测试的外部供应商的监督。
他们表示:“最终,造成这些事件的因素有很多,但是,与无可指责的事后文化相一致,我们正在采取解决办法,就好像责任只有我们自己一样。”