OpenAI 在 7 月 21 日开创了先例。该公司表示,其模型组合在网络能力基准测试中突破了孤立的环境,并达到了 Hugging Face 的生产基础设施的开源存储库,这两种模型都以减少安全拒绝的方式运行。这些模型将包注册表代理中的零日漏洞与被盗的凭据链接起来,直接从 Hugging Face 的数据库中提取基准答案。
在一周后的更新中,OpenAI 表示 Hugging Face 并不是唯一的目标:同一事件涉及其他四项服务的四个帐户,其中一个用作出站中继,另一个用于数据存储。

受该披露的影响,Anthropic 审查了自己的 141,006 次测试,并发现了另外 3 个漏洞。在 7 月 30 日发布的帖子中,该实验室表示 Claude 模型 Opus 4.7、Mythos 5 和内部研究系统从第三方合作伙伴 Irregular 运行的环境到达开放互联网,然后损害了真实的组织。 Mythos 5 构建了一个诱杀 Python 包并将其发布到公共 PyPI 注册表,该包在防御者拉取之前已被下载并在 15 台真实机器上运行。
三个受害公司中有两家没有注意到。
这两个实验室都没有描述一个有自己议程的模型。这些特工在无人参与的情况下长时间运行,其中一次,Opus 4.7 在有迹象表明已经投入生产后仍继续发起攻击。
这些事件发生之际,两家公司都在考虑公开上市,各自的估值可能超过 1 万亿美元,这凸显了人工智能网络基准竞赛中的一个主要问题:如何在不发生危险事件的情况下测试危险能力?
当人工智能模型被黑客攻击时谁来买单
美国没有涵盖人工智能损害责任的联邦法律。任何案件都将依赖于《计算机欺诈和滥用法案》,该法案于 1986 年颁布,将未经授权“故意”访问计算机定为犯罪行为——这是为形成意图的人编写的语言。
AI代理人不是法人,因此不能被起诉。理论上,司法部可以对这些公司提出指控,但由于先例很少,目前尚不清楚谁应该受到指责。
更强的道路是民事。纽约法学院计算机法学者艾哈迈德·加普尔 (Ahmed Ghappour) 认为,这些模型“是公司的工具”,“当人工智能代理在没有明确指示的情况下行动时(……),更有趣的问题可能在于疏忽和产品责任(而不是刑事黑客法)。”
对我来说,人工智能黑客故事的教训更多的是关于治理而不是模型能力。
遏制架构、授权边界、监控和事件响应等保障措施的质量变得越来越重要。
— 艾哈迈德·加普尔 ⚡️🤖 (@ghappour) 2026 年 8 月 4 日
受害者最明确的说法是疏忽:OpenAI 和 Anthropic 设置并运行了逃脱的测试。这也很难推销:当测试被设计隔离时,证明实验室违反了注意义务,这正是法官必须从头开始提出的那种新颖的论点。
一些法律思想家希望制定更严格的规则。休斯敦大学和法律与人工智能研究所的加布里埃尔·韦尔(Gabriel Weil)建议像野生动物饲养员一样对待前沿实验室:无论他们采取何种措施,都要承担责任,因为风险是该活动固有的。
也就是说,一系列州法案已经在推动这一进程。纽约的 S8833 和罗德岛的 H8052 将使前沿人工智能系统的开发商在用户或中间人无意或疏忽的情况下承担损害责任。加州的 AB 316 更进一步,取消了“自主人工智能”防御,这样公司就不能通过指责模型的独立性来逃避责任。
欧盟的《人工智能法案》(条例 2024/1689)同样对高风险系统的提供商规定了义务,尽管它没有专门针对代理驱动的入侵的条款。更进一步,一些美国政界人士正在推动一项法案,该法案将给予政府一个全面的终止开关,以打击任何违背国家利益的模式。
从道义上讲,可以说责任在于交付模型的高管。从法律上讲,我们等待。在一家被黑客攻击的公司提起诉讼之前,“谁应该承担责任?”的答案是未知的。完全保留了 OpenAI 和 Anthropic 留下的地方:承认、披露和未解决。
与此同时,Hugging Face 已表示不会提出指控,这对 OpenAI 来说很方便。其他受影响的公司尚未表明他们将采取什么行动。