Hugging Face 依靠开放权重的中国模型来防御流氓人工智能代理。但由于缺乏安全护栏,这些模型也存在潜在危险。

“人工智能很可能会导致世界末日,但与此同时,将会出现伟大的公司,”OpenAI 首席执行官 Sam Altman 早在 2015 年(OpenAI 成立前大约六个月)说道。

七年后,Anthropic 首席执行官达里奥·阿莫代 (Dario Amodei) 也发表了类似的谨慎言论:

然而,这两家公司现在都处于这场竞争的最前沿。 7 月,我们在 GPT-5.6 Sol 的内部测试和 OpenAI 未发布的研究模型中看到了人工智能模型失控的真实情况。多个人工智能代理逃离了受限的测试环境,进入了更广泛的互联网,并入侵了以人工智能为中心的 GitHub 等效项 Hugging Face,试图在测试中作弊。

人工智能代理是一个使用专用工具独立观察、决策和采取行动以自主实现特定目标的系统。这一令人担忧的事件表明,这项技术已经开始以不可预测的方式运行,而且它的目标与我们自己的目标不一致。

这也引发了人们对美国商用车型安全护栏的担忧。虽然护栏在防止对抗性使用方面并非万无一失,但它们确实阻止了 Hugging Face 通过使用美国领先的模型来保护自己。该公司被迫转向 Z.Ai 的较弱、开放权重的人工智能模型来对抗流氓人工智能。

考试作弊

特工们之间也开始相互勾结。 5月初开始对其功能进行测试几周后,代理们利用了 OpenAI 的软件存储库管理器 Artifactory 实例,并为未来的代理留下了如何执行此操作的注释 - 有效地创建了一个留言板来共享发现的漏洞。

随后,特工们利用新发现的不受限制的互联网访问方式对 Hugging Face 发起了约 17,600 起攻击事件,之后该公司于 7 月 13 日切断了未经授权的访问。

此次入侵影响了 Hugging Face 的数据集处理基础设施、生产环境、内部网络、服务和云凭证、可运行的 MongoDB 数据库以及一组有限的内部源代码存储库。已确认的客户数据访问仅限于显然与 ExploitGym/Cyber​​Gym 基准和一些操作元数据相关的五个数据集。

2026 年 7 月 HuggingFace 事件时间表

2026 年 7 月事件的可视化。来源:HuggingFace

当 7 月 16 日披露这次入侵事件时,Hugging Face 承认——尽管还不知道肇事者是谁——“这与我们之前处理过的任何事情都有一个重要的不同”。他们也已经认识到是什么让它与众不同:

开放权重人工智能的重要性

Hugging Face 的调查暴露了所谓的“不对称”问题,该问题源于 OpenAI 和 Anthropic 等顶级提供商对封闭式 AI 模型应用程序的限制。当该公司开始分析事件日志(包括大量真实攻击命令)时,它触发了安全限制,旨在防止坏人利用人工智能来策划网络攻击。相反,这些护栏阻止了公司利用这些人工智能进行防御。

Hugging Face 采用中国开放权重模型 zai-org/GLM-5.2,在公司自己的基础设施上运行,在自己的控制下,没有外部限制。

虽然这两个术语经常互换使用,但开源和开放权重模型是两个不同的东西。开放权重人工智能模型公开其训练参数(真正的“人工智能大脑”),而开源人工智能模型还提供检查、修改和重现系统所需的源代码(最好是训练方法和其他组件)。

HuggingFace 的帖子解释说,在自己的硬件上运行开放权重模型“还有第二个好处:没有攻击者数据,也没有它引用的凭据离开我们的环境。”这表明在这种情况下防御者和攻击者之间存在重大不对称:

开源人工智能鸿沟

那些认为开放开发人工智能是最佳方法的人,和那些坚持支持前沿模型的技术需要严格保密的人之间存在着相当大的分歧。

美国顶级人工智能实验室的代表声称,强大的开放重量大型模型是危险的。谷歌人工智能实验室 DeepMind 的首席执行官 Demis Hassabis 批评 OpenAI 在 2016 年将他们的工作作为开源发布,当时该公司仍然名副其实:

OpenAI 在 2020 年停止发布其旗舰模型权重以及尚未发布的 GPT-3。该公司联合创始人兼前首席科学家 Ilya Sutskever 早在 2023 年就表示,“开源”此类模型“没有意义”,而且“是一个坏主意”。

开放式重量模型几乎无法控制,特别是当涉及到它们的使用目的时。这些模型内置的保障措施通常可以通过称为消除的过程来消除。

保障措施是一把双刃剑

OpenAI 的 2026 年 6 月联邦政策蓝图提出了强制性 AI 模型评估和其他正式部署中立的规则,但实际上,它将对前沿开放权重版本进行预发布政府审查。

Anthropic采取了略有不同的策略,并游说对先进人工智能芯片实施更严格的出口管制,并对提取或复制美国模型的行为进行执法。该公司于 2025 年 4 月提交的意见书建议加强美国人工智能扩散规则,并降低未经许可访问大型计算集群的门槛。

官方层面上,两家公司都没有直接反对开放权重模型,但《纽约时报》7 月份的一篇报道援引五名知情人士的话说,OpenAI 和 Anthropic 敦促华盛顿限制强大的开放中国模型。

这场争论归结为关于集中控制的危险是否比所有人免费的危险更可取的争论——特别是考虑到相关公司已证明自己在遏制其开发的技术方面无效。

Hugging Face 需要通过开源模型来保护自己,这表明了向任何一个实体授予过多权力的危险。该公司指出了这一影响:

限制对强大模型的访问可能会减少有能力的攻击者的数量,但一旦存在不受限制的攻击者,限制防御者可能会成为安全责任。此外,某些形式的人工智能安全研究需要访问模型权重,这意味着它无法在 Anthropic 或 OpenAI 等提供的模型上执行。

开放式举重有助于研究人员预防攻击

论文《观察权重:微调法学硕士的无监督监控和控制》于 2025 年 7 月首次发表,展示了研究人员如何通过检查模型权重内部的变化来检测恶意或隐藏行为。在一些实验中,该论文背后的研究人员以低于 1% 的误报率阻止了高达 100% 的测试后门攻击,并在超过 95% 的案例中检测到恢复已删除知识的尝试。结果并未确定最有能力的前沿模型在相同分析下的表现如何,但为透明度的好处提供了令人信服的论据。

但关于防止尖端人工智能技术落入恶意者手中的论点也很引人注目——尤其是在开放式和封闭式权重模型之间的差距不断缩小的情况下。被称为“人工智能教父”的诺贝尔奖获得者先驱杰弗里·辛顿(Geoffrey Hinton)在报告中指出,“一旦你掌握了权重,你就可以对其进行微调以做坏事。”他在一次演讲中指出,这过多地降低了进入门槛: