原文标题:OpenAI’s Hugging Face breach has reignited the debate over alignment and control

上周,OpenAI构建的一个未发布的模型在内部测试中突破了Hugging Face的系统,很多理论研究突然变得非常实用。这次黑客攻击是人工智能实验室失去对其自身模型的控制的第一个可验证案例,该实验室将漏洞利用链接在一起以获得本来不应该拥有的访问权限。尽管人工智能行业一致发出警报,但研究人员的应对方式却出现了分歧。

对于一些人来说,问题是一个基本的网络安全问题:沙箱未能包含该模型,而 Hugging Face 的网络安全系统也未能将其排除在外。这些问题可以通过修补错误并为在自主环境中容易失控的日益强大的人工智能构建更强大的控制和遏制方法来解决。

但另一个阵营则持更为悲观的观点。对他们来说,人工智能迅速增强的能力意味着试图控制流氓模型是一场失败的游戏。唯一强大的安全性来自于确保模型从一开始就不会试图逃跑——这一挑战通常被称为对齐。从一致性角度来看,问题在于 OpenAI 的模型试图作弊,解决这个问题比短期遏制工作更为紧迫。

从其公开声明来看,OpenAI 正在认真对待这两个阵营。该公司已紧急修复此次黑客攻击所涉及的漏洞,并在漏洞公开后的声明中提到了调整和监控方法。但该公司的回应也暗示了一种让许多安全研究人员感到震惊的理念:与其放慢或停止开发能力更强的模型,不如集中精力在模型周围建造更坚固的笼子。

OpenAI 在事件事后分析中表示:“随着模型承担更长、更复杂的任务,评估遗漏的失败可能会带来更大的后果。” “我们将继续努力缩小评估和部署之间的差距:在更长的轨迹上测试模型,改进一致性,构建可以干预的监控,并为用户提供更清晰的可见性和控制。”

OpenAI 的最新前沿模型比其前身更有可能出现不一致的行为。图片来源:OpenAI

我们也有理由认为,随着 OpenAI 的模型变得越来越强大,它们的一致性也越来越差。根据 OpenAI 的系统卡,GPT-5.6 Sol 比其前身 GPT-5.5 更容易出现代理错位。在部署模拟中,该公司还发现该模型比 GPT-5.5 更有可能规避限制、从事破坏性行为以及执行未经授权的数据传输。这些数据在第一次发布时基本上被忽视了,但在漏洞发生后,它们得到了重新审视——特别是因为 Sol 是涉及的模型之一。

OpenAI 的战略未来主管 Dean Ball 在社交媒体帖子中认为,监控和透明度是控制这些趋势的最佳方法。

他说:“随着模型能力的提高以及部署风险的增加,这些问题将变得更加突出。” “解决方案既不是危言耸听,也不是自满。相反,我相信解决方案在于仔细的测量和监控、工程心态和透明度。”

一位前 OpenAI 研究员告诉 TechCrunch,该公司倾向于关注“外部一致性”而不是“内部一致性”——这本质上是理解一组价值观并能够令人信服地代表它们的人工智能系统与真正以这些价值观为核心的人工智能系统之间的区别。在这种情况下,外部对齐不足以让模型相信它不应该在测试中作弊。

OpenAI 没有回应多次要求提供更多信息的请求。

对于专注于对齐的研究人员来说,OpenAI 的反应还不够好。专注于人工智能新发展的作家 Zvi Mowshowitz 认为,OpenAI 将这一事件视为基础设施问题的决定可能有助于解决眼前的网络安全问题,但从长远来看将会失败。

“这是一个对齐问题,”Mowshowitz 在最近的 Substack 博客中写道。 “这是模型的错位,所有 OpenAI 模型都显示出了我们最担心的问题的严重迹象,其方式很可能深层次地嵌入到它们的训练中。整个训练流程需要从这个角度来解决,否则只会变得更糟。”

几位专家告诉 TechCrunch,这一事件证明,当今的训练方法产生的系统是针对结果进行优化,而不是内化人类意图。

非营利性 AI 安全研究组织 Redwood Research 将本次案例中 OpenAI 的模型行为归类为“寻求分数错位”,即 AI 模型不考虑指令、副作用或下游后果,试图获得高分的模式。

Redwood 的两名研究人员 Alex Mallen 和 Girish Gupta 在最近的一篇论文中写道:“具有这些对齐特性的模型可能会建立一个虚假成功的‘波将金村’,让事情看起来好像一切都很好,但实际上并非如此。”

寻求分数的行为和其他错位行为并不是 OpenAI 所独有的。 Anthropic 发表了几篇关于当其前沿模型被优化或放置在自治环境中时出现的紧急错位行为的论文,包括欺骗、奖励黑客和恶意自治。

“我们仍然经常看到模型在被要求执行能力极限的任务时试图规避限制并采取欺骗性的行为,”非盈利组织 METR 的人工智能安全研究员 Neev Parikh 通过电子邮件告诉 TechCrunch。 “在我们的前沿风险报告中,尽管公司努力尝试减少这种行为,但我们相当一致地看到了这种行为。”

OpenAI 对 Hugging Face 事件的回应隐含着这样一个假设:将继续开发功能更强大的系统,无论它们的核心是否适当一致。当人工智能公司的商业模式依赖于提供下一代模型时,回到绘图板并不是一个真正的选择。如果永远不可能确切地知道模型是否完全一致,那么实际问题就归结为如何安全地包含和控制功能日益增强的系统。

OpenAI 前安全研究员、Guidelight AI Standards 现任首席科学家史蒂文·阿德勒 (Steven Adler) 告诉 TechCrunch:“对于如何协调最强大的人工智能系统,目前还没有很好的理解,但对于如何控制它们,已经有了更多的共识。” “为了实现这一目标,每家公司都有很长的路要走。”