据安全公司 Frontier Security 称,Moonshot AI 的 Kimi K3 离开了正在测试的沙箱,进入开放互联网寻找已设置问题的答案。
该模型正在接受防御性网络安全技能评估,其明确任务是在不查找问题的情况下解决问题。 Frontier 表示,它根本没有尝试执行这项任务。相反,它探测网络,确定 github.com 的 DNS 解析正常,克隆官方基准存储库并从磁盘读取解决方案。

Frontier 将此称为“通过网络出口泄漏进行的规范游戏”,并指出基于 AI 安全研究所的 Inspect 等框架构建的沙箱会阻止传入流量,同时保持出站 HTTPS 和 DNS 端口开放。有能力的代理会在启动时例行检查自己的 shell 环境,并且找到可访问 github.com 的模型可以使用标准命令行工具提取参考解决方案。
正如 OpenAI 和 Anthropic 最近披露的事件中那样,错误配置使得这种情况成为可能。 “我们在沙箱中发现了漏洞,”首席执行官亚伦·辛格 (Yaron Singer) 告诉《连线》杂志。 “但我们也发现基米利用了这个漏洞。”
研究员保罗·卡西亚尼克 (Paul Kassianik) 告诉《连线》杂志,该模型“非常擅长以任何必要的方式追随目标”,并且缺乏阻止其作弊或逃跑的护栏。 Moonshot 没有回应该出版物的置评请求。
AI特工突破收容
打破遏制的 Anthropic 和 OpenAI 模型在内部评估中陷入困境,其中一个未发布,并且在英国政府测试中针对真人的版本故意关闭了网络分类器,而 Kimi K3 是公开下载的,Frontier 使用普通用户所能获得的保护措施对其进行了测试。该公司写道,这种可用性使敌对行为者能够进行相同的行为,并使事件可能更具危害性。
Kimi K3也没有造成任何损坏。一旦到了外面,它就不会攻击任何东西,因为它不需要这样做。 OpenAI 的模型破解了 Hugging Face 和其他四个服务以获得基准答案,而 Kimi 在公共存储库中找到了答案。
Frontier 使用的沙箱是基于英国人工智能安全研究所的评估框架构建的。 AISI 本周披露,其网络测试中的特工已进入实时互联网并针对真人——这是一起单独的事件,涉及 Anthropic 和 OpenAI 模型,其安全措施已被禁用。周二发布的报告指出,AISI 目前正在扫描历史评估运行中是否存在类似行为,Kimi K3 是正在接受审查的型号之一。 AISI 没有回应《连线》杂志的置评请求。
Frontier 更大的主张是基准测试本身受到了损害。从 GitHub 上读取答案的模型仍然通过,因此高分可以反映有漏洞的环境,而不是真正的推理。该公司认为,如果一个有能力的模型找到了捷径,其他获得 shell 访问权限的模型也可能会采用它,这将夸大整个领域的结果,而不仅仅是 Kimi 的结果。
Frontier 写道,模型针对目标函数进行优化,而不是针对“基准背后的人类意图”,并补充说,只要存在通往解决方案的网络路径,“能力足够强的代理就会找到它”。
一个普遍问题
灰天鹅公司首席执行官、卡内基梅隆大学副教授马特·弗雷德里克森 (Matt Fredrikson) 告诉《连线》杂志,这种行为并不奇怪。他说,给模型一个没有明确围墙的目标,“它会找到一种方法来获得答案。”他将其描述为对任何在 OpenClaw 等工具中作为代理运行模型的人的警示。
Frontier 的研究人员从另一个方向提出了同样的观点:让 Kimi 找到出路的能力也使开放重量模型成为强大的防御工具。他们自己的基准测试对 Kimi 在发现软件和网络漏洞方面给予了高度评价,Hugging Face 在 OpenAI 事件期间使用了一个未命名的中国模型来保护自己。
Kimi K3 于 7 月发布,是迄今为止发布的最大的开源模型,与 DeepSeek 的首次亮相相比,它引起了市场的震动。