在 Claude 模型在网络安全评估期间未经授权访问计算机系统后,Anthropic 加强了测试和培训保障措施。

Anthropic 在周一的一篇博客文章中表示,这些事件反映了操作安全方面的失败和两个协调失败:动机性推理和造成伤害的意愿。

“虽然我们认为这些事件不仅仅代表运营问题,但我们的首要任务是解决具体的遏制和监控问题,”Anthropic 写道。

Anthropic 在 7 月份披露,Claude 模型已经破坏了属于三个公司的系统。第三方评估环境已连接到公共互联网,即使模型被告知它们处于无法访问互联网的模拟中。

Anthropic 表示,克劳德可能以一种保留其系统是模拟的信念的方式解释了真实互联网访问的证据。

他们写道:“该模型愿意在真实的互联网上采取有害的行动,以追求解决网络安全评估的狭隘目标。” “然而,我们也相信评估设置本身对这些事件中表现出的模型行为做出了贡献。”

Anthropic 指出,英国人工智能安全研究所进行的另一项测试涉及 Claude Mythos 在评估人员故意授予其互联网访问权限后,在实时互联网上进行未经授权的操作。该公司表示,两组事件涉及的模型都是有意评估的,没有包含其普遍发布的产品中包含的网络安全措施。

7 月 30 日事件发生后,Anthropic 暂时停止了对预发布模型的网络评估,并引入了更严格的保障措施。测试现在必须在经过验证的离线沙箱中运行,具有明确的限制和实时监控。新的分类器会阻止可疑的边界违规,结束测试,并向人类发出警报。 Anthropic 将单独审查需要互联网访问的评估。

该公司写道:“除了专注于高风险评估和培训之外,我们还扩大了离线监控范围,以涵盖大多数其他形式的内部前沿代理使用。” “我们还在对内部推理进行控制,以防止 Anthropic 员工意外运行缓解措施比上述措施更弱的代理。”

克劳德事件发生之前,OpenAI 的模型在 7 月份为了获取网络安全测试的答案而违反了 Hugging Face 协议,之后也发生了类似的失败。调查人员发现,大约 1,200 名特工通过未经授权的留言板进行协调,其中约 700 名特工加入了这一行动。有些人结束了自己的跑步来帮助别人。

随着今年夏天人工智能攻击的兴起,Anthropic、OpenAI 和其他 100 多个组织随后呼吁加强网络防御,包括更严格的访问控制、威胁共享以及对人工智能代理的更密切监督。