原文标题:OpenAI says it slowed Astra model development over security concerns

OpenAI 周五表示,在内部审查发现其在代理编码和网络安全方面取得了重大进展(足以引起对其能力的担忧)后,该公司已暂停其即将推出的 Astra 模型的某些方面的工作。

OpenAI 在周五的一篇博客文章中表示,这个仍在开发中的模型已经达到了“关键的网络安全阈值”,这意味着它可以独立识别并针对传统上受到良好保护的现实世界系统进行网络攻击。根据该公司于 2023 年创建的“准备框架”,这引发了额外的保障措施。

OpenAI 写道:“虽然我们继续对这个模型进行基准测试和评估,但我们的初步评估表明其性能足够强大,因此我们目前不能排除关键能力级别。” “Astra 是一款即将推出的车型,并未参与 Hugging Face 的利用。”

这一披露突显了混乱且仍处于萌芽状态的前沿人工智能实验室领域的一个不寻常时刻。各行业的公司因潜在风险(包括安全和网络安全问题)而暂停产品。但当产品仍在开发中时,他们很少公开宣布这些决定。

在这种情况下,OpenAI 已经受到审查,因为一个不同的未发布模型在内部测试期间破坏了 Hugging Face 的系统,这是人工智能实验室失去对其模型控制的首个可验证事件。此后,OpenAI 和 Anthropic 等人工智能实验室披露了其他一些人工智能模型在网络安全测试期间突破沙箱并构成威胁的事件。

这一系列案件似乎每天都有新的披露,引发了网络安全专家、立法者和人工智能实验室本身的不同反应。一些人表达了恐惧并呼吁加强监督。但也有一点弯曲。在某些圈子里,任何拥有具有这种能力的模型的人工智能实验室都将被视为令人印象深刻的进步。

OpenAI 表示,之所以分享这些信息,是因为它认为“对于这种潜在的能力转变,向公众以及安全和安保社区保持透明非常重要。”

人工智能实验室表示,它也在采取行动,包括制定更严格的安全控制措施,并暂停涉及 Astra 的不符合这些强化护栏的内部活动。 OpenAI 表示,它正在与相关政府机构和“选定的人工智能安全组织”合作,测试该模型的功能。