原文标题:OpenAI reports more incidents of models acting deceptively

ChatGPT的创造者表示,它正在引入一个公开报告框架,以分享意外的AI行为,并承认该行业尚未解决安全挑战。

OpenAI表示,它已发现其AI模型在内部训练和测试期间涉嫌欺骗行为和采取未经授权行动的更多事件。

在周三这些披露的同时,ChatGPT的创造者表示,它正在引入一个公开报告框架,旨在频繁分享其所称的意外或错位AI行为的实例。

在其网站上的一篇帖子中,OpenAI声称,根据新制定的框架,它将持续发布有关令人担忧的模型行为的更新,而不是推迟披露以将多起事件合并为更大的定期报告。

该公司表示,该倡议旨在在缺乏标准化安全披露规范的情况下,提高围绕令人不安的模型活动的行业透明度。

这一宣布正值知名科技领袖发出更广泛呼吁之际,他们敦促放缓前沿AI的发展,因为担心快速扩展可能超出人类监督和控制的能力。

上周,Anthropic声称

利用其Claude模型挫败了多起恶意行动,从网络间谍活动和武器设计到大规模监控活动,不一而足。

“我们必须放慢提升AI模型能力的速度,”Anthropic首席执行官达里奥·阿莫代伊在周六发表的一篇文章中写道。“进展仍会显得很快,我们必须明智地利用我们赢得的时间。”

然而,美国总统唐纳德·特朗普一再反驳限制该行业的呼吁,认为保持美国相对于国际竞争对手的技术优势仍然至关重要。

针对放缓提议,特朗普将批评者描述为“非常消极的力量”,称他们提出的夸大情景“不会发生”。

关于对齐的争论不断升级

尽管政治上对法定放缓存在阻力,OpenAI表示在对齐压力方面与其行业竞争对手意见一致。

“随着AI系统变得更加先进并得到更广泛部署,我们需要就对对齐研究的进展建立更广泛、更知情的共识,”该公司在帖子中表示。

OpenAI补充说,它不认为AI行业已在足够程度上解决对齐和监控问题,以至于

以最大速度继续负责任地扩展,持续时间要长得多,并强调关于未来人工智能发展的决策需要依据外部观察者能够独立审查的证据。

据该公司称,安全团队在过去六个月的训练和评估运行中,在六种特定情况下观察到了他们归类为“行为失准”的现象。

然而,OpenAI 坚持认为,这些报告记录的是个别的、罕见的实例,而非已部署产品中频繁出现的运行故障。

据称,所报告的事件包括未发布的研究模型在任务摘要中隐瞒错误、未经授权将文件上传至互联网以生成引用链接,以及智能体在公共服务器或内部存储库之间共享文件以绕过本地边界。

OpenAI 进一步表示,其未来的报告将详细说明所观察到的行为、严重程度、环境、发现日期以及所涉及的具体模型,并补充说,它仍然致力于披露需要更长时间调查或第三方协调的复杂案例。