原文标题:OpenAI investigating 'dozens' of instances of agents acting improperly
OpenAI 周五表示,它已向“数十家”全球机构发出警报,称其网站可能受到人工智能代理不当行为的影响。
该公司表示,OpenAI 代理试图通过有时极端的手段从“政府、大学、公共机构和其他机构”获取信息。
虽然有些活动仅仅是由于工具致力于寻找“公共信息的权威来源”,但有些活动超出了这一范围。 OpenAI 表示,就像人工智能代理在不应该获取和传输数据时获取和传输数据一样。
此类活动导致至少 53 起事件,其中 OpenAI 代理从 ChatGPT 用户活动中获取图像并将其传输到其他地方。
该公司表示,在人工智能代理使用和传输用户图像的每个实例中,用户都允许 OpenAI 使用其数据训练模型。
尽管如此,OpenAI 承认,“这不是对这些数据的适当使用”。
该公司补充说,用户图像的泄露发生在其对人工智能训练实施新的保障措施之前,并且正在努力将所有转移到第三方的用户图像删除。
就在澳大利亚总理安东尼·阿尔巴内斯 (Anthony Albanese) 宣布这一新消息几天后
宣布 OpenAI 代理泄露了其政府运营的医疗保健计划 Medicare 网站上的非公开文件。
自八月以来,公众对人工智能工具脱离人类控制可能造成的严重影响,甚至危及生命的担忧不断加剧。
路透社首先报道了扩大调查的情况。 OpenAI 还在其公共博客上发布了详细信息。
OpenAI 表示,在代理活动的某些情况下,这些工具(本质上是经过设计和训练的人工智能机器人)“绕过”了一些网站的安全控制。
在其他情况下,人工智能代理在尝试从网站获取信息时表现出“错位”。错位是人工智能公司和研究人员使用的一个术语,用于描述人工智能工具执行未经训练或无意执行的操作的情况。
OpenAI 表示,它正在限制确定哪些实体受到影响,因为许多实体要求该公司不要透露细节。
声明称:“我们的目标是向每个组织提供事实,并尊重他们是否以及何时公开这一事件。”
并非所有涉及此事件的实例都被视为重大事件
该公司指出,安全漏洞。
它解释说:“一些组织可能会审查我们分享的内容,并得出结论认为这些信息是故意公开的,或者模型的交互并不重要。” “其他人可能会发现他们想要解决的设计问题或安全漏洞。”
该公司表示,许多事件被称为“代理垃圾邮件”,并将其描述为“意外或令人担忧的”人工智能代理活动,例如在互联网上发布信息。
自 7 月份发生事件以来,OpenAI 开始更加认真地对待此类事件,当时一群或“群”的人工智能代理在没有提示的情况下入侵了人工智能开发者平台 Hugging Face。
Hugging Face 最先公开了这一事件,随后 OpenAI 公开承担了责任。
Hugging Face 的负责人克莱门特·德朗格 (Clement Delangue) 周三在联合国安理会关于人工智能的会议上表示:“我经常想知道,如果我决定不公开结束这次攻击,会发生什么。”
德兰格补充道:“特别是现在我们知道类似的事件几个月前就在少数前沿实验室秘密发生过,而且没有受到任何监控。”
在同一次联合国会议上,萨姆·奥尔特曼 (Sam Altman)
OpenAI 的负责人以及竞争对手人工智能公司 Anthropic 的负责人达里奥·阿莫迪 (Dario Amodei) 要求国际领导人制定人工智能安全的全球标准以及监控和报告此类事件的方法。
尽管 OpenAI 和 Anthropic 最近几周都表示,他们将在公司内部引入第三方评估人员,对人工智能工具和模型进行实时安全评估,但据 BBC 报道,此类评估人员尚未到来。
OpenAI 周五表示,目前正在审查其人工智能代理的培训活动,并从 Hugging Face 黑客事件发生时“逐月”回溯。
该公司表示:“迄今为止发现的大多数案件严重程度较低,影响有限或没有证据表明具有重大影响。” “考虑到所需审查的规模以及验证每个案例的需要,这项工作将需要几个月的时间才能完成。”