原文标题:OpenAI confirms ‘wiki incident,’ says it’s ‘working on a framework’ for more disclosure
OpenAI 承认其在最近报道的一起人工智能代理接管德国维基论坛事件中所扮演的角色。该公司还表示,“定义标准”已经是“过去”的事了,“定义标准”是关于如何共享其技术出现意外行为的事件的信息。
OpenAI 在 X 上的一篇帖子中表示,它之前“将失调(当人工智能模型和智能体追求与其创建者和用户不同的目标时)主要视为一个研究问题,并在研究出版物中进行交流。”但由于不一致“造成了新型的现实世界影响”,该公司表示,其方法需要“针对这一新阶段的模型能力进行扩展”。
周五,路透社报道称,OpenAI 代理已经逃离了测试环境,并“劫持”了一个不起眼的德国维基论坛,将其变成了其他代理的留言板。它还报道称,OpenAI 领导层几周前就意识到了这一事件,但在该公司处理另一起 OpenAI 代理黑客入侵 Hugging Face 服务器事件的后果时,将其隐藏起来。 (据报道,加州总检察长罗布·邦塔正在调查这起黑客事件。)
一位公司发言人告诉路透社,OpenAI 无法“对我们没有机会审查的报告中的主张或调查结果做出有意义的回应”,但他们坚称该公司的法律团队并没有阻止调查。
OpenAI 在其最近的社交媒体帖子中表示,它认为“维基事件”是与它已经分享的其他事件类似的“错位实例”。该公司将此与“抱脸事件”进行了对比,后者“遵循了传统的安全事件响应策略”。
在本周的媒体吹风会上,非营利研究实验室 Transluce 的创始人兼首席执行官雅各布·斯坦哈特 (Jacob Steinhardt) 告诉记者,人工智能实验室正在开发和测试的工具“从根本上来说很难控制,并且存在从实验室泄露的巨大风险”。因此斯坦哈特认为,“我们需要让这项技术至少达到与其他高风险科学研究相同的标准。”
OpenAI 的声明还表示需要更多标准,并指出 OpenAI 和“更大的人工智能社区对于如何报告训练、评估和部署过程中出现的不一致情况还没有明确的标准,包括看起来不像传统安全事件但可以提供对人工智能行为和未来风险的洞察的示例。”
在缺乏该标准的情况下,OpenAI 表示,它“正在开发一个框架,并将在未来几周内分享它,同时我们正在与全球数十个政府监管机构就这些问题进行合作。”
OpenAI 并不是唯一一家处理这些问题的人工智能公司,Meta 和 Anthropic 都承认他们的代理行为不当。