原文标题:OpenAI’s new reasoning technique alarms AI safety experts
据《The Information》周二报道,OpenAI 的新 Astra 模型将使用一种名为“循环深度”的推理技术,使其能够在大多数推理模型所特有的顺序思维之外进行操作。这种技术也被称为“不透明递归”,可能会使模型的思想链更难以监控——这让人工智能安全专家感到不安。
据报道,尽管 Astra 对这项技术的使用有限,但它的出现仍然引起了人工智能安全专家的严重担忧。
Redwood 首席执行官巴克·施勒格里斯 (Buck Shlegeris) 消息传出后在一篇帖子中写道:“我对 Astra 使用不透明重复的报道感到非常担忧。” “我不知道 Astra 的 CoT 可监控性是否比以前的模型低得多。但如果 OpenAI 进一步推动这项技术,他们将可以选择大幅增加重复率并完全破坏 CoT 可监控性。”
长期人工智能安全倡导者兹维·莫肖维茨 (Zvi Mowshowitz) 也发表了自己的看法,并写道,可能有必要制定法律来防止人工智能实验室之间的“逐底竞争”。
“这项技术是在玩火,冒着 OpenAI 和 Anthropic 一直努力建立的禁忌的风险,即我们努力尽可能长时间地保持思想链的忠实性和可监控性,”Mowshowitz 写道。 “更频繁地使用此类技术可能会损害可监控性。”
在正常情况下,推理模型的思想链提供了模型在尝试解决问题时所采取的顺序步骤。尽管这种表述并不完美,但它仍然可以作为监控不当行为或失调的宝贵工具。就 OpenAI 最近的流氓代理活动而言,思维链记录是弄清楚代理行为原因的重要工具。
在不透明循环中,模型采用不太线性的方法,在循环中多次处理相同的查询。结果留下的清晰痕迹更少,有效地回避了传统的思维链记录。
至关重要的是,Astra对该技术的使用似乎是有限的。该模型的思想链仍有望清晰易读,该公司拒绝了任何有关其将转向“神经语言”的建议。 OpenAI 已经宣布了广泛的思想链监控系统的计划,作为其前瞻性安全计划的一部分。
在 X 上的一篇帖子中,OpenAI 首席科学家 Jakub Pachocki 强调了该实验室对清晰思想链的承诺。 “自从我们创建第一个推理模型以来,OpenAI 就一直致力于保存和利用思想链监控,”Pachocki 写道。 “这是我们当前研究计划的核心目标。
所有人工智能模型都会进行一定数量的不透明推理,很少有研究人员将思想链日志作为模型推理的直接表示。尽管如此,这些警告并没有消除人们的担忧,即不透明的重复可能会使人工智能推理更难以监控,特别是随着它在不同模型中的使用不断增长。在周三上午的后续报道中,The Information 报道称 Anthropic 和 Google DeepMind 已经在讨论这项技术。
Redwood Research 首席科学家 Ryan Greenblatt 在一篇回应该消息的帖子中表示,不透明推理可以轻松地比传统的思维链推理更快地扩展,从而有效地消除可见渠道中的所有推理。
格林布拉特写道:“我最担心的是,从这里开始的自然进展将涉及将不透明推理扩大到模型完全或几乎完全在潜在空间中推理的程度。” “我希望现在避免最令人担忧的架构还为时不晚,OpenAI 将就此止步。”