乔治华盛顿大学的物理学家发布了一个公式,该公式可以估计人工智能聊天机器人在陷入糟糕的答案之前会给出多少个好的答案,早期的测试表明它是有效的。

Neil Johnson 和 Frank Yingjie Huo 发表的这项研究发表在《Patterns》杂志上,并以预印本为基础,预印本是在正式同行评审之前公开发布的版本,于 2 月份首次发布。

聊天机器人可以在很长一段时间内做出明智的回答,然后转向有害的事情,例如关于自残或极端主义言论的糟糕建议,而且没有简单的方法来预测这种转向何时会发生。作者认为,现有的安全工具通常依赖于离线模型所缺乏的云连接。

约翰逊和霍将问题追溯到注意力头,这是人工智能模型的一部分,它决定对话中前面的哪些词在选择下一个词时最重要。随着聊天的进行,累积的上下文会将注意力吸引到一组可能的答案或另一组答案上,直到出现提示。

这是许多越狱者利用的常见模式,也是可能的公司关注系统提示(人工智能聊天机器人在任何查询之前读取的文本片段)的原因之一。然而,没有人能够准确指出需要付出多少努力才能有效削弱一个模型。

他们的公式将临界点(称为 n )估计为在第一个坏标记之前出现的好标记(模型一次产生一个的单词片段)的数量。如果对话已经倾向于坏的一面,模型会立即倾斜,n 为零。如果效果良好,模型会给出一系列良好的答案,然后发生翻转。

在预印本中,该公式在 16 项明确测试中的 15 项(即 94%)中选择了正确的案例(立即或延迟)。研究人员在六个开放权重模型上进行了这些测试,这意味着人工智能系统的文件是公开的,因此任何人都可以从 OpenAI、EleutherAI 和 Meta 下载并运行它们。

所有六个参数都在 1.24 亿到 4.1 亿之间,这些参数是模型内的可调整数字,可以粗略地衡量模型的大小。据报道,这篇发表的论文将测试范围扩大到了 7 个模型,参数多达 120 亿个,但按照当前标准来看,这个数字仍然很小。

目标是设备上的人工智能,即完全在没有互联网连接的手机或笔记本电脑上运行的人工智能,包括人们像朋友一样交谈的聊天机器人。 Decrypt 去年测试的谷歌实验性 AI Edge Gallery 应用程序已经可以让 Android 手机离线运行模型,并且输入的任何内容都不会发送到谷歌的服务器,随着硬件变得更强大、更小的人工智能模型变得更强大,这似乎是一种随着时间的推移而增长的趋势。

离线运行的模型没有云服务检查其输出,这是作者想要弥补的差距。他们提出了一种与模型并行运行的低成本监视器,并在 n* 低于安全阈值时进行标记,有点像汽车仪表板上的警示灯。

他们还描述了将临界点推向超出范围的方法,例如将内容注入对话中,以便 n* 超出响应的长度。作者说,对齐训练是教导模型行为的过程,可以改变或抑制特定提示的小费,但不能消除潜在的机制。

2025 年 4 月,Decrypt 报道了同一对的一篇早期论文,该论文显示“请”“谢谢”对模型输出的影响可以忽略不计,因为该模型将礼貌用语视为与请求的实质内容正交或在数学上无关的。该版本模拟了一个单一的、刻意简化的注意力头。

预印本的测试使用了小型模型和 300 个标记的窗口,或者几个短文本段落,其预测可能会因一个输出而偏离。