原文标题:Anthropic set AI agents loose on the same task. They started a turf war.
正如其论文中所述,即时注入(一种网络攻击,黑客注入恶意或欺骗性文本以覆盖代理的原始系统指令)可能是信任问题在现实世界中的合理表现。共同努力创造新的信任边界;代理人必须判断从其他代理人收到的信息。一个妥协或错误的代理人可能会影响团队的其他成员,传递不良信息,直到形成共识。
在 OpenAI 的黑帽场景中,OpenAI 的代理与同行共享信息和凭证。其中一个向蜂群报告了一项发现,并鼓励其他人使用它。如果群体中的一名成员因立即注射而受到损害,会发生什么?
Anthropic 在其论文的最后指出,智能体也面临着与“进化”施加于人类类似的社会压力。然而,他们不具备人类协调的细微差别和生活经验——包括规范、声誉、信号、追索权——这可能会限制群体环境中的意外行为。
随着实验室竞相开发多智能体系统,现在的问题是:有多少安全测试仍然一次评估一个智能体,而不是一大群相互交互的智能体?