原文标题:Nvidia just showed that the harness, not the AI model, is now the real hero
当要求人工智能执行长期任务时,这比底层模型要重要得多。线束是人工智能模型的软件包装器——将原始模型转变为可以独立运行的工具、内存管理和规则。
长话短说:只需使用经过调整的定制工具来很好地处理内存,并包括一个类似“主管”的 boss 组件,研究人员就让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上获得了 100% 的分数。ARC-AGI-3 是一组没有指令的 2D 游戏,其中模型必须弄清楚如何玩并获胜,类似于人类的游戏方式。 (这一基准尤其令竞争对手前沿实验室 OpenAI 感到恼火。)在没有该安全带的情况下,Opus 5 的得分为 30%,这是所有测试模型中最高的结果。
英伟达的研究表明,虽然模型选择确实很重要,但模型本身(充当代理“大脑”的部分)在代理系统中所占的比例比许多人工智能用户意识到的要小,尤其是对于长期任务而言。线束使模型成为代理:它处理记忆、上下文和反馈。
“一般来说,世界将代理几乎解释为模型的 API,”Nvidia 人工智能部门产品副总裁 Adel El Hallack(如上图所示)告诉 TechCrunch。但代理人的作用实际上不止于此。 “它是模型。它是模型周围的脚手架,我们称之为工具,即它使用的工具集。它是运行时以及我们为其提供访问权限的相关技能和库。”
长期任务是那些需要将许多决策串联在一起(有时需要数天)才能完成的工作。这与人工智能只是对提示做出响应形成鲜明对比。弄清楚如何让人工智能在不分心、不胡闹的情况下完成长期任务,是代理研究的圣杯之一。
例如:微软在 4 月份发布了一项研究,测试了 19 名法学硕士涉及文档编辑的长期任务,发现所有模型(包括前沿模型)都充满了错误。 (如果人类做出这样的工作,他们会立即被解雇。)
自行做出决策的模型也被发现删除用户的文件,甚至整个数据库,或者转向犯罪行为来实现从共谋到黑客攻击的目标。
Nvidia 研究人员选择使用这个交互式推理基准进行测试是特别有意义的,几乎是有趣的。 100% 的分数意味着该模型可以像人类一样击败游戏。
OpenAI 对其模型在 ARC-AGI-3 上的糟糕得分(低于 10%)感到非常慌乱,以至于上个月进行了自己的研究。与 Nvidia 一样,OpenAI 发现,只需调整安全带上的两个设置,其模型的得分就增加了两倍。
但没有一个模型能够像 Nvidia 的研究人员那样接近 100% 的分数。他们表明,该安全带需要一个“监督者”组件,当智能体卡住时,该组件可以促使智能体朝正确的方向前进。
“更有趣的部分是,除了负责这项工作的主要代理人之外,还引入了一名监督代理人,”埃尔哈拉克说。它“几乎就像首席执行官一样,当代理偏离方向或开始探索一条可能导致死胡同的路径时,或者重新探索它以前走过的路径时,就会推动它。”
虽然监督代理的概念并不新鲜,但如今大多数代理用户仅依赖一层来使用他们的工具,例如 Claude Code、Codex 或 Hermes。 Nvidia 研究人员创建了自己的增强型工具,称为 Agentic Variation Operators (AVO)。
请注意,这不是 Nvidia 的新产品。相反,Nvidia 生产了大量用于构建 Nemo 品牌线束的开放技术。其中一些技术是商业化的,许多技术是公开可用的。
尽管如此,英伟达的结果进一步证明,模型选择远非影响代理性能的唯一因素。例如,7 月,Databricks 发布了一些令人惊叹的研究,表明该工具比模型更能极大地影响人工智能成本。
Databricks 首席执行官 Ali Ghodsi 告诉 TechCrunch:“你可以选择相同的型号,但使用不同的线束,如果使用错误的线束,你的成本会显着增加。” “所以你会想,哦,这是一个昂贵的型号。这是一个便宜的型号。但是等等,你使用哪种安全带?它本身可以使你的成本增加两倍。”
英伟达更重要的一点是要表明,开放式安全带就像开放式模型一样,让用户的控制力远远超出他们的想象。
“我们相信,而且我们正在通过生态系统来演示,开放式安全带如何让您能够转动更多旋钮来提高准确性,”El Hallack 说。 “这与 OpenAI 减慢模型训练速度有关”,因为模型造成了安全漏洞。
他补充道:“我们相信,拥有一个开放的代理堆栈——您可以在其中跨线束、跨基础设施、跨运行时进行控制——是我们引领生态系统安全向前发展所必需的。”