原文标题:A new kind of AI model from a ChatGPT inventor is thrilling developers

ChatGPT 伤透了 Diogo Almeida 的心。

Almeida 是一名 OpenAI 研究员,他帮助构建了聊天机器人,然后发明了根据人类反馈进行强化学习 (RLHF),这种模型训练技术可能对我们当前的人工智能时代负有最大的责任。但尽管它有能力,他还是感到失望。

“我们有瓶装闪电,但它没有用,”阿尔梅达告诉 TechCrunch。 “从那时起我就一直在与这个问题作斗争。我花了一段时间才得出结论:问题是我们正在针对人类语言进行优化……四年来我们一直非常擅长人类语言,但这对自动化没有用,因为计算机说的是不同的语言。”

两年前,Almeida 离开 OpenAI,创办了 TypeSafe AI,这是一家试图解决这个问题的初创公司。本周,该公司发布了一个新的基于 Transformer 的模型 Jev,它不是一个大型语言模型 (LLM)。它不输出文本,而是产生概率,或者该公司所说的“校准决策”。

避开语言可以做一些事情:它使模型变得非常便宜和快速,并且因为用户提前定义了输出,所以它不会产生幻觉。它的输出代币是免费的,输入代币是计量的

以十亿为单位,而不是以百万为单位。

屏幕截图显示了 Jev 和 OpenAI 模型响应相同请求的比较。图片来源:TypeSafe AI / TypeSafe AI

开发人员对该产品表现出了极大的兴趣;由于需求如此之高,该公司一度失去了通过其 API 为用户提供服务的能力。 Jev 似乎对软件自动化最有用。到目前为止,软件开发人员认为这是一种将智能融入到代码中的更便宜、更可靠的方法。

例如,代理基础设施制造公司 Vercel 的软件工程师 Pranit Sharma 表示,他的公司已使用 OpenAI 的 ChatGPT Luna 5.6 来运行分类器来审查命令的安全性。当 Vercel 用 Jev 取代 OpenAI 的 Luna 时,得到结果的速度提高了 5 到 18 倍,准确性也更高。

另一位开发人员、Bryo AI 首席技术官 Nikhil Mudholkar 对 Jev 与 Gemini 进行了商业电子邮件分类测试。在他的测试中,Gemini 的准确度稍高一些,但价格却贵了 10 到 20 倍。对 Mudholkar 来说更有趣的是 Jev 的置信度得分——“它是唯一一个能够返回真实概率的得分,这使得它非常适合自动化工作流程!!”

除了在某些用例中取代法学硕士之外,

新模型还可以增强它们,作为对不当行为的智能检查。阿尔梅达认为,使用特工来监控特工可能很快就会变得昂贵,但使用 Jev 来做到这一点是有意义的。他看到用户部署 Jev 来跟踪 LLM 代理痕迹并防止越狱。

“最终,它将幻觉问题稍微委托给了用户,”Earendil 的首席技术官 Armin Ronacher 解释道,该公司构建了开源模型 Harness Pi。 “用户必须说,好吧,如果只有 50% 的概率返回,也许这是抛硬币,我会忽略它。但如果是 95%,当然,那么我可以用它做点什么。”

Ronacher 说,Jev 的另一个潜在用途是模型路由。预测给定的工作负载是否需要特定的模型会很有用,但使用法学硕士来完成这项工作会很昂贵。 Jev 的低成本和速度使这种实时分类成为可能。

这就是阿尔梅达的希望。该模型以 19 世纪经济学家威廉·斯坦利·杰文斯 (William Stanley Jevons) 的名字命名,他的同名悖论描述了商品成本下降如何导致其被越来越多地使用。在这种情况下,情报成本的下降应该会导致其广泛部署。

阿尔梅达说:“我们认为,智能软件将会以一种新兴的、分布式的方式遍布各处……更像是早期的互联网,而不是你所知道的人们现在试图构建的大型应用程序。”

阿尔梅达对该模型的架构守口如瓶,外界观察人士怀疑该模型是建立在开放权法学硕士之上的。该公司将 Jev 称为“System One 模型”,专注于直觉而不是推理,并且特别专注于正确的任务。阿尔梅达表示,杰夫专门接受了合成数据方面的培训,使用了一种他称之为“根据校准决策进行强化学习”的技术。

“我们很早就打赌,我们将收集所有数据,这是我一生中做过的最好的赌注之一——在我看来,比我们的发布更好,比 RLHF 更好,”他告诉 TechCrunch。 “[我们公司]的一半是一个实验室,基本上拥有统计上易于理解的合成数据的整个子领域,这就是我现在的生活乐趣。”

目前,Jev 是这种模式中的佼佼者,但 Ronacher 预计,由于其实用性显而易见,竞争对手将会涌现。

“我们应该早点在很多方面看到这一点,但是

大概是因为法学硕士是如此便宜和有补贴,你通常不需要有创造力,”他说。

TypeSafe 本身将以新的方式构建该模型的更多版本。当被问及 TypeSafe 是否是前沿实验室时,阿尔梅达表示,“前沿实验室的主要产品是恐惧或炒作。我希望我们的主要产品是智能……(但我们)不是一个意义上的实验室,你知道,就像赌上无限的财富,或者宗教,或者在数据中心建造上帝,或者今天的任何事情。”