Anthropic 于周三发布了 Claude Haiku 5.5,称其是其制造的最便宜、最快、功能最强大的小型模型。它的目标是处理大量杂务,例如总结文档和查询数据库,以及对速度敏感的工作,例如实时客户支持和为用户操作网络浏览器。

将 Claude 插入自己产品的开发人员为每百万个输入代币支付 0.10 美元,每百万个输出代币支付 0.50 美元,以获得最多 100,000 个代币的提示。令牌是人工智能模型读取和写入的小文本块,大约是一个单词的四分之三,它们是大型人工智能公司的计费依据。这与 OpenAI 为其竞争对手小型模型 GPT-6 Luna 9 月 22 日推出时设定的速率相符。

Haiku 4.5 的收费为 1 美元和 5 美元,因此新费率降低了 90%,而超过 100,000 个代币的提示则降低了 50%。由于对旧模型的大约 90% 的请求都落在该范围内,并且 Haiku 5.5 将文本拆分为稍微更多的标记,因此 Anthropic 认为平均节省接近 75%。

客户支持聊天和长电子邮件摘要是 Anthropic 构建 Haiku 的目的。因此,本质上重复的、简单的、非创造性的任务最适合这个模型。

也就是说,基准测试表明这无论如何都不是一个愚蠢的模型。例如,在 OSWorld 2.1 上,测试人工智能是否可以通过长时间、多步骤的任务来操作真正的计算机,以部分学分百分比进行评分,Haiku 5.5 击败了 OpenAI 的 GPT Luna,成功率分别为 72.4% 和 48.9%。

Terminal-Bench 4.0让人工智能代理通过自己输入命令来完成专业任务,并对第一次尝试正确完成的份额进行评分。 Haiku 5.5 的使用率为 39.2%,而 OpenAI 的 Luna 为 16.4%,Haiku 4.5 为 0%

相比之下,Anthropic 的 Claude Sonnet 5.5 得分为 70.6%。

我们在一个简单的逻辑问题上尝试了该模型,它的响应速度非常快,几乎是立即响应。它还给出了错误的答案,这不是你想要的模型,所以要小心不要盲目相信它。

GDPval-AA v2.1 使用 Elo 量表(借鉴自国际象棋的一对一评级系统)对 44 个职业的真实专业工作模型进行评级,Haiku 5.5 得分为 1620。Luna 得分为 1437,Haiku 4.5 得分为 735。

这也是第一款具有可调节努力设置的俳句模型,表盘可以让用户以成本换取更明智的答案。 Anthropic 还将 Sonnet 5.5 的缓存读取价格减半至每百万代币 0.10 美元,这是模型已处理文本的折扣率。

Haiku 5.5 于 9 月 22 日发布 Opus 5.5 15 天后发布,9 天后于 9 月 28 日发布 Sonnet 5.5,这是 Anthropic 承诺的三个 Claude 5.5 模型中的最后一个。 Opus 5.5 是首席执行官 Dario Amodei 发表文章敦促行业减缓人工智能能力增长以来的第一个版本。

Haiku 5.5 现已在 Claude 网站、Amazon Web Services、Google Cloud 和 Microsoft Azure 上提供,名称为 claude-haiku-5-5。 Anthropic 本周还推出了每月 API 积分:Max 5x 计划的订阅者可享受 100 美元,Max 20x 的订阅者可享受 200 美元,Team 计划的用户可享受高达 500 美元的奖励。