Anthropic 于周二发布了 Claude Fable 5.1 和 Claude Mythos 5.1,这是自 6 月 9 日推出《神鬼寓言 5》以来 Mythos 级模型系列的首次更新。
该公司声称新的人工智能模型是世界上“最先进的编码和知识工作”,并且它已经进入了三个月的发布周期,其中已经包括 18 天的出口管制关闭、仲夏期间订阅访问的价格战,以及 7 月份发布的 Claude Opus 5,其价格低于《神鬼寓言 5》。

根据 Anthropic 的说法,《神鬼寓言 5.1》和《神话 5.1》是相同的基础模型,但附加了不同的安全过滤器。 《神鬼寓言 5.1》通常可供拥有 Claude 帐户的任何人使用。 Mythos 5.1 仍然仅限于通过 Anthropic 的网络验证计划和生命科学验证计划进行审查的网络安全和生命科学专业人员,该计划是 Mythos 5 门禁的 Glasswing 项目访问路径的继承者。
基准测试实际衡量的是什么
Anthropic 的头条数据来自 Terminal-Bench-Science 0.1,这是一个测试 AI 代理是否可以在命令行环境中执行科学研究任务的基准测试,得分为通过率。
《神鬼寓言 5.1》的收视率达到 52.6%,而《神鬼寓言 5》和《Opus 5》的收视率分别为 24.7% 和 29.0%,是前作的两倍多。
Terminal-Bench 4.0 测试通过终端完成的代理编码——跨多步骤命令行会话编写、运行和调试代码,以正确完成任务的百分比进行评分。 《神鬼寓言 5.1》的得分为 55.8%,高于《神鬼寓言 5》的 42.0%,也领先于 Opus 5 的 52.3%。
Mythos 5.1 在使用较轻的网络安全过滤器的情况下运行,在同一测试中得分为 60.9%; Anthropic 表示,这一差距反映了其防护措施拦截并重新路由到 Opus 4.8 的任务。
在 Humanity 的 Last Exam(一项由数十个学术领域的专家级问题组成的多学科推理测试中,Fable 5.1 在没有外部工具的情况下达到了 60.9%,在使用外部工具的情况下达到了 65.0%,均领先于 Opus 5,这表明这是 Anthropic 用于学术目的的最先进模型。
它击败 Opus 5 的地方,以及数学变得更加模糊的地方
Opus 5 于 7 月推出,每个代币价格是《神鬼寓言 5》的一半,但在大多数主要基准测试中的得分都超过了《神鬼寓言 5》,这实际上使旗舰型号对于大多数付费用户来说是多余的。
Fable 5.1 扭转了这一局面:它现在在 Anthropic 发布的所有基准测试中都击败了 Opus 5,包括 Opus 5 之前击败 Fable 5 的基准。
但《神鬼寓言 5.1》的每个代币成本仍然是 Opus 5 的两倍——投入 10 美元,产出 50 美元,而 Opus 5 的投入为 5 美元,产出为 25 美元。令牌是模型可以处理的基本信息量(通常约为平均英语单词的三分之二),公司需要付费使用,因为繁重的工作流程通常会很快耗尽订阅计划中设置的配额。
Anthropic 自己对该模型的宣传依赖于努力水平而不是原始分数:它表示,以低或中等推理努力运行《神鬼寓言 5.1》可以以低得多的成本匹配或击败《神鬼寓言 5》的旧结果,同时为那些困扰其他一切的问题保留最高努力等级。
对于日常工作来说,努力程度越低,完全跳过 Opus 5 的理由就越弱。
经过几个月的 Anthropic 调整条款后,Access 遵循与《神鬼寓言 5》相同的划分方式。在 Pro 计划和标准团队或企业席位上,《神鬼寓言 5.1》完全从按 API 费率计费的即用即付使用积分中提取,因为它不属于这些计划的每周限制。在 Max 套餐和高级团队或企业席位上,它作为订阅的标准部分包含在内,每周使用量高达 50%。
Claude Fable 5.1 现已在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上提供,型号 ID“claude-fable-5-1”。