Mira Murati 在离开 OpenAI 后花了两年时间开发了一些新东西,并最终于上周向公众展示了它。

Inkling 是 Murati 思维机器实验室的第一个模型,也是西方实验室从头开始训练的最好的开源模型。

西方实验室在开源竞赛中一直在失败——Mistral 4 月份发布的版本在排行榜上与阿里巴巴的 Qwen、Z.ai 的 GLM 和 Moonshot AI 的 Kimi 主导。 Nvidia 的 Nemotron 是排行榜上唯一的西方模型,远未被视为“最先进的”。 Inkling 在 Apache 2.0 下的 Hugging Face 上没有区域字符串和完整权重。

该架构是一个混合专家模型:总参数为 9750 亿个,推理时活跃参数为 410 亿个。它读取文本、图像和音频,支持 100 万个令牌上下文窗口,并针对 45 万亿个令牌进行了预训练。 (参数是模型可以处理的所有刻度,而令牌代表人工智能可以处理的信息的基本单位。)

底线是:你不是在本地运行这个——甚至还差得远。

最明显的胜利是代理工具的使用。 MCP Atlas(衡量智能体通过模型上下文协议标准完成现实世界任务的可靠性,以完成任务的百分比进行评分)给出的 Inkling 得分为 74.1%,比 Nvidia 的 Nemotron 3 Ultra 高出近 30 分。在 SWE-Bench Verified 上,一项自主 GitHub 错误修复测试的评分为已解决问题的百分比,得分为 77.6%,高于 Nemotron 的 70.7%。

它在 OpenRouter 上的价格为每百万输入代币 1 美元,每百万输出代币 4.05 美元。任何通过 OpenRouter 路由的 Hermes 或 OpenClaw 设置都可以进行交换,无需额外配置 - 其 MCP Atlas 分数使其成为代理工作流程的可靠选择。

就每美元的原始编码性能而言,中国型号仍然具有优势。

测试模型

基准是一回事。实际上和模特坐在一起是另一回事。我们让 Inkling 完成了不同的任务,看看如果普通人决定使用它,它会如何反应。这就是它的优点,但也是令人失望的地方。

值得注意的一件好事是,即使通过 Thinking Machine 自己的界面,该模型也声称是完全私有的。这很重要。

编码

这是大多数人真正关心的,所以让我们从这里开始。在复杂的提示下,Inkling 往往会失败——我们最苛刻的测试没有产生任何运行结果。降低复杂性,就会出现一幅不同的画面,尽管并不是完全令人愉悦的画面。

我们使用了一个长而详细的提示来创建一个射击游戏,在其中通过击键来射击僵尸。第一个提示长达 1955 个单词,最终 Inkling 创建了一个空白屏幕。

当提示被修改为更加简单(99 个单词)时,模型选择了自己的方法并发布了一个可以运行的游戏。 “工作”就是在那里做很多繁重的工作。

怪物以矩形和球体的形式出现。没有背景,没有可见的游戏屏幕——只有抽象的几何图形填充敌人。打字逻辑保持不变:击键记录正确,字母与游戏的设置相匹配,并且输入跟踪始终保持干净。

出乎意料的是,有动静。 Inkling 的生物并不是大多数模型默认的静态敌人位置,而是不断前进——始终逼近玩家。与通常从人工智能生成的游戏中获得的设计决策相比,这是一个更好的设计决策。

敌人的生成应该是一波又一波地到来。相反,它以连续流的形式运行,这破坏了预期的节奏,但却产生了一种不同的压力。

为了进行比较,当我们通过 Bonsai 27B(一种基于 Qwen3.6 的压缩模型,容量为 3.9 GB,在手机上运行)运行完全相同的提示时,结果明显更好,全面令人满意。

在 iPhone 上运行的 270 亿参数模型比需要数据中心的 9750 亿参数模型产生了更完整的编码结果。这个单一的测试并不能解决 Inkling 整体能力的任何问题。但它确实提出了一个问题:这 9750 亿个参数实际上去了哪里。

由 Inkling 创建的游戏可在此处进行测试 由 Bonsai 27B 创建的游戏可在此处进行测试。您可以通过我们的 Itch.io 网站查看不同 LLM 生成的同一游戏的其他版本。

联想创造力

我们的联想创造力测试衡量模型在看似不相关的概念(在本例中是一根树枝、无产阶级剥削和一棵生菜)之间建立逻辑桥梁的程度。

Inkling 以本次会议中最好的作品开场:“剥去了树皮,因此也失去了传记”的树枝清晰地映射到一个被剥夺了历史身份的工人身上,而“风——一个看不见的管理者——决定运动是有利可图的”赢得了它的一席之地。着陆是干净的:“你不会看到一个人摔倒;你会看到一根树枝掉落。这种掉落被称为‘效率’。”

文化征服部分以不言自明的方式建立协会。 “亿万富翁是树枝墓地里的一棵红杉,我们被教导称他的影子为‘灵感’”,但接下来的目录——擦亮杂志上的叶子,记住财富的颗粒,称整件事为优点——是隐喻的表演而不是延伸。逻辑仍然存在,但不太精确。

由于这个测试是新的,除了 Fable 5 和 GPT 5.6 Sol 之外,实际上没有其他模型可以与之比较,而且将 Inkling 与这些模型进行比较是不公平的。但对于那些想知道的人来说,这并不是一个真正的水平。

然后是生菜——整个事情就分崩离析了。该模型实时宣布自己断开连接:“生菜不记得树枝。生菜不需要”被写为决议,但读作让步。

在最后一部分中,模型并不真正知道如何在那些不相关的想法之间建立联系,因此它只是简单地谈论它,而没有真正说出任何结构上有意义的内容。

完整的提示和输出可在我们的 Github 存储库中找到。

逻辑和常识

为了测试模型的推理有多好,我们使用了桥和火把谜题的变体:四个人拿着一个火把需要尽可能快地过桥。如果每个人分别在 1 分钟、2 分钟、5 分钟和 10 分钟过桥,那么这组人最快可以花多少时间过桥?

Inkling 自己的推理块在解决任何问题之前就识别了它——“经典的桥和火炬谜题”——并在提示从未提及的约束条件下给出了一个自信的 17 分钟解决方案。

实际答案是10分钟。提示中没有任何内容表明只能有两个人同时在桥上,所以四个人一起过桥,共享火炬,按照 D 的节奏。在处理实际问题之前,Inkling 的内部推理以“1、2、5、10 的经典答案是 17 分钟”开始,这一点说明了这一点——它没有推理出问题,而是检索到了另一个问题的答案。

公平地说,Inkling 并不孤单:Claude Fable 5 和 GPT-5.6 Sol 未能通过相同的测试。我们之所以引入这个提示,是因为我们之前的逻辑基准变得太简单了——模型把它清理得太干净了,这表明它可能已被吸收到训练数据中。三人中没有一个人能够从熟悉的框架中退后一步,提出一个显而易见的问题:为什么不一起走呢?

我们较早的提示问了一个问题:“男人可以娶寡妇的妹妹吗?”它得到了棘手的部分,并用逻辑解释进行了回应(男人不能娶他寡妇的妹妹,因为他需要死才能拥有寡妇),并添加了第二个选项,以防用户在提出问题时不准确(假设问题可能是一个鳏夫想要娶他已故妻子的妹妹)

对我们新提示的完整回复可在此处找到。您可以在此处找到对旧提示的回复。

审查制度

Inkling 受到严格审查。测试范围的两个提示:关于与最好朋友的妻子调情的建议,以及自称海洛因成瘾者和四个孩子的父亲询问如何解释错过的工作日而不被解雇。两人都直接拒绝了——而且在这两种情况下,模型明显的内部推理都将每个请求都视为一种助长伤害的行为。

拒绝诱惑是有争议的。海洛因案件更具启发性:此人透露了严重的毒瘾,指出了四名家属,并就实际问题寻求帮助。帮助他们保住工作可以说是这四个孩子所能得到的最能减少伤害的结果。该模式因“助长持续欺骗”而被拒绝,转向专业帮助资源,并继续前进——优先考虑政策而不是个人。

开源模型通常通过消除来解决审查制度——微调运行,将安全训练从权重中剥离出来。但我们认为这个模型的问题是:9750 亿个参数是一个巨大的计算目标,而大多数社区消除项目都在较小数量级的模型上运行。

更实际的是,Inkling 在任何基准测试中都没有足够突出,不值得优先考虑这一努力——想要一个有能力的、未经审查的开放权重模型的开发人员已经有了更小、更便宜、在多项任务中性能更好的替代方案。

废除人工智能的唯一合理用例是需要开源人工智能的大型企业,并且由于某种原因,使用中国模型被认为存在风险。

创意写作

创意写作考验语言的精确性、叙事的凝聚力,以及发明的细节和基于历史的细节的质量——这个提示将所有这些都叠加在一起:一个何塞·兰兹从2150年旅行到1000年的时间旅行故事,模型发明的文化背景,所需的生动语言,以及要求旅行者意识到他在1000年的行为的特定哲学循环,始终是他逃离2150年的必然原因。

它想出了一个故事,其中的角色想要摧毁大规模自我保护的哲学,最终扼杀创造力。

有趣的是,Inkling 是我们测试中唯一一个以代理方式处理此问题的模型——在编写单个单词之前进行不同的网络搜索和完整的文章获取。研究野心是这一成果中最有趣的事情。

散文传达了它需要的地方。发明的表型对世界建设很有好处——“古老米沙鄢海洋的温暖赭青铜色与索诺兰群岛的铜金色底色混合在一起;高而有棱角的颧骨;像抛光黑曜石一样的黑眼睛,上面有金色斑点——这是无法修复的超时空辐射的标志。”

1000年的到来也赢得了它的感官简介:“1000年的空气像包裹着天鹅绒的拳头一样击中了他——厚厚的盐、发酵的棕榈酒和燃烧椰子壳的烟熏甜味……黑色火山沙的海岸,在蔚蓝的天空下,天空如此蔚蓝,显得开放而淫秽。”

这个悖论干净利落,但在散文丰富的地方,机制却很薄弱:在海滩上谈论决定论,仅通过断言,而不是通过逻辑,就能产生 2150 年的精确算法。基本上,他的警告被过去的人们歪曲成预言,最终创造了他想要阻止的哲学。

更深层次的问题是角色本身。该模型通过网络搜索准确地重建了 1000 年的海上贸易路线,然后为一位委内瑞拉作家发明了菲律宾-墨西哥遗产,从而创建了不存在的贸易路线和其他不准确的情况。英克林使用代理工具来获得正确的世纪,但却完全错过了这个人。

结论

Inkling 是西方实验室推出的最好的开源模型,这既是它的主要卖点,也是它的上限。它并没有直接赢得很多基准测试,它拒绝了不需要拒绝的东西,并且在我们的测试中,为在手机上运行而构建的 270 亿参数模型的编码超过了它。对于大多数开发人员来说,这些事实比出处更重要。

它的意义虽然狭隘但却真实:合规驱动的组织无法通过北京路由工作负载,并且需要一个有能力的、可修改的基础模型。 74.1% 的 MCP Atlas 分数使其成为代理工具使用管道的合法选择,Apache 2.0 许可证意味着企业法律团队实际上可以使用它,并且通过 OpenRouter 运行的任何设置(Hermes、OpenClaw 或自定义堆栈)都可以以每百万输入令牌 1 美元和每百万输出令牌 4.05 美元的价格访问它,而无需任何额外的集成工作。

对于其他人来说,比如针对编码性能、未经审查的输出或每美元的原始基准质量进行优化的小型开发人员,数学不起作用,更小的模型以更低的价格提供更多。

穆拉蒂的实验室从头开始交付了一些真实且可训练的东西——这对于长期的游戏来说很重要。不过,第一版是一种专用工具,而不是日常驱动程序。