>>>> gd2md-html 警报:生成的源中的内联图像链接并将图像存储到您的服务器。注意:从 Google 文档导出的 zip 文件中的图像的显示顺序可能与文档中的顺序不同。请检查图像!
----->

一组研究人员刚刚构建了一个大型人工智能模型的更小、更便宜的版本。事实证明,较小的那个比缩小后的版本更聪明。
这不应该发生。
这就像失去肌肉的同时又变得更强壮。但多元宇宙计算公司的一个团队表示确实如此,其原因说明了我们一直在错误地缩小人工智能的规模。
研究人员在周五发表的一篇论文中写道:“对于从业者来说,实际的信息是,在基于蒸馏的治疗管道中,量化步骤不是要最小化的成本,而是教师监督的额外机会,产生的模型同时服务更便宜,内存更轻,并且至少与全精度模型一样准确。”
将人工智能模型的参数视为一堵巨大的旋钮墙——保存它所学到的一切的数字。更多旋钮,更智能的型号,但运行起来更重。 OpenAI 的 GPT-OSS 120B 拥有 1200 亿个旋钮。每一项都需要消耗内存和电力。
为了廉价地运送人工智能,公司剥离了旋钮并缩小了幸存者的尺寸。这就像压缩照片:文件较小,但压缩过多且图像模糊(例如从 4K 变为 720p)。如果模型缩小得太厉害,它就会变得愚蠢。每个人都接受了这笔交易。
这些研究人员走得更远。他们将 GPT-OSS 削减为 600 亿个参数,并将每个参数压缩到一个微小的 4 位槽中,这相当于极限压缩的数字形式。通常这会破坏模型,但这些研究人员找到了一种真正增强模型的方法。
在几乎所有用于比较的基准中,较小的模型优于完全精确构建的模型。
复印错误
当缩小模型时,通常会通过将其与“半缩小”版本(具有 600 亿个旋钮和更高的精度)进行比较来纠正其错误。问题是中间模型已经是原始模型的模糊副本。所以你正在教这个小模型模仿有缺陷的双胞胎。它永远无法超越双胞胎。
这些研究人员所说的“量化感知治疗”改变了目标。它将小模型指向未压缩的大模型,并说:复制这个答案。小模特向大师学习,而不是向泥泞的中间学习。在 9 次测试中的 7 次中,4 位 600 亿模型击败了原本应该是其更好一半的 600 亿双胞胎。真正的 1200 亿参数仍然赢得了大多数回合——尺寸并没有被废除——但“节食”版本却突破了一个没人想象的门槛。
更小、更智能是一件大事,因为人工智能会吞噬硬件。修复后的模型大约需要原始模型四分之一的内存和一半的旋钮。这就是数据中心的人工智能与适合桌面(或者最终是手机)的人工智能之间的差距。
因此,能够在消耗一半能源的情况下产生更好结果的模型对于小型实验室和本地开发人员来说意义重大。
它也是免费的。该团队在 Hugging Face 上将修复后的 Hypernova-60B 模型作为开放权重发布,因此任何人都可以下载并运行它。这符合一系列不断突破令人惊讶的障碍的开放模型:神秘的免费模型 Ox Alpha 最近击败了背后没有已知构建者的 Claude 系统,围绕阿里巴巴 Qwen 3.8 Flash Next 的炒作,以及使用 Fable 或 Claude Opus 等大型法学硕士的推理轨迹来改进小型模型的微调浪潮。
但不要过度旋转。制作 60B 学生的缩小工具是专有的,因此配方尚未完全开放,并且该团队仅测试了 GPT-OSS,而不测试 Llama、Qwen 或 Mistral 系列。