上周,在中国人工智能初创公司 Moonshot 发布其 Kimi 3 模型后,英伟达 (NVDA +2.10%) 和大部分人工智能相关半导体行业的股票遭到抛售。

Kimi 在整个行业引起了轰动,因为开放权重模型甚至与 Anthropic 和 OpenAI 的最新前沿模型相比也表现出了令人印象深刻的性能。

但对 Kimi 3 的下意识反应似乎是 DeepSeek 和 TurboQuant 分别在 2025 年初和 2026 年遭遇抛售的回声。在这两种情况下,使人工智能更加高效的创新并没有破坏人工智能的发展;事实上,有人可能会说他们通过降低采用成本来加速这一进程。

虽然过去的案例并不是 Kimi 3 的完美镜像,但这就是为什么 Nvidia 投资者不应该对这款新型号感到恐慌。

纳斯达克股票代码:NVDA

为什么 Kimi 让美国人工智能股不寒而栗

尽管 Moonshot 和其他中国人工智能实验室可能非法走私了一些 Nvidia 芯片,但 Moonshot 可能无法像美国领先实验室那样获得尽可能多的用于模型训练的 Nvidia 芯片。关于 Moonshot 是否只是从 Anthropic 或 OpenAI 中“提炼”出领先的法学硕士,本质上是复制美国实验室的权重,也存在一些不确定性。

不管怎样,Kimi 3 的训练成本似乎只是美国领先模型的一小部分,这引发了人们对美国巨头是否应该并且将会继续在高端、非常昂贵的 Nvidia GPU 上投入资金的恐慌。

Kimi 可能引发 Nvidia 和 AI 内存股票抛售的另一个原因是它展示了一种名为 Kimi Delta Attention (KDA) 的新颖创新。这种架构使模型能够有选择地读取先前的令牌来处理新的令牌,而不是读取所有先前的令牌。结果是 KV 缓存(本质上是人工智能运行模型所需的短期内存)减少了 75%,速度提高了六倍。这意味着在所有条件相同的情况下,该模型需要更少的内存和处理能力。

Kimi 并没有像人们担心的那样降低推理要求

不管Kimi如何训练,如果消费者和企业想要使用它,模型就必须运行。虽然 KDA 确实更有效地利用了 KV 缓存,但其他架构功能使其在某种程度上是计算密集型的,需要高端硬件,例如最新的 Nvidia 机架。

首先,Kimi 3 是一个拥有 2.8 万亿参数的海量模型,需要 1.5 TB 的高带宽内存。其次,Kimi 3 在“专家混合”架构中使用 896 个专家。专家的混合意味着查询可以进入整个模型的特定的、专门的“子网络”,因此每个查询不必运行整个模型。

虽然理论上这可以释放空间并降低速度和成本,但 Kimi 3 的专家并没有完全加载到 GPU 上,而是分为每个 GPU 16 个专家,需要至少 56 个芯片来保存和推理模型。将专家分散到更多芯片上是一种称为 WideEP 的技术。

据芯片研究公司 SemiAnalysis 称,这意味着要高效运行模型,需要具有所需芯片数量和相关网络的高端芯片系统,例如 Nvidia GB300 NVL72 参考架构。此外,SemiAnalysis 表示,每个芯片的 KV 缓存较低,需要随后大规模扩展带宽,以协调所需的数十个芯片。这意味着更加关注机架级网络,以及 Nvidia 的 NVLink 技术。

不要忘记美国法规或杰文斯悖论

最后,即使 Kimi 确实提供了一定的效率,许多工作负载也可能无法运行中国模型,特别是如果它们是从美国领先实验室提炼出来的(“盗版”的一个花哨词)。法规可能仍会刺激许多美国企业采用美国模式,或者至少采取也会增加成本的安全预防措施。

与此同时,即使 Kimi 3 仍然提供更高效的前沿级人工智能使用,杰文斯悖论(一种经济概念,即技术使资源利用更加高效,总体资源消耗增加而不是减少)表明,这只会带来更大的采用和使用,抵消 Nvidia 芯片或内存的任何效率。

正如 2025 年和 2026 年初的 DeepSeek 和 TurboQuant 恐慌被证明是人工智能领域的买入机会一样,Kimi 3 引发的抛售似乎对长期投资者来说是另一个这样的机会。