原文标题:OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show
值得注意的是,这一比较是针对 Nvidia Blackwell 系统的,但当 Jalapeo 完全部署时,竞争可能已经取得了显着进展。 Ho 估计 Jalapeo 将在 2026 年底“小批量”部署,并在 2027 年进行更大规模的部署。
Jalapeo 于去年 10 月首次宣布,由 OpenAI 与 Broadcom 密切合作开发,OpenAI 自己的模型协助开发过程。该公司计划将 Jalapeo 打造成一个多代平台,允许人工智能产品、模型、芯片和内存协同开发。
由于采用了全栈方法,OpenAI 能够解决推理过程中经常导致推理处理过程中出现摩擦的特定阶段。特别是,Jalapeño 旨在最大限度地减少处理的预填充和通信阶段的延迟,OpenAI 表示这通常是瓶颈。
该公司在介绍结果的博客文章中表示:“我们设计 Jalapeo 是为了最大限度地减少数据移动和通信延迟。” “这意味着模型状态,包括生成响应时使用的 KV 缓存,可以显式放置并保留在本地,同时系统为每个推理阶段激活计算、内存和网络的正确组合。”