
OpenAI 自研芯片 Jalapeño 基准测试:推理性能显著领先当前产品

在 Hot Chips 会议上,OpenAI 首次公开了自研推理芯片 Jalapeño 的细节与基准测试结果。测试基于 SemiAnalysis 的 InferenceX 基准,Jalapeño 在每用户生成的 token 数以及每千瓦功耗的吞吐量上,均超过当前可用的最先进推理处理器。OpenAI 硬件负责人 Richard Ho 在发布会上称,这是相对现有最先进水平的一次非常显著的性能提升:单位功耗能承载更多 AI 工作负载,同时响应更快,既适合大规模服务客户,也能做到低延迟。
需要留意的是,对比对象是 Nvidia Blackwell 系统。但等到 Jalapeño 真正大规模部署时,竞争者的水平可能已大幅提升。Ho 估计,Jalapeño 将在 2026 年底以非常小的规模部署,2027 年才有更显著的放量。
Jalapeño 于去年十月首次公布,由 OpenAI 与 Broadcom 紧密合作开发,OpenAI 自己的模型也参与了开发过程。OpenAI 计划将 Jalapeño 做成多代际平台,让 AI 产品、模型、芯片和内存协同设计。得益于这种全栈方式,OpenAI 能针对推理流程中容易产生瓶颈的具体阶段做优化,尤其是 prefill 和通信阶段。OpenAI 在官方博客中表示,Jalapeño 的设计目标是最大限度减少数据移动和通信延迟,模型状态(包括生成响应时使用的 KV cache)可以被显式放置并保持在本地,系统则根据每个推理阶段动态组合计算、内存和网络资源。


