OpenAI 自研芯片 Jalapeño 基准测试:推理性能显著领先当前产品

在 Hot Chips 会议上,OpenAI 首次公开了自研推理芯片 Jalapeño 的细节与基准测试结果。测试基于 SemiAnalysis 的 InferenceX 基准,Jalapeño 在每用户生成的 token 数以及每千瓦功耗的吞吐量上,均超过当前可用的最先进推理处理器。OpenAI 硬件负责人 Richard Ho 在发布会上称,这是相对现有最先进水平的一次非常显著的性能提升:单位功耗能承载更多 AI 工作负载,同时响应更快,既适合大规模服务客户,也能做到低延迟。

需要留意的是,对比对象是 Nvidia Blackwell 系统。但等到 Jalapeño 真正大规模部署时,竞争者的水平可能已大幅提升。Ho 估计,Jalapeño 将在 2026 年底以非常小的规模部署,2027 年才有更显著的放量。

Jalapeño 于去年十月首次公布,由 OpenAIBroadcom 紧密合作开发,OpenAI 自己的模型也参与了开发过程。OpenAI 计划将 Jalapeño 做成多代际平台,让 AI 产品、模型、芯片和内存协同设计。得益于这种全栈方式,OpenAI 能针对推理流程中容易产生瓶颈的具体阶段做优化,尤其是 prefill 和通信阶段。OpenAI 在官方博客中表示,Jalapeño 的设计目标是最大限度减少数据移动和通信延迟,模型状态(包括生成响应时使用的 KV cache)可以被显式放置并保持在本地,系统则根据每个推理阶段动态组合计算、内存和网络资源。

OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show | TechCrunch

查看原文