Jalapeño 首批结果:AI 推理速度与效率行业领先

OpenAI 公布了自研推理芯片 Jalapeño 的首批实测结果。这是在芯片、内存、网络、软件和机架级系统协同设计的前提下,对整机系统而非单芯片所做的性能评估。测试基于 SemiAnalysis 的公开基准 InferenceX,对比对象是当前市面领先的商用 AI 系统(文中涉及 GB200、GB300 系统)。结果显示,Jalapeño 在每瓦吞吐量和端到端延迟两个维度上都明显更好,且没有出现传统硬件常见的“高吞吐与低延迟二选一”的取舍。

在三个公开模型上,Jalapeño 的峰值每瓦产出(即单位功率下完成的 AI 工作量)比对比系统高 1.5 到 1.9 倍,端到端延迟低 1.7 到 3.6 倍。针对高交互负载(如智能体),其综合性能高出 2.1 到 4.1 倍。具体到模型:GPT-OSS 120B 上峰值混合吞吐每千瓦约 1.9 倍,最小 TBT(token 间延迟)约 2.7 倍优势;DeepSeek R1 670B 上峰值每瓦约 1.7 倍,最小 TBT 约 4.1 倍优势;Kimi K2.5 1T 上峰值每瓦约 1.5 倍,最小 TBT 约 3.8 倍优势。特别是在“匹配上一代最佳 TBT”的吞吐测试中,Jalapeño 的每千瓦混合吞吐量是上一代最佳系统的数十倍(例如 DeepSeek R1 上为 104.3 倍,Kimi 上为 56.1 倍,GPT-OSS 上为 53.7 倍)。这些数字来自 InferenceX 基准,统一按各加速器发布的芯片功率(TDP)归一化。Jalapeño 额定 700 瓦,但在测试负载下实际持续功率始终保持在 550 瓦以下。

Jalapeño 的设计出发点不是单芯片跑分,而是让整个推理链路更快。语言模型推理分两个阶段:prefill(处理输入提示)是计算密集,decode(逐 token 生成)更受内存带宽限制,还有跨核跨芯片通信带来的延迟。Jalapeño 通过显式放置模型状态(包括 KV 缓存)并保持其局部性,按需激活计算、内存和网络资源,从而减少数据移动和通信等待。其大域网络让整个工作负载留在单一连接系统内,避免请求在不同资源间来回搬运。这种设计让它既能擅长 prefill 也能擅长 decode,并且能适应两者比例的变化——这是智能体负载的典型特征。

AI 在 Jalapeño 的诞生中直接介入。团队借助 AI 探索实现方案、缩短设计测量验证循环,从开始设计到 tapeout 只用九个月。AI 还优化了算术电路,让芯片在计划时间内容纳更多计算性能。Jalapeño 本身也被设计成一个清晰、可预测的编程目标:工程师用局部张量、显式通信和可预测同步来描述计算,AI 再负责映射、放置、调度和协调。支持新模型仍需新 kernel 和模型专用优化,但用 Codex 和 GPT-Astra,团队在两个月内把三个原本不在生产计划中的开源权重模型调到高性能。对 GPT-OSS 的注意力模块和混合专家模块,AI 生成的实现比人类专家手写版本快 1.5 到 1.8 倍(仅限这些模块,不代表整个模型)。

Jalapeño 带来的直接价值是:同样功耗和硬件下能做更多有用工作,从而降低成功结果的服务成本。OpenAI 计划今年年底前将 Jalapeño 部署进自有算力基础设施。这是多代产品路线图的第一代,Gen 2 已深度开发,Gen 3 正在成型。同时 OpenAI 明确表示会继续与 NVIDIA 等伙伴合作广布加速器,用于训练和推理。文章也承认,量产前仍需完成产线认证、软件成熟度、规模化运营以及更多模型上的验证。综合来看,这些数据来自 OpenAI 自己的测量,虽使用第三方基准,但仍属厂商自证,实际广泛部署后的表现有待独立验证。

Jalapeño’s first results show industry-leading speed and efficiency in AI inference

查看原文