OpenAI 8 月 25 日公布了自研推理芯片 Jalapeño 的第一批实测数据。测试用的是 SemiAnalysis 的公开基准 InferenceX,模型选了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T,工况标注为 8k 输入、1k 输出、单 token 预测。
总体口径是三个模型上峰值吞吐的每瓦产出高 1.5 到 1.9 倍,端到端延迟低 1.7 到 3.6 倍,高交互负载下性能高 2.1 到 4.1 倍。附录把对比对象和功耗都写明了。GPT-OSS 120B 对的是 1200 W 的 GB200,峰值混合 TPS/kW 是 85448 对 44960,端到端延迟 1.03 秒对 1.80 秒,最小 TBT 0.69 毫秒对 1.87 毫秒,也就是单用户每秒 1459 对 535 个 token。在 535.28 tok/s/user 这个交互档上,两者的每千瓦混合吞吐是 22935 对 427。
功耗口径需要留意。归一化用的是各家公布的芯片标称功率,Jalapeño 标称 700 W,但 OpenAI 说实测持续功耗在这批负载下保持在 550 W 及以下。
研发节奏这块给了几个数字。从初始设计到流片九个月,AI 参与了实现方案探索、设计与验证回路以及算术电路优化。用 Codex 配 GPT-Astra,团队在两个月内把三个原本不在生产计划里的开源权重模型调到了高性能。在选定的 GPT-OSS 注意力和专家混合模块上,AI 生成的实现比人类专家手写的快 1.5 到 1.8 倍,原文明确限定这个倍数只适用于选定模块,不代表整个模型。
这些数据全部来自 OpenAI 自测,没有第三方复跑,原文也没披露制程、封装和内存规格。