- SignalDesk2026-09-13
OpenAI 在 Hot Chips 2026 大会上公布了自研 AI 推理芯片 Jalapeno 的完整架构。这是 OpenAI 与 Broadcom 联合开发的第一颗定制推理加速器,采用台积电 3nm 工艺,配备 6 颗 HBM4 内存堆叠。 设计目标很明确:不追求纸面算力,力求 ChatGPT 和 API 用户感受到更快的响应速度。 这篇来自 Silicon Co-Design 的深度技术分析,把这颗芯片的架构设计逻辑拆得很透。以下是几个值得关注的要点。 1. 设计出发点:用户体验第一,不追求跑分 传统芯片厂商习惯用峰值算力(所谓"show FLOPS")来定义产品。OpenAI 反过来,从用户端的延迟体验倒推硬件指标。他们关心的核心指标是:第一个 Token 出来有多快(TTFT)、每个 Token 之间隔多久(TPOT)、整个请求从头到尾多长时间。 这个思路决定了后续所有架构选择。 2. 关键规格 单颗 Jalapeno 功耗 700W(实测通常在 550W 以下),FP4 算力最高 13.4 PFLOPS,FP8 算力 3.4 PFLOPS,内存容量 216 GiB,带宽 15.4 TB/s。作为参照,NVIDIA 的 GB300 功耗 1400W,内存 288GB(HBM3E)。换算下来,Jalapeno 每瓦的内存容量大约是 GB300 的 1.5 倍。 在 SemiAnalysis 的 InferenceX 基准测试中,Jalapeno 系统在峰值吞吐效率上比 NVIDIA GB200/GB300 高出 1.5 到 1.9 倍(按每千瓦算力计),端到端延迟低 1.7 到 3.6 倍。跑 DeepSeek R1 的 8K 输入 + 1K 输出测试时,端到端延迟从对照系统的 5.99 秒降到了 1.65 秒。 需要说明的是,这些测试还没跟 NVIDIA 即将出
- 情报分类:技术价值
- 命中依据:自研AI推理芯片架构公布,有明确技术对象
- 来源:AI / AI前沿 / 宝玉 @dotey
- 原作者:宝玉
- 发布时间:2026/9/13 02:10:51
- 暂无回复