对 OpenAI 的 Richard Ho 的访谈
文章来自 More Than Moore 对 OpenAI 的 Richard Ho 的访谈,聚焦 OpenAI 自研推理加速器 Jalapeño。核心事实:OpenAI 与 Broadcom 合作设计、Celestica 做板卡集成;该芯片为推理加速而非训练,配备 216 GiB HBM4(15.4 TB/s),单芯片峰值 700 W、实测持续功耗约 550 W;本地域 128 颗,完整系统 2048 颗,4-bit 精度下可达 27 EFLOP/s。 HotChips 2026 上给出首批实测数据:对比 NVIDIA GB200/GB300,峰值吞吐每瓦性能提升 1.5–1.9 倍,延迟改善 1.7–3.6 倍,部分操作点最高达 104 倍。 两个争议/看点:一是 OpenAI 选择单一平衡芯片覆盖整个推理负载,而行业趋势是拆分 prefill/投机解码/完整解码并用不同专用硬件;二是芯片设计过程中大量使用 OpenAI 自家模型辅助计算设计、版图适配和 kernel 优化,其中一个 attention 实现从不足 roofline 1% 提到近 90%,耗时约 40 小时。




