用 AI 设计 AI 芯片:OpenAI「辣椒芯」凭什么跑赢英伟达?
OpenAI 造芯片这件事,终于从传闻变成了现实。8 月 25 日,OpenAI 在斯坦福举行的 Hot Chips 2026 大会上,公布了首款自研 AI 推理芯片 Jalape?o(墨西哥辣椒) 的首批实测数据。结果一出,震动整个芯片圈——在多个关键指标上,它跑赢了英伟达的旗舰系统。OpenAI CEO 山姆·奥特曼只发了很短的感言:「我们造了一颗芯片,快得离谱。」
Jalape?o 是 OpenAI 与博通(Broadcom)联合打造的首款自研芯片,专为大语言模型推理而设计(不用于训练)。从立项到流片,只用了约 9-16 个月——在芯片行业,这是数得上号的最快纪录之一。
它的硬件规格相当豪华:台积电 N3P 工艺,216GiB 的 HBM4 内存,内存带宽高达 15.4TB/s(接近英伟达 GB300 的两倍),标称功耗只有 700W。
数据有多夸张?对照英伟达看看
测试采用半导体研究机构 SemiAnalysis 的公开基准套件 InferenceX,在 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 三个开源大模型上运行,对标英伟达 GB200/GB300 旗舰系统。核心结果:
——每瓦吞吐量:是英伟达系统的 1.5~1.9 倍
——端到端延迟:降低 1.7~3.6 倍
——单用户峰值速度:GPT-OSS 上达 1459 token/秒(英伟达 GB200 为 535),DeepSeek R1 上约 700 token/秒(GB300 为 169)
——极限场景:在特定等速解码下,每千瓦吞吐最高达到 GB300 的 104.3 倍
—— 功耗:实测持续功耗 ≤550W,而 GB200/GB300 为 1200W/1400W——几乎只有英伟达的一半
SemiAnalysis 的评价相当罕见:「第一代芯片通常毫无竞争力,但 Jalape?o 击败了我们测试过的每一款英伟达、AMD 和谷歌芯片。」
性能之外,Jalape?o 还有一个更耐人寻味的看点——OpenAI 用了自家 AI 来设计芯片。
OpenAI 的 Codex 模型(基于 GPT-6)参与了芯片内核的编写,用 Glooper 语言生成的部分内核,性能比人类工程师写的还快 1.5~1.8 倍。也就是说,这颗打败英伟达的芯片,一部分功劳要记在 AI 自己头上。
「AI 造芯」不再是科幻——当 AI 开始帮人类设计下一代 AI 芯片,这个循环一旦跑起来,速度只会越来越快。
以上对比冷静下来看有三点:
第一,对比并不完全公平。 SemiAnalysis 坦言,拿 Blackwell 系列做对手有点「田忌赛马」,Jalape?o 真正的对手应该是英伟达同样采用 HBM4 的下一代 Vera Rubin——它已经量产、正在出货,却没被放进测试。而且测试时英伟达开了多 token 预测优化,若按此对比,峰值能效优势会缩到约 1.5 倍;「104.3 倍」也只是特定场景的单一数据点。
第二,跑分由 OpenAI 自己提供。 SemiAnalysis 现场验证了过程,但并未跑完整套测试,也没测更接近真实负载的长上下文多轮 Agent 基准。
第三,OpenAI 明确表示不会弃用英伟达。 这颗芯片只管推理,训练仍然大量依赖英伟达 GPU。英伟达此前还同意为 OpenAI 的数据中心提供最高 1050 亿美元的融资支持。两者是「既合作又竞争」的关系。
Jalape?o 目前处于工程样品阶段,计划 2026 年底逐步部署到 OpenAI 的自有算力集群,第二代芯片已深度开发,第三代已初具雏形。它瞄准的方向也很明确:让 ChatGPT 更快、更便宜。
这件事的真正意义,或许不在「一颗芯片打败英伟达」——毕竟测试口径还有争议。而在于:AI 公司开始自己造芯片了,而且用 AI 造 AI 芯片。 谷歌、亚马逊、Meta 都已经在走这条路。
当推理芯片从英伟达「一家独大」走向「群雄逐鹿」,受益的会是所有用 AI 的人——更快的响应,更低的价格。而这,也许才是「辣椒芯片」带给我们最大的价值。
