OpenAI 自研推理芯片 Jalapeño 首秀:DeepSeek R1 每瓦吞吐量据称达 GB300 的 1.7 倍
据 IT之家 8 月 26 日消息,OpenAI 于 8 月 25 日发布博文,展示了其首款自研 AI 推理芯片 Jalapeño 的性能表现。OpenAI 称,在基于公共基准工具 InferenceX 的测试中,Jalapeño 面向大语言模型推理任务时,无论是单用户 token 处理能力,还是按功耗计算的吞吐效率,都超过了当前市面上的部分顶级推理系统。测试对比对象包括英伟达 GB200 与 GB300 系统,涉及 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三款模型。
来源显示,Jalapeño 在不同模型上的每瓦 AI 吞吐量约为对比系统的 1.5 至 1.9 倍,端到端延迟约为对比系统的 28% 至 59%。其中,在运行 GPT-OSS 120B 时,Jalapeño 的每千瓦峰值吞吐量约为 GB200 系统的 1.9 倍;在 DeepSeek R1 上,其每瓦性能约为 GB300 的 1.7 倍;在 Kimi K2.5 上,每瓦性能约为 GB300 的 1.5 倍。OpenAI 还表示,Jalapeño 额定功率为 700 瓦,但测试工作负载期间持续功耗保持在 550 瓦或以下。
Jalapeño 的定位:不是训练芯片,而是面向推理成本优化
Jalapeño 是 OpenAI 首款自研 AI 推理芯片,由 OpenAI 与博通合作开发,并由台积电采用 3nm 制程代工制造。该芯片是一颗 ASIC,也就是专用集成电路,采用脉动阵列架构,并配备 HBM 高带宽内存。与面向通用计算和训练任务的 GPU 不同,Jalapeño 的目标更集中:服务大语言模型推理场景,提升 token 生成效率并降低单位算力成本。
这一定位也解释了 OpenAI 为什么强调“每瓦吞吐量”和“端到端延迟”。对于 ChatGPT 这类高并发 AI 服务而言,模型训练固然重要,但长期运营成本主要来自海量用户请求下的推理负载。如果同等功耗下能处理更多 token,或在相近吞吐下显著降低延迟,就意味着数据中心电力、散热和硬件投入都有潜在优化空间。
- 测试工具:SemiAnalysis 开发的公共基准测试工具 InferenceX。
- 测试模型:GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T。
- 对比系统:英伟达 GB200 与 GB300。
- 芯片用途:仅用于 OpenAI 内部推理任务,不对外销售。
- 部署节奏:OpenAI 计划在 2026 年年底前小规模部署,2027 年逐步扩大规模。
从 GPU 依赖到自研 ASIC,OpenAI 正在重塑算力供应链
过去几年,大模型公司对高端 GPU 的依赖持续加深,英伟达也因此成为 AI 基础设施领域的关键供应商。OpenAI 推出 Jalapeño,并不意味着立刻摆脱 GPU 生态,而是显示出头部 AI 公司正在尝试用自研 ASIC 分担部分推理压力。尤其是在模型调用量不断增长的背景下,专用芯片有机会在固定模型结构、固定推理流程和大规模部署中获得效率优势。
来源提到,Jalapeño 及配套服务器系统不会对外销售,仅供 OpenAI 内部使用,目标是降低 GPU 采购和算力运营成本。这一点值得关注:OpenAI 并不是要成为芯片厂商,而是将芯片作为 AI 服务基础设施的一部分。当模型、推理框架、数据中心调度与芯片设计可以协同优化时,AI 服务商可能获得传统采购模式难以实现的效率提升。
仍需谨慎看待:基准测试不等于全面替代
虽然 Jalapeño 的首秀数据亮眼,但仍需注意几个限制。首先,本次测试对比的是 GB200 和 GB300 系统,尚未与英伟达最新一代 Vera Rubin 芯片进行对比。其次,公开基准测试能够展示特定模型与特定工作负载下的效率,但真实生产环境还涉及模型版本变化、并发请求形态、内存容量、网络互联、稳定性和软件生态等因素。
此外,OpenAI 也表示英伟达仍是其重要合作伙伴,未来会继续采用多供应商策略来满足庞大的算力需求。因此,Jalapeño 更像是 OpenAI 算力版图中的一块新拼图,而不是对现有 GPU 体系的直接替代。对于中文读者和国内 AI 行业而言,这一进展的核心信号在于:大模型竞争正从模型参数和产品体验,进一步延伸到芯片、系统和能源效率层面。谁能以更低成本稳定提供高质量推理服务,谁就可能在下一阶段 AI 应用普及中占据更有利位置。