智能工具库

OpenAI 自研芯片 Jalapeño 首秀:实现 1.9 倍能效比

OpenAI 首款自研推理芯片 Jalapeño 发布,在 GPT-OSS 等模型上实现 1.5-1.9 倍能效比,大幅降低延迟,为智能体应用带来革命性体验。

2026-08-25 0来源:OpenAI Blog

OpenAI 自研芯片 Jalapeño 首秀:实现 1.9 倍能效比

2026 年 8 月 25 日,OpenAI 正式公布了其首款自研推理芯片 Jalapeño 的首批测试结果。作为公司“全栈优势”战略的重要落地,这款芯片在处理速度、能效比及延迟控制上均取得了突破性进展,标志着 AI 硬件开发进入了一个新阶段。

性能实测:吞吐量与延迟的双重提升

Jalapeño 的核心价值在于它打破了传统硬件在“吞吐量”和“低延迟”之间的妥协。在针对 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 等模型的测试中,Jalapeño 展现出了惊人的能效。

  • 能效比提升:在峰值吞吐量下,Jalapeño 每瓦完成的 AI 任务量是对比系统的 1.5 到 1.9 倍
  • 延迟降低:端到端延迟比对比系统降低了 1.7 到 3.6 倍
  • 交互体验:对于高度交互式的工作负载(如智能体 Agent),其性能更是达到了对比系统的 2.1 至 4.1 倍

这意味着,在相同的硬件成本下,开发者可以获得更多的 Token 生成速率,而用户也能体验到几乎实时的响应速度。

架构设计:协同设计解决推理瓶颈

传统 AI 推理系统往往面临“顾此失彼”的问题:在处理提示词的“预填充”阶段,系统计算密集;而在逐个生成 Token 的“解码”阶段,系统又受限于内存带宽。这种差异导致系统在不同阶段表现参差不齐。

Jalapeño 的独特之处在于其全栈协同设计

  1. 显式状态管理:将模型状态(如 KV 缓存)显式地保留在本地,减少了数据在计算核心和芯片之间的无效移动。
  2. 网络互联优化:通过广泛的互联范围,确保整个工作负载保持在单一系统内,最大限度减少通信延迟。
  3. 动态资源调配:能够根据预填充与解码的工作负载比例变化,灵活调整计算、内存和网络资源组合。

这种设计使得 Jalapeño 能够在智能体等复杂任务中保持高效,避免了因等待数据而导致的算力闲置。

AI 辅助开发:硬件与软件的双重革新

令人惊讶的是,Jalapeño 的开发过程本身就是 AI 驱动的。

  • AI 设计芯片:利用 AI 探索不同的电路实现方式,将原本漫长的设计迭代周期压缩到了九个月,并成功在芯片中融入了更多的计算性能。
  • AI 编程芯片:Jalapeño 被设计成一个对 AI 友好的平台。通过搭载 GPT-Astra 的 Codex,OpenAI 团队在两个月内就使三款原本不在计划内的开放权重模型实现了高性能运行。
  • 性能飞跃:针对特定模块,AI 生成的代码运行速度是人工编写方案的 1.5 到 1.8 倍

这为开发者提供了一个新的范式:未来的硬件编程不再仅仅是手写内核,而是与 AI 协作,由 AI 负责底层的调度与优化。

对开发者和使用者的实用价值

Jalapeño 的推出对 AI 生态有着深远的影响:

  • 降低成本:更高的每瓦性能意味着更低的云服务成本,这对于大规模部署 AI 服务的开发者至关重要。
  • 智能体加速:随着智能体应用(如自主编程、复杂决策)的兴起,低延迟和高吞吐是刚需。Jalapeño 使得这些应用在现有硬件上成为可能。
  • 迭代加速:AI 辅助编程能力的提升,意味着新模型或新架构能更快地适配专用硬件,缩短了产品从研发到上线的周期。

OpenAI 计划在今年年底前逐步扩大 Jalapeño 的部署规模,并已启动第二代(Gen 2)和第三代(Gen 3)芯片的研发。随着这些技术的落地,我们有望见证 AI 推理能力的进一步边界拓展。


注:本文基于 OpenAI 于 2026 年 8 月发布的官方技术报告整理。

本文基于 OpenAI Blog 的公开内容,由 AI 辅助整理改写后发布。

原标题:Jalapeño’s first results show industry-leading speed and efficiency in AI inference

阅读原文