OpenAI自研Jalapeño推理芯片早期基准曝光:GPT-OSS 120B每瓦吞吐更高、Token延迟更低
thinkindev • 2026-08-26
1738 views
OpenAI正在将“丰富智能”愿景从模型层延伸到芯片层。其自研Jalapeño推理芯片围绕自身模型工作负载设计,早期基准测试显示,在GPT-OSS 120B模型上,Jalapeño相较测试中的商用系统实现了更高的每千瓦峰值吞吐量,同时Token延迟更低。这意味着在相同电力消耗下可以完成更多推理任务,并缩短用户等待时间,对大规模AI服务的成本结构和实时体验都有直接影响。该进展也印证了OpenAI CFO Sarah Friar所强调的全栈协同逻辑:芯片、算力、模型与产品并非孤立进步,而是复合叠加,共同推动智能以更大规模、更低成本被使用。Jalapeño的早期数据虽然尚未全面公开,但已显示出OpenAI在推理基础设施上减少对外部通用方案依赖、针对自身负载进行垂直优化的明确信号。
核心要点
- OpenAI自研Jalapeño芯片专为自身模型负载优化,早期基准优于测试商用系统
- 在GPT-OSS 120B上实现更高每千瓦峰值吞吐量和更低Token延迟
- 该进展体现OpenAI全栈协同战略,有助降低大规模推理成本并提升实时体验