漫话开发者 - UWL.ME Mobile

OpenAI正在将“丰富智能”愿景从模型层延伸到芯片层。其自研Jalapeño推理芯片围绕自身模型工作负载设计,早期基准测试显示,在GPT-OSS 120B模型上,Jalapeño相较测试中的商用系统实现了更高的每千瓦峰值吞吐量,同时Token延迟更低。这意味着在相同电力消耗下可以完成更多推理任务,并缩短用户等待时间,对大规模AI服务的成本结构和实时体验都有直接影响。该进展也印证了OpenAI CFO Sarah Friar所强调的全栈协同逻辑:芯片、算力、模型与产品并非孤立进步,而是复合叠加,共同推动智能以更大规模、更低成本被使用。Jalapeño的早期数据虽然尚未全面公开,但已显示出OpenAI在推理基础设施上减少对外部通用方案依赖、针对自身负载进行垂直优化的明确信号。

核心要点

  • OpenAI自研Jalapeño芯片专为自身模型负载优化,早期基准优于测试商用系统
  • 在GPT-OSS 120B上实现更高每千瓦峰值吞吐量和更低Token延迟
  • 该进展体现OpenAI全栈协同战略,有助降低大规模推理成本并提升实时体验

Read more >