OpenAI 近日公布其首款自研 AI 推理晶片「Jalapeño」的首批基準測試結果。官方表示,Jalapeño 在吞吐量、能源效率與延遲三方面均取得更佳組合,並強調「每單位功率的效能」才是衡量推理晶片的重要標準,而非單看每顆晶片的絕對數字。[1]
測試結果重點
Jalapeño 由 OpenAI 與 Broadcom 合作開發,專為大規模 LLM 推理而設。OpenAI 於官方公布中表示,新晶片能以同一架構同時提供更高的吞吐量與更低的延遲——即「同一時間服務更多 AI 工作量,同時回應更快」。[1]
據媒體分析,SemiAnalysis 公開的 InferenceX 基準測試顯示,Jalapeño 在每千瓦吞吐量上較現有頂級推理處理器高出約 1.5 至 1.9 倍,端到端延遲低約 1.7 至 3.6 倍;對比的 Nvidia 機架系統功耗達 1,400 瓦,而 Jalapeño 僅 700 瓦。另有分析指,該比較並非完全對等,因為 Jalapeño 採用較新的 HBM4 記憶體,而受測 Nvidia 晶片屬較舊世代。
設計理念:以每瓦效能為準
OpenAI 在官方公布中特別指出,推理效能若按每顆晶片計算,容易忽略功耗與成本;「每單位功率的效能」才是部署大規模推理基建時真正重要的指標。[1] 這背後反映的邏輯十分直接:數據中心擴充時,瓶頸往往在於電力與散熱,而非晶片數量。
對晶片市場的意義
Jalapeño 的出現,是「超大型數據中心營運商自研晶片」趨勢的最新一例。OpenAI、Google、Amazon、Anthropic 等閉源 AI 實驗室均在自研晶片,以減輕對 Nvidia 的依賴;分析普遍認為,推理正是目前增長最快的市場,若自研晶片在推理效率上持續領先,將直接衝擊 Nvidia 增長最快的推理業務利潤。
OpenAI 早前表示,Jalapeño 將於今年底部署於其自家算力基建,第二、三代已在開發中。
參考資料
[1] OpenAI — Jalapeño’s first results show industry-leading speed and efficiency in AI inference