OpenAI 於 2026 年 8 月 25 日公布自研推論晶片 Jalapeño 的首波實測。對照領先的商用 AI 系統,每瓦吞吐量(同樣一度電能完成多少工作)最高約 1.9 倍,端到端延遲(從提問到拿到完整答案要等多久)最高約降 3.6 倍。
官方測了三個開放權重模型,數字都是區間:每瓦吞吐量約 1.5 至 1.9 倍,延遲約降 1.7 至 3.6 倍。1.9 倍與 3.6 倍是兩項各自最好的成績,來自不同模型,不是同一個模型同時達到。
2026 年 6 月 24 日,OpenAI 與博通 (Broadcom) 聯合揭曉 Jalapeño,其為 OpenAI 第一顆自研推論晶片,由 OpenAI 從零設計,博通負責矽實作與聯網(公告點名包含交換器產品線 Tomahawk),板卡與機櫃則交給 Celestica。
博通當時指出,Jalapeño 從設計到 tape-out 約 9 個月,過程還用了 OpenAI 自家模型加速。換言之,這不是把舊加速器修修改改端出來,而是一條全新路線的第一代,鎖定的目標就是 LLM 推論。
實測數據該如何理解?
這次公布的數字,測的是三個開放權重模型:GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T,用 SemiAnalysis 的公開測試套件 InferenceX 跑分,量的是使用者從送出問題到拿到完整答案的整段過程,比晶片規格表上的紙面數字更貼近實際使用情境。
SemiAnalysis 這次是派人到 OpenAI 實驗室現場核對測試過程,不只是引用官方數字,但也提到測的只是 8k1k(輸入 8,000 字、輸出 1,000 字)這種相對單純的工作負載,還沒有跑更接近真實多輪長對話場景的 AgentX 測試。
官方給出三組區間:峰值每瓦吞吐量 1.5 至 1.9 倍、端到端延遲約降 1.7 至 3.6 倍、互動負載則是 2.1 至 4.1 倍。這三組都是區間,讀的時候要注意 1.9 倍與 3.6 倍分別來自不同模型的測試結果,屬於兩項各自最好的成績,並非同一次測試同時達成。
針對OpenAI釋出的比較數據,正文只籠統寫「領先的商用 AI 系統」,但真正講清楚要翻到附錄,才知道 GPT-OSS 120B 比的是 NVIDIA GB200,DeepSeek R1 與 Kimi K2.5 比的則是 GB300。
而 SemiAnalysis 對這個對照組提出保留,指出GB200、GB300 是輝達已經量產的上一代,比較公平的對手應該是同樣採用 HBM4 記憶體的新世代 Rubin,畢竟 Rubin 已經開始出貨給客戶,Jalapeño 卻還停在工程樣品階段。
SemiAnalysis 另外拿 7 月輝達與 CoreWeave 公布的 Rubin 實測重新比較,算出 Jalapeño 每瓦效能仍勝過 Rubin,但成本效益(每美元輸出量)大致打平;差距的一大原因是這次 Jalapeño 測試還沒用上推測解碼(speculative decoding)等加速技巧,這項技巧通常能把每個 token 的成本再壓低 3 到 5 倍。
其中 GPT-OSS 的每瓦吞吐量成績(1.5 至 1.8 倍),官方數字旁特別標注這算的是模型裡的其中一個區塊,而非整個模型的表現。
功耗方面,Jalapeño 額定功耗 700W,官方寫實測時持續功耗控制在 550W 以內。OpenAI 也提到,團隊用 Codex 搭配 GPT-Astra,花了約兩個月把這三個開放權重模型調校到高效能狀態,才拿出這批成績。
OpenAI 強調,這套架構設計上要同時兼顧吞吐量與延遲,不像既有系統常得在兩者間取捨,這是官方對架構設計理念的說法。
SemiAnalysis 則從另一個角度解讀這次的領先,他們認為關鍵不在硬體規格真的贏過輝達,而是 OpenAI 軟體團隊調校晶片的速度比輝達快,這才是自研晶片能在短時間內衝出好成績的主因。
Jalapeño佈署還有一段路
OpenAI 規劃 2026 年底把 Jalapeño 導入自家基礎設施,這仍屬內部佈署,還沒有對客戶出貨的時間表。6 月揭曉時,工程樣品就已在實驗室跑工作負載,8 月 25 日這批數字,等於是把當時的實測結果公開。
後續訓練與推論仍會並用輝達等夥伴的產能,Jalapeño 作為多世代路線的第一代,官方並未宣布它會成為唯一的推論後端;年底進駐自家機房之後,外部供應鏈要怎麼切,官方還沒有更細的產能數字。
延伸閱讀:Grok Bot新手教學!4步驟建「AI代理一人公司」:月費60美元值得嗎?幕僚團隊如何設定?
資料來源:OpenAI、博通 IR、《The Register》、SemiAnalysis
本文初稿為AI編撰,整理.編輯/ 李先泰
