輝達 (NVIDIA) 8 月 24 日宣布,機架級 AI 推論加速系統 Groq 3 LPX 正式進入全面量產。第三方測試機構 Artificial Analysis 的實測數據顯示,Groq 3 LPX 以 FP8 精度執行開源模型 Gemma 4 31B、在 10 萬 token 的輸入上下文下,跑出每秒 3,400 個輸出 token 的成績,創下該模型當時的最快紀錄;輝達表示,這項成績較最接近的競爭平台快 4 倍。
目前首家宣布採用的 AI 雲端業者是 Nebius,計畫將 Groq 3 LPX 導入自家 Token Factory 推論平台。
Nebius 技術長 Danila Shtan 表示:「生成才是真正決定 AI 系統回應速度的推論階段,而這正是 Groq 3 LPX 設計用來加速的環節。」他並提到,Nebius 希望確保 AI 代理每一輪互動都感覺是即時的,而且開發者不需更換 API、也不必搬遷到新架構。
輝達創辦人暨執行長黃仁勳 (Jensen Huang) 則指出,推論已成為驅動 AI 成長最主要的力量,Groq 3 LPX「再一次在 AI 吞吐量、效率與反應速度上寫下巨大突破」。
一顆掛著 Groq 招牌的輝達晶片,從何而來
Groq 3 LPX 之所以掛著「Groq」的名字,源自輝達 2025 年 12 月與 Groq 達成的技術授權協議。
根據 Groq 官方公告及輝達 SEC 申報文件,輝達當時以非獨家授權方式取得 Groq 的 LPU(Language Processing Unit,一種專門加速文字生成的處理器架構)相關技術,並延攬 Groq 創辦人 Jonathan Ross、總裁 Sunny Madra 及其他核心成員加入輝達,但並未購買 Groq 公司股權、既有產品或客戶合約。Groq 公司本身仍獨立運營,GroqCloud 業務照常,現任執行長為 Adam Winter。
這筆交易的總對價,輝達 2026 財年 10-K 申報文件顯示約 170 億美元,其中 130 億美元於交割時支付,另 40 億美元(含估算利息)於一年內支付;先前媒體慣用的「約 200 億美元」,僅是外部估計數字,並非輝達正式揭露的交易對價。
AI 推論運算可拆成兩階段:先讀懂輸入內容的「prefill(預填)」,以及逐字產生回應的「decode(解碼)」。Groq 的 LPU 架構鎖定加速「解碼」這一段,正是使用者等待 AI 逐字吐出回應時感受最直接的環節;輝達將這套技術延伸應用到自家 Vera Rubin NVL72 平台,一座 Groq 3 LPX 機架最多可容納 256 顆 Groq 3 LPU 處理器,打造出這套推論系統。
效能數字之外,還有哪些保留
《The Register》分析指出,Groq 3 LPX 這項每秒 3,400 個 token 的成績需要動用多少顆 Groq 3 LPU,輝達並未公開實際測試配置;該媒體依晶片內建 SRAM 容量自行估算,認為至少需要 64 顆。
《The Register》也提到,Gemma 4 31B 的模型權重本身,用 1 到 2 顆 Cerebras CS-3 系統就能完整容納,但這不代表 Cerebras 用 1 到 2 顆晶片就能跑出與 Groq 3 LPX 相近的效能。
同一測試條件下,Cerebras 的實測成績約為每秒 882 個 token,低於 Groq 3 LPX 的 3,400 個 token;兩者在更大規模 MoE(混合專家架構)模型上的表現,以及背後真正的晶片成本效益,公開資料仍不足以完整比較。
資料來源:輝達官方公告、輝達部落格:Nebius 採用與產品定位、《The Register》、《SiliconANGLE》、輝達 2026 年度 10-K 申報、Groq 官方公告、Groq 公司與管理團隊、台灣銀行牌告匯率
本文初稿為AI編撰,整理.編輯/ 李先泰
