Google 於美國時間 8 月 13 日(台灣時間 14 日)發表 Gemini 3.7 Flash,距離上一版 3.6 Flash 推出僅隔三週,官方將它定位為「歷來最聰明的工作馬模型」,鎖定編碼與 AI 代理(能自主執行多步驟任務的 AI)工作。
這款模型以截至 2026 年 12 月 31 日的促銷價供應(標準定價的一半),約為 OpenAI 主力模型 GPT-5.6 Terra 定價的三分之一;官方公布的編碼評測顯示兩者互有勝負,第三方評測機構 Artificial Analysis 的綜合智慧指數則只落後 GPT-5.6 Terra 一分,完成單一任務的速度快 40%。當企業客戶越來越在意 AI 帳單,這場發表的主角與其說是能力,不如說是價格。
Google 執行長皮蔡(Sundar Pichai)在 X 發文表示,Flash 系列是 Google 的「工作馬」(workhorse),白話說就是負責消化大量日常任務的主力模型:「提供高性能與絕佳價格,因此我們快速推出更新,將它們交到開發者手中。」這已是 Google 三個月內第三次更新主力 Flash 型號(從 3.5、3.6 到 3.7),還不含同期的 Flash-Lite、Flash Cyber 等衍生版本。
依官方公布的測試成績,衡量產品級程式碼生成能力的 FrontierCode 1.1 Main,得分從上一版的 34.4% 提升到 43.6%;軟體工程實測 DeepSWE v1.1 更從 49.0% 跳升至 65.3%。
對上 GPT-5.6 Terra,官方對照表則顯示互有勝負:Gemini 3.7 Flash 在 FrontierCode 1.1 Main(43.6% 對 41.3%)與網頁開發測試 Code Arena(Elo 1588 對 1523)領先,在長程軟體工程 DeepSWE v1.1(65.3% 對 69.6%)與終端機代理測試 Terminal-bench 2.1(85.8% 對 87.4%)則落後。
開發者可透過 Gemini API、Google AI Studio 等管道取用;個人用戶方面,Google AI Pro 與 Ultra 訂閱者專屬的個人 AI 代理服務 Gemini Spark,自 8 月 13 日起改用 3.7 Flash,但該服務尚未開放歐洲經濟區、英國、瑞士與奈及利亞。
綜合智慧只差一分、速度快 40%:第三方實測數據
Artificial Analysis 在 X 公布發布前實測:Gemini 3.7 Flash 在高推理模式下的綜合智慧指數(涵蓋代理、編碼、知識工作等多類任務的總和評分)拿下 56 分,比 3.6 Flash 提升 4 分,僅次於並列 57 分的 GPT-5.6 Terra 與 Meta 的 Muse Spark 1.2。
速度是它最突出的優勢。 該機構指出,Gemini 3.7 Flash 每秒可輸出約 340 個 token(模型計算文字量的單位),幾乎是 GPT-5.6 Terra 的 3 倍;換算成實際工作情境,完成測試中單一任務平均只要 1.7 分鐘,比 GPT-5.6 Terra 快 40%。以促銷價計算,每項任務成本約 0.4 美元,比 3.6 Flash 便宜 30%。
在兩項測試中,這款平價模型甚至擊敗各家旗艦:試算表與文件問答測試 AA-AnalystAgent 拿下 60%,領先 Anthropic 的 Claude Opus 5(53.8%);模擬企業軟體環境的代理測試 AutomationBench-AA 也以 62.7% 居首,領先第二名的 Kimi K3(52.7%)。
價格差距則更直觀。截至 2026 年 12 月 31 日,Gemini 3.7 Flash 促銷價為每百萬 token 輸入 0.75 美元、輸出 3.75 美元;對比 OpenAI 於 7 月 30 日調降後的 GPT-5.6 Terra 定價(輸入 2 美元、輸出 12 美元),輸入為對手的 37.5%、輸出為 31.25%。2027 年 1 月 1 日起恢復標準定價(輸入 1.5 美元、輸出 7.5 美元)後,則為對手的 75% 與 62.5%,價差明顯縮小。
當價格變成最重要的 benchmark
科技研究機構 Constellation Research 旗下 Constellation Insights 總編輯 Larry Dignan 在評論中直言,大型語言模型最有價值的基準測試(benchmark)正快速變成價格:「我們大可繼續比較其他基準測試,但誰在乎呢?Gemini 3.7 Flash 會夠好用。」 他觀察,token 成本已是各企業財報電話會議上反覆出現的關鍵字,沒有一家企業不在緊盯 AI 預算。
同篇文章中,Dignan 也引述 Palantir 執行長艾力克斯.卡普(Alex Karp)對當今前沿模型收費模式的觀點:「這套 token 收費模式對 AI 實驗室或許行得通,但對其他所有人都行不通。它正在打破企業預算,卻拿不出足以合理化開支的成果。」
值得注意的是,就在 Google 降價的同一週,以低價聞名的 DeepSeek 反其道而行。《彭博》報導,DeepSeek 自 8 月 16 日起實施尖峰時段動態定價,最先進的 V4-Pro 模型尖峰時段輸出價格從每百萬 token 0.87 美元調高至 3.96 美元,約為原先的 4.6 倍(漲幅約 355%);DeepSeek 官方說法是為了「更合理地分配資源」,鼓勵開發者把工作移往離峰時段,且調漲後價格仍遠低於美國對手。
企業支出管理平台 Ramp 的 8 月報告則提供另一個註腳:在其 token 支出管理產品觀測到、樣本較偏科技業的企業客戶中,Anthropic 性能最強、也最貴的旗艦模型 Fable 5 上市一個月,僅占受觀測 Anthropic token 採購量的 6%,顯示這群企業為「更聰明」多付錢的意願有明確上限。
資料來源:Google 官方公告、Gemini Flash 官方頁、Gemini API 定價、Sundar Pichai X 發文、Artificial Analysis X 發文、AA-AnalystAgent 榜單、AutomationBench-AA 榜單、OpenAI GPT-5.6 Terra 模型頁、OpenAI API 更新日誌、Constellation Research、《彭博》、Ramp AI Index
本文初稿為AI編撰,整理.編輯/ 李先泰
