Google 於美國時間 9 月 2 日(台灣時間 9 月 3 日)宣布推出新一代語言模型 Gemini 3.8 Flash,以及鎖定資安防禦用途的限量版本 3.8 Flash Cyber。這是 Google 在短短六週內第三度發布 Flash 系列模型(上一代 3.7 Flash 於 8 月 13 日上線)。
3.8 Flash 在軟體工程、金融、法律等多項專業任務測試中的表現逼近成本更高的頂尖模型;而 3.8 Flash Cyber 則透過新設的 Fairwind 計畫,優先開放給政府單位與關鍵基礎設施的資安防禦人員,官方稱其在挖掘與修補漏洞上的表現已達業界頂尖水準。
Gemini 3.8 Flash 定位為 Google「最聰明的工作馬模型」,官方表示效能較上一代 3.7 Flash 有明顯提升,速度與價格則維持不變。在 DeepSWE v1.1(一項測試 AI 能否自主完成長時間、多步驟軟體工程任務的指標)上,3.8 Flash 的表現超越多數規模更大的頂尖模型,運算成本卻只是對手的一小部分。
這款模型也跨進金融與法律等專業領域,在 Vals Finance Agent V2(模擬金融分析與報告任務的測試)與 Harvey's Legal Agent Benchmark(模擬法律事務所任務的測試)上,3.8 Flash 的成績優於 3.7 Flash 與其他頂尖模型;在涵蓋理工、人文與專業領域的高難度多步驟推理測驗 HLE-Verified 中,則拿下 54.9% 的成績。
Google 解釋,這些進步的關鍵在於模型「更願意多做一點」,遇到複雜任務時會自動多花幾個步驟推理、反覆呼叫工具驗證,可能因此耗費更多 token,官方仍保留 3.7 Flash 供在意成本的開發者選擇。
定價方面,3.8 Flash 維持與 3.7 Flash 相同的優惠價:每百萬輸入 token 0.75 美元(約合新台幣 23.8 元)、輸出 token 3.75 美元(約合新台幣 119 元),優惠期至 2026 年 12 月 31 日止。2027 年 1 月 1 日起,價格將調整為每百萬輸入 1.50 美元(約合新台幣 47.6 元)、輸出 7.50 美元(約合新台幣 238 元),等於整整漲了一倍。
這款模型僅開放 Google AI Pro 與 Ultra 訂閱者於 Gemini App、Google 搜尋 AI 模式及 Google 試算表使用,開發者則可透過 Google Antigravity、AI Studio 與 Gemini API 取用。
Flash Cyber:專門幫防禦方抓漏洞、補漏洞
與 3.8 Flash 同步發表的 3.8 Flash Cyber,是取代前一代 3.5 版本的資安專用模型。在資安產業標準的漏洞挖掘測試 CyberGym 上,3.8 Flash Cyber 的自主挖掘漏洞能力超越 3.5 Flash Cyber,也贏過規模更大的頂尖模型;在另一項涵蓋 20 種程式語言、更貼近實際防禦情境的內部測試中,成功率更超過 70%,較前一代模型大幅躍進。
這款模型僅透過 Google 新設的 Fairwind 計畫,優先開放給受信任的政府機關、關鍵基礎設施營運商與軟體維護者申請使用,尚未開放給一般開發者。
Google 引用多項實測數據佐證成效,Chrome 資安團隊測得,3.8 Flash Cyber 針對 Chrome 漏洞產生的正確修補程式數量,是體型更大的最佳商用模型 2.6 倍;資安業者 Wiz 的內部滲透測試顯示,3.8 Flash Cyber 的漏洞檢出率較其他頂尖模型高出 7.5% 到 9.7%,成本卻只要對手的五分之一到二分之一。Google 雲端的漏洞研究團隊更用這款模型在不到 2 小時內,找到一項過去通常需要耗費數月才能發現的重大基礎性漏洞。
在另一項考驗「修補」能力的外部測試 CWE-Bench(由第三方機構 Collinear 維護)中,3.8 Flash Cyber 的修補成功率為 47.2%,只些微落後頂尖模型的 47.8%,但成本明顯更低。Google 也特別強調,團隊優先投資的是「修補」能力而非攻擊或滲透能力,呼應這款模型鎖定防禦用途的定位。
先設好安全圍欄,才放行更強的能力
由於 3.8 Flash Cyber 的漏洞挖掘能力若遭濫用,可能反過來被拿去攻擊系統,Google 表示一般版 3.8 Flash 具備防範化學、生物、放射性與核子(CBRN)以及網路攻擊濫用的防護機制;3.8 Flash Cyber 為了支援更完整的防禦能力,資安相關限制採取較寬鬆的設計,因此僅提供給通過審核、需要更完整資安能力的信任防禦者。
Google 另外指出,3.8 系列在抵禦提示注入攻擊(prompt injection,即被惡意指令誤導而執行非預期動作)的能力上也有明顯進步,相關成效由第三方機構 Gray Swan 測試驗證。
這是 Google 在短短六週內第三度發布 Flash 系列模型,更新速度明顯加快,也呼應 OpenAI、Anthropic 與 Meta 近期同樣密集發布新模型的競爭態勢。
資料來源:9to5Google、Google 官方部落格、中央銀行新臺幣/美元銀行間收盤匯率
本文初稿為AI編撰,整理.編輯/ 李先泰
