Google在美國時間9月30日(台灣時間10月1日)發表新一代旗艦模型Gemini 4 Argon,距離上一代Gemini 3將近一年,也是Google DeepMind超過7個月來第一款比輕量Flash系列更高階的模型。
獨立評測機構Artificial Analysis的綜合智力指數顯示,Argon拿下53分,與OpenAI的GPT-6 Astra並列,以這項指數衡量,Google重回AI實驗室前三強。不過,Argon截至10月1日只開放給少數資安合作夥伴試用,《Bloomberg》也引述知情人士報導,部分Google員工認為它實際寫程式的表現不如跑分亮眼。
3.5 Pro跳票之後,Argon是什麼來頭?
Argon來得比預期晚。Google在5月的I/O開發者大會預告Gemini 3.5 Pro、承諾隔月推出,最後卻沒有發表;《Bloomberg》引述知情人士指出,Google已放棄3.5 Pro。事實上,這段空窗期Google確實只持續推出更小、更便宜的Flash模型,反觀OpenAI與Anthropic則一路往前衝。
Google DeepMind負責人Koray Kavukcuoglu具名發布的官方部落格文章指出,Argon專為長時間、多步驟的複雜任務打造,主攻軟體工程、法律與金融等企業知識工作,以及資安防禦。Google DeepMind的Gemini產品負責人Tulsee Doshi接受《Axios》採訪時表示:「Argon是一款全方位的模型,在多個領域都具備最前沿的能力。」
最直觀的變化是輸出長度的上限。AI模型處理文字的基本單位稱為token,Argon的輸出上限從前代的6.4萬個token拉高到100萬個,換算約為75萬個英文單字。Google的說法是,模型有足夠空間深入推理,才能一次解開困難問題。實際使用時,這麼長的回應要靠Gemini API新功能Long Decode Continuation,把長回應暫停、再透過後續呼叫接續下去,Artificial Analysis測試時就是這樣做,以避免請求逾時。
Google內部已大量使用Argon。以Google開源的影片解碼軟體libgav1為例,Google讓多個Argon分頭作業,接手一個既有的Rust(一種較能避免記憶體漏洞的程式語言)版本,把其中3.2萬行針對處理器加速的程式碼(SIMD)改寫成安全的Rust寫法,最後產出的解碼器比原本的Rust版快2.7倍,輸出畫面完全一致。
開放節奏則相當保守。Argon第一階段只透過Fairwind計畫開放給一群受信任的資安防禦者,Google也參與美國政府的自願性機制,讓政府在模型公開前先取得使用權限。等測試回饋到位、防護機制調整完成,才會擴大開放給開發者、企業與消費者,首批是付費API客戶與Google AI Ultra訂閱用戶,Google並未公布具體時程。
跑分追上了,價格優勢卻是打折換來的
根據Artificial Analysis的測試,Argon在最高推理強度下的綜合智力指數為53分,與GPT-6 Astra並列,略高於OpenAI另一款GPT-6.1 Sol(52分);相較Google上一款非Flash等級的模型Gemini 3.1 Pro Preview(30分),一口氣大進23分。
進步主要來自兩處。第一是代理能力,也就是讓AI自己拆解步驟、操作工具完成任務,這向來是Gemini的弱項。Argon在Artificial Analysis版的自動化測試AutomationBench-AA拿下77.5%,排名第一,領先Anthropic的Claude Sonnet 5.5約6個百分點;在測試命令列操作能力的Terminal Bench 4拿到57%,僅次於Claude Sonnet 5.5、Claude Opus 5.5與GPT-6 Astra。
第二是幻覺率。在AA-Omniscience知識測試中,Argon的幻覺率為15%,是綜合指數45分以上模型中最低,GPT-6 Astra則為51%。換言之,Argon遇到不知道的問題,比較會老實承認,而不是硬猜,但代價是答對率只有50%,低於GPT-6 Astra的63%。
Google自家公布的成績則包括:測試長時間軟體工程任務的DeepSWE v1.1拿下77.9%,創下最佳成績;測試資安漏洞修補能力的CWE-bench v1以68%並列第一。
價格是另一個賣點,但要看清楚條件。Argon首發優惠價為每100萬個輸入token 2美元(約新台幣64元)、輸出token 10美元(約新台幣319元),是原價4美元(約新台幣127元)與20美元(約新台幣637元)的五折,Google未公布優惠期限。
Artificial Analysis推算,在首發五折、加上快取折扣提高到95%(重複送入模型的內容大幅打折)的條件下,Argon完成一項綜合指數測試任務平均花1.99美元(約新台幣63元),只要GPT-6 Astra(3.26美元,約新台幣104元)的6成。
不過,較低的測試任務成本主要來自優惠定價與快取折扣,並非更省token。 在這項測試中,Argon每項任務平均輸出6.2萬個token,是GPT-6 Astra(2.7萬個)的兩倍多;一旦優惠結束,每項任務成本會升到3.98美元(約新台幣127元),約為GPT-6 Astra的1.2倍。
內部雜音:分數漂亮,實戰寫程式卻未必
發表當天,《Bloomberg》引述多名直接接觸開發的知情人士報導,Gemini 4在業界常用的基準測試上表現亮眼,但員工實際拿來工作時表現較差,處理某些寫程式任務有困難;其中一人指出,Argon不太擅長決定App與網站外觀的前端設計。
報導也點名業界常見的「刷榜」(benchmaxxing)現象,指的是工程師把心力放在拿高分,而不是做出真正好用的產品,兩名知情人士認為Gemini 4似乎受此影響。AI新創Surge AI創辦人Edwin Chen比喻:「就像說『我家小孩SAT(美國大學入學考試)考得很好』,但SAT成績並不等於現實世界的表現。」
Google內部看法並不一致。部分員工認為Anthropic的Fable與OpenAI的Astra進步速度比Gemini更快,Gemini 4即使在最佳狀態,某些面向仍會落後;也有員工認為新模型已追上領先實驗室。
延伸閱讀:Google AI掌門換人!13年老將接棒哈薩比斯:Koray Kavukcuoglu是誰?如何搶救Gemini劣勢?
資料來源:Google官方公告、《Axios》、《Bloomberg》、Artificial Analysis評測、Artificial Analysis X貼文、鉅亨網匯率
本文初稿為AI編撰,整理.編輯/ 李先泰
