遲到一年的逆襲?Google躍級發布Gemini 4 Argon:綜合智力重回前三,為何實戰能力被打問號?
遲到一年的逆襲?Google躍級發布Gemini 4 Argon:綜合智力重回前三,為何實戰能力被打問號?

Google在美國時間9月30日(台灣時間10月1日)發表新一代旗艦模型Gemini 4 Argon,距離上一代Gemini 3將近一年,也是Google DeepMind超過7個月來第一款比輕量Flash系列更高階的模型。

獨立評測機構Artificial Analysis的綜合智力指數顯示,Argon拿下53分,與OpenAI的GPT-6 Astra並列,以這項指數衡量,Google重回AI實驗室前三強。不過,Argon截至10月1日只開放給少數資安合作夥伴試用,《Bloomberg》也引述知情人士報導,部分Google員工認為它實際寫程式的表現不如跑分亮眼。

3.5 Pro跳票之後,Argon是什麼來頭?

Argon來得比預期晚。Google在5月的I/O開發者大會預告Gemini 3.5 Pro、承諾隔月推出,最後卻沒有發表;《Bloomberg》引述知情人士指出,Google已放棄3.5 Pro。事實上,這段空窗期Google確實只持續推出更小、更便宜的Flash模型,反觀OpenAI與Anthropic則一路往前衝。

Google DeepMind負責人Koray Kavukcuoglu具名發布的官方部落格文章指出,Argon專為長時間、多步驟的複雜任務打造,主攻軟體工程、法律與金融等企業知識工作,以及資安防禦。Google DeepMind的Gemini產品負責人Tulsee Doshi接受《Axios》採訪時表示:「Argon是一款全方位的模型,在多個領域都具備最前沿的能力。」

最直觀的變化是輸出長度的上限。AI模型處理文字的基本單位稱為token,Argon的輸出上限從前代的6.4萬個token拉高到100萬個,換算約為75萬個英文單字。Google的說法是,模型有足夠空間深入推理,才能一次解開困難問題。實際使用時,這麼長的回應要靠Gemini API新功能Long Decode Continuation,把長回應暫停、再透過後續呼叫接續下去,Artificial Analysis測試時就是這樣做,以避免請求逾時。

Google內部已大量使用Argon。以Google開源的影片解碼軟體libgav1為例,Google讓多個Argon分頭作業,接手一個既有的Rust(一種較能避免記憶體漏洞的程式語言)版本,把其中3.2萬行針對處理器加速的程式碼(SIMD)改寫成安全的Rust寫法,最後產出的解碼器比原本的Rust版快2.7倍,輸出畫面完全一致。

開放節奏則相當保守。Argon第一階段只透過Fairwind計畫開放給一群受信任的資安防禦者,Google也參與美國政府的自願性機制,讓政府在模型公開前先取得使用權限。等測試回饋到位、防護機制調整完成,才會擴大開放給開發者、企業與消費者,首批是付費API客戶與Google AI Ultra訂閱用戶,Google並未公布具體時程。

跑分追上了,價格優勢卻是打折換來的

根據Artificial Analysis的測試,Argon在最高推理強度下的綜合智力指數為53分,與GPT-6 Astra並列,略高於OpenAI另一款GPT-6.1 Sol(52分);相較Google上一款非Flash等級的模型Gemini 3.1 Pro Preview(30分),一口氣大進23分。

進步主要來自兩處。第一是代理能力,也就是讓AI自己拆解步驟、操作工具完成任務,這向來是Gemini的弱項。Argon在Artificial Analysis版的自動化測試AutomationBench-AA拿下77.5%,排名第一,領先Anthropic的Claude Sonnet 5.5約6個百分點;在測試命令列操作能力的Terminal Bench 4拿到57%,僅次於Claude Sonnet 5.5、Claude Opus 5.5與GPT-6 Astra。

第二是幻覺率。在AA-Omniscience知識測試中,Argon的幻覺率為15%,是綜合指數45分以上模型中最低,GPT-6 Astra則為51%。換言之,Argon遇到不知道的問題,比較會老實承認,而不是硬猜,但代價是答對率只有50%,低於GPT-6 Astra的63%。

Google自家公布的成績則包括:測試長時間軟體工程任務的DeepSWE v1.1拿下77.9%,創下最佳成績;測試資安漏洞修補能力的CWE-bench v1以68%並列第一。

價格是另一個賣點,但要看清楚條件。Argon首發優惠價為每100萬個輸入token 2美元(約新台幣64元)、輸出token 10美元(約新台幣319元),是原價4美元(約新台幣127元)與20美元(約新台幣637元)的五折,Google未公布優惠期限。

Artificial Analysis推算,在首發五折、加上快取折扣提高到95%(重複送入模型的內容大幅打折)的條件下,Argon完成一項綜合指數測試任務平均花1.99美元(約新台幣63元),只要GPT-6 Astra(3.26美元,約新台幣104元)的6成。

不過,較低的測試任務成本主要來自優惠定價與快取折扣,並非更省token。 在這項測試中,Argon每項任務平均輸出6.2萬個token,是GPT-6 Astra(2.7萬個)的兩倍多;一旦優惠結束,每項任務成本會升到3.98美元(約新台幣127元),約為GPT-6 Astra的1.2倍。

內部雜音:分數漂亮,實戰寫程式卻未必

發表當天,《Bloomberg》引述多名直接接觸開發的知情人士報導,Gemini 4在業界常用的基準測試上表現亮眼,但員工實際拿來工作時表現較差,處理某些寫程式任務有困難;其中一人指出,Argon不太擅長決定App與網站外觀的前端設計。

報導也點名業界常見的「刷榜」(benchmaxxing)現象,指的是工程師把心力放在拿高分,而不是做出真正好用的產品,兩名知情人士認為Gemini 4似乎受此影響。AI新創Surge AI創辦人Edwin Chen比喻:「就像說『我家小孩SAT(美國大學入學考試)考得很好』,但SAT成績並不等於現實世界的表現。」

Google內部看法並不一致。部分員工認為Anthropic的Fable與OpenAI的Astra進步速度比Gemini更快,Gemini 4即使在最佳狀態,某些面向仍會落後;也有員工認為新模型已追上領先實驗室。

延伸閱讀:Google AI掌門換人!13年老將接棒哈薩比斯:Koray Kavukcuoglu是誰?如何搶救Gemini劣勢?

資料來源:Google官方公告、《Axios》、《Bloomberg》、Artificial Analysis評測、Artificial Analysis X貼文、鉅亨網匯率

本文初稿為AI編撰,整理.編輯/ 李先泰

關鍵字: #Google #Gemini
往下滑看下一篇文章
不只給場域、更助攻海外!桃園如何助思納捷做大智慧能源管理版圖?
不只給場域、更助攻海外!桃園如何助思納捷做大智慧能源管理版圖?

隨著全球淨零轉型浪潮持續推進,企業不僅要許下減碳承諾,更得拿出可以被量測、驗證的實際成果,這也驅使企業加速導入智慧能源管理系統。早在 2017 年便投入此領域的思納捷,從桃園出發,透過工業園區與公共建築等在地場域的部署經驗,持續打磨技術與解決方案,隨後更在桃園市政府青年事務局「桃園天際線加速器」協助下,逐步將市場版圖延伸至海外。如今,思納捷全球累積超過 1,000 個應用實績,不僅成功將台灣智慧能源解方推向海外,更成為全球企業推動綠色轉型不可或缺的關鍵夥伴。

從桃園場域開始淬鍊:思納捷把「失敗經驗」變成難以複製的競爭力

思納捷總經理莊棨椉原先在資策會從事能源與物聯網相關研究,當時,他從歐美市場發展看見智慧能源管理的趨勢,於是,團隊從資策會獨立出來、成立思納捷,將過去累積的研發能量帶向市場。而技術落地第一站,就是從工業聚落密集的桃園開始,思納捷運用 IoT 技術管理工業園區的路燈、空氣品質、排水與交通等公共設施與環境,也進一步走進園區工廠,協助企業掌握與管理用電。

然而,從研究機構走向市場後,莊棨椉很快發現,「做得出來」與「真的能用」之間,還隔著一段不小的距離。許多從技術角度來看完全可行的做法,在進入真實場域後,反而出現各種從未想過的問題。

舉例來說,在幼獅工業園區部署智慧路燈時,思納捷原本採用 Mesh Wi-Fi 網狀網路,讓路燈彼此串聯、逐站傳遞訊號,沒想到實際上線後,路樹上的枝葉竟然擋住了訊號,造成通訊不穩定。為此,團隊重新調整架構,採用 NB-IoT 方式,讓每支路燈直接透過電信網路傳輸資料,降低環境遮蔽物對通訊的影響。

類似的「踩坑」經驗也發生在澎湖馬公港。思納捷與合作夥伴共同佈建智慧路燈,採用 PLC 電力線通訊技術,明明在實驗室與一般道路測試都沒有問題,到了港區卻完全無法傳輸訊號。團隊一路追查才發現,原來地下線路早已受到鹽害侵蝕,為此重新抽換線材,才讓系統得以正常運作。

串設備、整數據、AI 自主管理:思納捷打造 24 小時能源總管

「每一次踩坑,都讓團隊更清楚不同技術的適用邊界,也讓下一次部署少走一段彎路,」莊棨椉說,思納捷運用近十年來走進不同場域、解決各種意外狀況所累積的實戰經驗,形塑出 3 大產品特色。

第一,是物聯網裝置串接能力。
目前思納捷已能串接超過 1,000 種設備,涵蓋電表、水表、空調、冰水主機等不同類型,支援數量為全台最多。無論企業使用何種廠牌的設備,都能快速介接至思納捷的平台,降低設備整合門檻。

第二,是將數據與場域 Know-how 轉化為管理模組,讓企業可以「隨選即用」。
思納捷將多年累積的數據與經驗,轉化為超過 20 種應用模組,企業可以依需求持續擴充功能,一改過去可能要導入多套解決方案,才能管理不同設備的系統孤島問題。

舉例來說,某電子元件代理商在導入思納捷解決方案後,管理人員只要透過一支手機,就能掌握辦公大樓各樓層的設備運轉狀況,包括用電、用水、會議室、電動車充電樁到空調系統。不僅大幅提升管理效率,也能進一步掌握實際用電需求、降低能源耗用,並據此調降契約容量,每月節省約百萬元的電費成本。

第三,是讓能源與設備管理從人工管理走向 AI 自主管理。
思納捷以自家大數據為基礎,結合 AI 提升系統自主判斷與調控能力,持續優化能源管理的成效。「我們的目標,就是打造 24 小時雲端 AI 總管,讓系統可以自己判斷和調整,讓設備隨時維持在最佳運轉狀態,避免造成不必要的能源浪費,」莊棨椉強調。

出海前先看懂市場:桃園天際線加速器降低新創試錯成本

隨著產品逐漸成熟,思納捷也開始把目光投向海外,而進駐桃園天際線加速器,則為團隊提供一個以更低成本探索海外市場、驗證發展方向的機會。

莊棨椉表示,透過加速器安排的韓國、新加坡等國際交流,思納捷得以接觸不同市場的潛在客戶、創投與投資者,了解當地產業環境與實際需求,也能與在地新創交流創業與市場拓展經驗;國際經驗的獲取與海外拓點,都是成本極高的決策,藉由這些機會,思納捷得以用較低成本,去了解國際市場的可能性與風險。

此外,加速器也會安排專業業師分享國際市場經驗,從不同角度刺激團隊思考,重新檢視既有商業模式與海外布局策略。例如,曾經有業師與莊棨椉逐項分析海外上市必須具備的條件,讓他重新盤點公司現階段的優勢與不足,也進一步思考什麼才是最適合思納捷的成長路徑。

「加速器讓我們有機會多看、多聽、多接觸。」莊棨椉說。這些交流的價值,不只是認識多少潛在客戶,而是讓團隊在真正投入大量人力與資金以前,先釐清當地究竟有沒有市場、客戶需求是否成熟,以及既有產品與商業模式能不能直接複製。過去許多只能透過資料或想像判斷的問題,如今都能透過實際走進市場、接觸第一線業者取得更多資訊,降低走錯路的風險與試錯成本。

對思納捷而言,加速器帶來最關鍵的幫助是,透過市場探索、業師輔導與資源媒合,讓團隊在真正投入之前,有更多機會看懂市場、驗證方向,再決定下一步怎麼走。對資源有限的新創而言,這種「先驗證、再投入」的過程,反而能降低海外布局的機會成本,讓每一步走得更精準。

展望下一階段,思納捷團隊將持續聚焦校園、園區、建築與工廠四大場域,持續深化應用,讓「24 小時能源與機電設備雲端 AI 總管」的概念在更多場景落地,同時,當既有台商客戶前往海外設廠、有智慧能源管理需求時,思納捷也會跟隨客戶腳步提供服務。莊棨椉認為,唯有先把技術與服務做深,建立可複製的成熟模式,未來才有機會將台灣累積的智慧能源管理經驗帶向更大的國際市場。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
一次搞懂工業AI
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓