Google在美國時間2026年9月15日發表Gemini 3.8 Live與Gemini 3.8 Live Extended Thinking兩款語音對話模型。
這次升級的核心是「邊想邊說、邊聊邊做事」:模型可以在對話不中斷的情況下,於背景執行工具與API呼叫,並近即時讀取鏡頭或螢幕畫面。開發者9月15日起可在Gemini API與Google AI Studio使用,一般用戶則能在Gemini Live與Search Live用到新模型。
兩款模型怎麼分工:一款跑量、一款想深
Google官方部落格說明,兩款模型定位不同。Gemini 3.8 Live主打規模與成本效率,強項是流暢對話與「視覺理解」(官方稱visual grounding,也就是看著畫面回答問題)。Gemini 3.8 Live Extended Thinking則鎖定高複雜度任務,具備多步推理能力。
Extended Thinking最大的特色是「同時推理與說話」。過去語音AI遇到需要思考的問題,常會停頓一段時間再回答;新模型可先用「我查一下」這類口語回應確認指令,再於背景推理並回報進度,減少等待時的對話中斷。
兩款模型的共通能力有三項:近即時處理視覺輸入、支援97種語言並可在對話中自動偵測與切換、在背景執行工具與API呼叫而不打斷交談。 官方示範影片中,Gemini 3.8 Live能看著棋盤即時下棋,Extended Thinking則把手繪草圖加上語音回饋,直接產出可運作的React(網頁前端框架)元件。
語音代理測試拿第一,費率要看API定價頁
依官方公布的測試成績,Gemini 3.8 Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index(語音對語音品質指數)以82.6分拿下總排名第一;在τ-Voice(語音代理任務完成率測試)拿到68.6%,在Sierra的τ-Voice-banking(銀行客服情境測試)拿到35.1%。
這兩項測試考的是語音AI能否真的把客服或銀行流程從頭走完,而不只是對話順不順。推理能力方面,Big Bench Audio(音訊推理測試)得分97.7%。
Gemini 3.8 Live則在Speech Agent Arena(用戶偏好排行)排名第二,Google強調這款模型是在維持成本效率的前提下達到這個成績。至於ServiceNow的EVA-Bench語音代理測試,Google只提到兩款模型在準確度與對話品質之間取得平衡,未給出具體數字。
值得注意的是,Google在公告正文只稱兩款模型「價格具競爭力」,未詳列費率,但官方API定價頁已公布兩款模型的收費。付費方案下,音訊輸入每100萬token為3美元(約新台幣95元),音訊輸出每100萬token為12美元(約新台幣382元);文字輸入與輸出則分別為0.75美元與4.5美元。兩款模型採同一價目表,Extended Thinking的思考token計入輸出計費。
誰能用、何時能用:Workspace功能綁訂閱方案
兩款模型都從9月15日起陸續推出,但開放對象與階段不同,分列如下:
- 開發者:兩款模型皆已在Gemini API與Google AI Studio上線。
- 企業:兩款模型皆為Gemini Enterprise私人預覽;Gemini Enterprise for Customer Experience標示即將推出,Extended Thinking另將開放Workspace企業客戶,Google未給時間表。
- 一般用戶:Gemini 3.8 Live進入Search Live;Extended Thinking進入Gemini Live,Workspace的Docs Live限Google AI Pro與Ultra訂戶,Gmail Live與Keep Live開放所有Google AI訂戶。
換言之,想在Docs裡用語音請AI改文件,得先是Google AI Pro或Ultra訂戶;未訂閱的用戶能用到的是Gemini Live與Search Live。企業端則還在私人預覽階段,尚未全面開放。
在開發者生態上,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel與Vision Agents等七家開發平台已串接Gemini Live API,替開發者處理即時音訊串流的底層基礎設施。企業合作夥伴則包括Salesforce、Genspark與Lumeris。Google另表示,兩款模型生成的所有音訊都嵌入SynthID水印,人耳聽不出來,但可用工具偵測為AI生成內容。
資料來源:Google官方部落格、Gemini Live API開發文件、Gemini API定價頁、Gemini 3.8 Live模型文件、Gemini 3.8 Live Extended Thinking模型文件
本文初稿為AI編撰,整理.編輯/ 李先泰
