Google 於美國時間 8 月 26 日發表全新語音轉文字模型 Gemini 3.5 Transcribe。該模型不僅強調整體的「辨識精準度」,更主打能將口語內容直接轉化為立即可用的結構化文字。
它具備自動過濾「嗯」、「啊」等贅詞的功能,並能理解講者中途改口的語意(例如:「我們禮拜二見,不對,是禮拜三」),最終只保留正確的資訊。
根據 Google 引用第三方機構 Artificial Analysis 的數據,其串流模式平均字錯率達 4.0%,非串流模式更低至 2.6%,號稱是自家史上最精準的語音轉文字模型。目前開發者已可透過 Gemini API 的公開預覽版進行體驗。
Gemini 3.5 Transcribe跟一般語音輸入差在哪?
傳統語音辨識模型在面對背景噪音、專業術語,或講者停頓與重複時,準確度往往會大幅下降。Gemini 3.5 Transcribe 的優勢在於能將原始音訊直接轉換為已排版、整理完畢的文字,省去後續人工清稿的繁瑣步驟。
其核心能力包含:
智慧修正與過濾:自動處理講者的自我更正,僅保留最終定案版本,並自動移除無意義的填充詞。
自訂詞彙庫:允許使用者預先匯入企業內部術語或特殊拼法,確保模型準確辨識,避免被誤轉為常見字詞。
多語言與口音支援:支援超過 85 種語言的自動偵測,並能妥善處理各地的口音與方言。
講者辨識與時間戳記:錄音檔可自動標示不同發言者並附上逐字時間戳記。官方指出,目前可精準支援最多三名講者(超過三人則屬實驗性質)。
高難度情境辨識:在吵雜環境中,針對郵遞區號、訂單編號等英數字混雜內容,依然能維持優異的辨識表現。
如何解讀準確度數據?
「字錯率」(WER)是衡量語音辨識能力的通用指標,數值越低代表辨識越精準。根據 Google 引用 Artificial Analysis 的數據,其串流模式平均字錯率達 4.0%,非串流模式更低至 2.6%。
另一組來自 FLEURS 多語言基準測試的數據顯示,串流字錯率為 5.50%、非串流為 5.04%(註:兩組數據源自不同測試基準,無法直接相互比較)。
速度方面,從開始辨識到產出最終逐字稿的時間,較 Google 前代語音模型 Chirp 3 大幅縮短 70%。不過需留意,官方號稱的「最精準」是與自家舊模型比較,並未列出與其他競品數據。
目前開放使用對象
新模型的開放範圍目前分為三層:
開發者端:以公開預覽(Public Preview)形式進入 Gemini API,可透過 Google AI Studio 與 Google Antigravity 取用。
企業端:Gemini Enterprise Agent Platform 開放公開預覽;Gemini Enterprise for Customer Experience 則即將推出。
一般使用者:最快接觸到的三個入口為 macOS 版 Gemini app(僅限英文)、Android 版 Gboard 的 Rambler 功能(限部分國家與語言),以及即將推出的 Chrome 應用。官方尚未說明開放國家名單(包含台灣)。
技術上,此模型透過兩支 API 運作:
Live API:負責雙向即時串流,延遲低於一秒,適合語音助理等需即時回話的場景。
Interactions API:專門處理預錄音檔、會議紀錄與通話存檔,並提供講者標記與逐字時間戳記。
資料來源:Google 官方部落格、Google Cloud 語音辨識準確度說明文件
本文初稿為AI編撰,整理.編輯/ 李先泰
