Google推Gemini 3.5 Transcribe AI語音轉文字支援逾85種語言
- 記者:黎怡涵|責任編輯:新聞中心
- 發佈時間:2026.08.27 11:33
- 最後更新時間:2026.08.27 11:33
- 記者:黎怡涵|責任編輯:新聞中心
- 發佈時間:2026.08.27 11:33
- 最後更新時間:2026.08.27 11:33
Google推Gemini 3.5 Transcribe,AI語音轉文字更精準。(圖/翻攝自Google官網)
Google推出新一代語音轉文字模型Gemini 3.5 Transcribe,主打更精準的語音辨識及文字整理能力,可自動去除「嗯」、「呃」等口頭禪,處理自我修正、專業術語及多種口音,並支援超過85種語言。Google表示,新模型可用於即時語音互動、會議紀錄、通話分析及語音輸入等應用。

Gemini 3.5 Transcribe提升語音辨識
Google表示,Gemini 3.5 Transcribe能直接將原始語音轉換成經過整理及格式化的文字,不僅辨識說話內容,也能理解自然語言中的停頓、自我修正及口語表達。
例如使用者說「我們週二見,不,週三」,模型能辨識說話者的自我修正,將內容整理為修正後的文字。此外,模型也能移除「嗯」、「呃」等填充詞,並依照語意自動整理文字格式。
根據Artificial Analysis測試,Gemini 3.5 Transcribe在即時串流情境下的字詞錯誤率(Word Error Rate,WER)為4.0%,非即時處理則為2.6%。Google表示,相較於前一代Chirp 3,模型的最終文字輸出延遲時間降低約70%。
模型也能辨識使用者提供的自訂詞彙,包括專業術語及特殊拼寫,並可在預錄音訊中辨識最多3名說話者,為不同發言內容標記時間戳。
支援超過85種語言
Gemini 3.5 Transcribe可自動偵測並轉錄超過85種語言,並針對不同地區的口音及方言進行處理。Google表示,在FLEURS多語言基準測試中,新模型的表現也優於Chirp 3。

Google也將Gemini 3.5 Transcribe應用於旗下多項產品。在Android版Gboard中,新的Rambler功能可將語音轉換成格式完整的文字,使用者也能直接透過語音修正錯字或改變文字風格。
在macOS版Gemini中,使用者則能透過語音下達指令,讓Gemini結合螢幕內容及其他Gemini模型,完成檔案摘要、文字改寫及圖片生成等工作。
開放開發者及企業使用
Google表示,Gemini 3.5 Transcribe目前已透過Gemini API在Google AI Studio及Google Antigravity開放公開預覽,企業則可透過Gemini Enterprise Agent Platform公開預覽使用,未來也將整合至Gemini Enterprise for Customer Experience。
開發者可透過Live API使用即時串流版本,支援低於1秒的延遲;預錄音訊則可透過Interactions API進行轉錄,適用於會議、通話紀錄及其他音訊內容。
目前Gemini 3.5 Transcribe已在macOS版Gemini以英文推出,Android版Rambler則先於部分國家及語言提供。Google也表示,Chrome語音輸入功能將於未來推出,讓使用者能直接在網頁欄位以語音輸入文字。