Google推Gemini 3.8 Live AI語音代理可邊對話邊執行複雜任務

Google推Gemini 3.8 Live及3.8 Live Extended Thinking。(圖/翻攝自Google官網)
Google推出Gemini 3.8 Live及Gemini 3.8 Live Extended Thinking兩款人工智慧(AI)語音模型,強化即時語音對話、視覺理解及多步驟推理能力,讓AI代理能在持續與使用者對話的同時,於背景執行工具及API操作。
Gemini 3.8 Live主打大規模部署及成本效率,支援即時視覺輸入,並可在對話中自動切換97種語言;Gemini 3.8 Live Extended Thinking則針對複雜任務設計,能在回應使用者的同時進行更深層的多步驟推理。
AI可邊對話邊執行任務
Google表示,新模型可在語音對話持續進行期間,於背景呼叫工具及API,讓AI可以先回應使用者,再等待外部任務完成,而不必中斷整段對話。模型也能結合即時影像資訊,根據使用者提供的即時影像資訊提供更具上下文的回應。
Extended Thinking版本則能在處理複雜工作時同步推理及說話,例如先以「讓我確認一下」等語句回應,再在背景完成多步驟任務並即時說明進度。

Google表示,Gemini 3.8 Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index取得82.6分,位居第一;在評估AI語音代理任務完成能力的τ-Voice測試中取得68.6%,並在τ-Voice銀行測試取得35.1%。
主攻企業語音AI市場
Google希望透過Gemini Live API,讓開發者打造客服、金融及其他需要即時語音互動的AI代理。Agora、LiveKit、LangChain、Pipecat及Vercel等平台已支援相關API,協助開發者處理即時音訊串流等基礎設施。
新模型也支援精確處理確認碼、理賠編號及技術資料等英數字資料。Google表示,Gemini 3.8 Live及Extended Thinking目前已透過Gemini API與Google AI Studio陸續提供。

Gemini 3.5 Transcribe支援85種以上語言
此外,Google也提供Gemini 3.5 Transcribe語音轉文字模型,支援85種以上語言。公司表示,該模型在串流及非串流測試中的平均單字錯誤率分別為4.0%及2.6%。
為協助辨識AI生成音訊,Google表示,其AI產品產生的音訊都會加入不可察覺的SynthID浮水印,讓相關內容能被辨識。

隨著AI代理從文字介面逐漸轉向語音互動,Google希望透過即時推理、視覺理解及背景工具執行能力,讓Gemini不只是回答問題,也能直接協助使用者完成更複雜的工作。