微軟推出3款AI語音模型 MAI-Transcribe即時轉錄準確度稱冠

  • 記者:黎怡涵|責任編輯:新聞中心
  • 發佈時間:2026.10.02 17:37
  • 最後更新時間:2026.10.02 17:37
將網站加入你的 Google 偏好搜尋來源,更容易搜尋到喜歡的內容
微軟推出3款AI語音模型。(圖/Shutterstock達志影像)

微軟推出3款AI語音模型。(圖/Shutterstock達志影像)

微軟(Microsoft)宣布推出3款人工智慧(AI)語音模型,包括即時語音轉文字模型MAI-Transcribe-2-Streaming,以及文字轉語音模型MAI-Voice-2.1與MAI-Voice-2.1-Flash,主打低延遲、多語言及高效率,協助開發者打造更自然的AI語音代理人。微軟表示,MAI-Transcribe-2-Streaming在Artificial Analysis的轉錄準確度測試中,完整及部分轉錄結果的準確度均排名第1。


MAI-Transcribe-2-Streaming 支援60語言即時轉錄

MAI-Transcribe-2-Streaming支援60種語言,並可持續自動偵測使用者使用的語言。不同於必須等待使用者說完才輸出文字的傳統語音轉錄方式,模型在接收到語音後100多毫秒便可產生初步轉錄內容,之後隨著更多上下文資訊加入持續修正,並快速形成穩定文字。

微軟表示,這讓AI語音代理人能在使用者尚未說完話時便開始推理或呼叫工具;在即時聽打及字幕等應用中,內部測試顯示文字出現速度約為最接近競品的2倍。該模型年底前的優惠價格為每小時音訊0.54美元。


MAI-Voice系列 主打多語言及低延遲

MAI-Voice-2.1則聚焦於多語言文字轉語音,支援23種語言及26個語言地區,且同一個聲音可跨不同語言維持一致的聲音特徵,同時依照當地語言調整口音及發音。

MAI-Voice-2.1-Flash則針對高流量及低延遲應用設計,支援與MAI-Voice-2.1相同的語言範圍,可在約150毫秒的端到端延遲下生成45秒音訊。微軟表示,模型推理速度提升55%,價格則比同類模型低約60%,每100萬字元15美元。兩款模型也支援以數秒參考音訊進行跨語言聲音複製,並內建同意與安全防護機制,降低聲音複製遭濫用的風險。

微軟表示,將MAI-Transcribe-2-Streaming搭配MAI-Voice-2.1-Flash,可縮短AI語音代理人「聽取、理解、決策及回答」各環節的等待時間,讓代理人能在對話進行期間處理資訊及使用工具。目前3款模型均可透過Microsoft Foundry使用,另可在MAI Playground等平台取得。