Google DeepMind推手語轉文字AI Pixel 11首搭支援美國手語

  • 記者Yu Han Lei責任編輯新聞中心
  • 發佈時間:2026.08.13 17:32
  • 最後更新時間:2026.08.13 17:32
Google推手語AI,Pixel 11可轉文字。(圖/翻攝自Google DeepMind)

Google推手語AI,Pixel 11可轉文字。(圖/翻攝自Google DeepMind)

Google DeepMind推出新的手語轉文字(SL2T)模型,首次將AI手語技術導入消費性產品,讓聽力障礙者可透過手語直接在手機上輸入文字。這項功能目前率先支援美國手語(ASL)轉英文,並搭載於Pixel 11系列的Gboard及Live Transcribe,未來將擴大至更多裝置及手語。

(圖/翻攝自Google Deepmind)
這項功能目前率先支援美國手語(ASL)轉英文。(圖/翻攝自Google DeepMind)

AI讓手語直接轉換成文字

Google DeepMind表示,SL2T可讓使用者在原本需要打字的情境中改以手語輸入,例如搜尋網路、撰寫訊息或文件,以及要求Google Gemini回答問題或執行任務。在Live Transcribe中,使用者也能以手語回應對話,減少與他人溝通時來回打字的需求。

Google DeepMind指出,全球有超過7,000萬名聾人及聽力障礙者,使用超過200種手語。然而,近年語音AI快速發展,已能提供語音轉文字及即時翻譯等功能,手語相關技術的進展卻相對有限。

這是因為手語並非將英文或其他口語「用手比出來」,而是具有自身文法及詞彙的自然語言。除了手部動作之外,手語還透過手臂、身體、頭部及臉部表情等同步動作傳遞訊息,因此AI必須同時處理語言翻譯與複雜的影像辨識。


超過10萬小時資料訓練

DeepMind表示,SL2T使用超過10萬小時、涵蓋50多種手語的資料訓練,其中約四分之一為美國手語。模型同時學習不同語言、方言及使用者熟練程度,希望藉此掌握不同手語之間共通的語言結構。

為保護使用者隱私,SL2T不會直接將手機攝影機拍攝的原始影像傳送至伺服器。裝置端模型MediaPipe Holistic會先辨識使用者身體各部位的位置,將影像轉換成由幾何座標組成的動作資訊,再將這些資料傳送至伺服器進行翻譯,原始影片則會立即捨棄。

與部分過去的手語翻譯系統不同,SL2T也不會先將手語轉換成所謂的「手語詞標」(glosses),再翻譯成文字,而是直接將動作座標轉換成文字。DeepMind表示,這能更完整保留手語中的非手部動作及空間結構,也避免中間詞彙限制影響翻譯品質。

DeepMind表示,SL2T目前是表現最好的手語翻譯模型之一,在FLEURS-ASL等基準測試中也取得領先成績。不過,Google承認這項技術仍有改進空間,並將持續處理即時翻譯延遲、單手手語及不同慣用手使用者的表現,未來也會加入更多手語及裝置支援。