谷歌手語AI首次落地消費電子

當地時間8月12日,谷歌旗下DeepMind對外發布全新多語言手語轉文字模型SL2T,這項手語人工智慧技術正式搭載至Pixel11手機系統,實現手語AI第一次落地普通消費電子產品,補齊聽障群體智慧終端互動短板電子

本次上線的SL2T模型,最先適配Pixel11內建Gboard鍵盤、即時轉寫Live Transcribe兩款工具電子。手機前置攝像頭捕捉使用者動作之後,使用者便可依靠比出手語完成訊息編輯、網頁檢索、和Gemini大模型對話等原本需要手動打字的操作。內測資料顯示,使用者使用美國手語輸入文字,效率和自然度優於手動鍵盤打字,溝通體驗大幅提升。

在底層訓練層面,SL2T依託超過50種手語、累計10萬小時時長的手語素材完成訓練,四分之一訓練素材來自美國手語資料集電子。跨語種的聯合訓練方式,讓模型摸索不同手語之間共通的動作邏輯,識別效果優於單語種手語模型,在FLEURS ASL評測基準重新整理當下手語轉寫模型測評紀錄。

長久以來語音轉文字、語音輸入已經成為智慧手機標配功能,方便普通使用者解放雙手完成文字錄入電子。但全球現存超200種手語,大約7000萬聽障人群長期缺少適配移動端、成熟穩定的手語識別工具,手語相關技術大多停留在實驗室研發階段,很難面向普通使用者落地使用,移動端無障礙互動長期存在缺口。

新功能使聽障人士也享受到類似語音輸入的靈活“打字替代”體驗電子。不同於過往手語識別產品需要先將手勢對應固定標籤詞彙再轉換成文字,SL2T省去中間註解流程,直接解析人體動作座標生成文字。手語屬於獨立語言,面部神態、肢體空間位置、唇部動作都會承載語法含義,傳統標籤式識別方式容易丟失非手部動作攜帶的語義,全新架構能夠打破固定詞彙庫的桎梏,識別上限隨著訓練素材擴充持續提高。

隱私防護同樣是本次模型的重點設計電子。手機端Media PipeHolistic工具即時追蹤手部、面部、軀幹合計130處關鍵點,裝置只會向外傳輸動作座標資料,拍攝產生的原始影片畫面即時刪除,不會上傳雲端,規避拍攝畫面洩露帶來的隱私隱患。

據DeepMind團隊介紹,專案全程吸納聽障從業者、手語顧問委員會參與產品迭代,貼合手語使用者日常溝通習慣電子。現階段該功能僅開放美國手語轉英文,後續谷歌計劃逐步適配更多手語種類,並且向更多安卓機型鋪開該無障礙功能。

手語模型並不是DeepMind初次嘗試的殘障群體無障礙AI專案,2025年5月科研團隊對外官宣開源手語互譯模型SignGemma,依託輕量化Gemma架構搭建手語翻譯框架,主要針對美國手語開展最佳化,為如今SL2T消費級落地打下演算法根基電子

除此之外實驗室還研發過多項普惠技術:依託自研WaveNet語音合成演算法,幫助肌萎縮側索硬化症患者復刻出事前原生嗓音;Euphonia專項專案專門辨識中風、失語病患造成的含糊不清語音,破解言語障礙人群裝置互動難題電子。谷歌移動端無障礙產品線LiveTranscribe多年迭代音訊轉寫演算法,長期為聽障使用者提供日常聲音字幕,多年的聲學視覺多模態經驗,全部賦能本次手語識別模型開發。

多家科技廠商已經加速佈局面向殘障群體的AI無障礙賽道,國內科大訊飛旗下訊飛聽見,透過聽力殘疾認證的使用者可以享用免費即時語音轉寫、帶有月度時長配額的會議同傳權益;華為依託鴻蒙大模型打造完整助殘工具包,AI眼鏡藉助“小藝看世界”幫助視障人士識別路況障礙,小藝AI語音修復最佳化失語者含糊的發聲;蘋果升級iPhone、VisionPro端側AI,裝置搭載智慧即時字幕、圖片詳情解析功能,Vision Pro專屬新增眼動操控相容外接電動輪椅的無障礙功能電子

北京商報綜合報道

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://wap.yxd-1688.com/post/65913.html

🌐 /