AI Marketing

Google推出Gemini 3.5 Transcribe 語音轉文字AI可自動剔除口頭禪、辨清多人對話

Google推出Gemini 3.5 Transcribe 語音轉文字AI可自動剔除口頭禪、辨清多人對話

Google推出Gemini 3.5 Transcribe 語音轉文字AI可自動剔除口頭禪、辨清多人對話

Google於美國時間8月26日推出新一代語音轉文字模型Gemini 3.5 Transcribe,聲稱是該公司歷來最準確的語音辨識技術。新模型不止把說話內容逐字轉成文字,還會自動整理句子、剔除「嗯」、「呃」等口頭禪,甚至理解說話者臨時修正內容的情況。

Google舉例,若有人說「我們約星期二開會——不,改星期三」,系統能明白對方是在更改時間,而不會將兩個日子都寫進紀錄裡。

📈 準確度大幅提升

根據測試機構Artificial Analysis的數據,新模型處理已錄好的錄音時,錯字率只有2.6%;即時轉錄,即一邊講一邊出字,錯字率則為4.0%。若以另一項涵蓋多種語言的FLEURS基準測試計算,非即時及即時模式的錯字率分別為5.04%及5.50%。Google表示,新模型較舊版本Chirp 3更準確,處理速度亦快了七成。

新模型還特別強化辨認電話號碼、訂單編號、郵政編號等英數混合資料。企業亦可預先輸入公司名稱、產品名稱等專有詞彙,讓系統辨識時更準確,適合客服中心、物流公司等有大量專業術語的行業使用。

👥 一次可分辨三個人聲

Gemini 3.5 Transcribe支援超過85種語言及口音,甚至能應付說話中途轉換語言的情況,用戶毋須預先設定使用哪種語言。

處理會議錄音或訪談等預先錄好的音訊時,系統可分辨最多三名不同說話者,並標示各人發言時間。若說話者超過三人,準確度則未有保證,Google形容此功能仍屬測試階段。這項功能適合用於整理會議紀錄、Podcast節目及客服電話等。

🗣️ 講一句話即可叫AI做事

新模型另一特點是可配合Google的AI指令系統,讓語音不止變成文字,還可以直接變成指令。例如用戶對着電腦說「幫我整理這份文件」或「用這段內容生成圖片」,系統會理解意思,再交由其他AI模型處理。目前這項功能只在Mac版Gemini應用程式提供。

📱 已率先用於多項Google產品

新模型現正應用於Android手機輸入法Gboard的新功能「Rambler」,用戶說話後,系統會自動修正文法、整理句子,甚至可以再用語音修改剛才打好的內容。

Google的程式開發平台Antigravity亦已用上這技術,並會參考用戶當時的螢幕畫面、對話紀錄等資料,提升辨識準確度;例如即使檔案名稱較特別,系統仍可靠畫面資訊推斷出正確名稱。

Mac版Gemini應用程式則走得更前,用戶單靠聲音就可以整理文件、改寫文字、搜尋資料,甚至生成圖片。Google預告,未來Chrome瀏覽器亦會加入這技術,屆時用戶在任何網頁輸入框都可以用語音打字,例如回覆留言或填寫表格。

🔓 開放狀況

Gemini 3.5 Transcribe目前仍屬公開測試階段。開發者可透過Google AI Studio試用;企業客戶可經Gemini Enterprise Agent Platform使用;一般用戶則已可在Mac版Gemini應用程式及部分地區的Android Gboard中率先體驗。

✏️ 內容:由 AI Marketer HK 編輯部整理

————
👇 相信「AI × 數碼營銷」是未來的你,
歡迎 Tag 一位同行好友,一起成長!

#AIMarketerHK #DigitalMarketing #geminilive

View original Facebook post

Google推出Gemini 3.5 Transcribe 語音轉文字AI可自動剔除口頭禪、辨清多人對話