谷歌(Google)推 Gemini 3.5 語音雙更新:精準去除冗言贅字、支援85種語言轉錄
Google 於8月26日宣佈推出全新 AI 音訊模型 Gemini 3.5 Transcribe 同 Gemini 3.5 Live Translate。新模型大幅提升語音轉文字準確度,自動移除填充詞並支援多說話者識別。同時 ,實時語音翻譯功能擴展至逾70種語言,並整合至 Google Meet 同 Translate 應用程式,為日常溝通同工作效率帶來實質提升。
Google 推出 Gemini 3.5 系列音訊模型 全面提升語音識別與實時翻譯體驗
科技企業 Google 於8月26日正式宣佈,推出全新 AI 音訊模型 Gemini 3.5 Transcribe 同 Gemini 3.5 Live Translate。呢次更新主力針對實時對話同語音識別進行優化,目的係為一般用戶同開發者提供更精準、更流暢嘅語音處理體驗,進一步整合語音技術至日常數碼生活之中。

Gemini 3.5 Transcribe 核心功能與準確度提升
全新嘅 Gemini 3.5 Transcribe 將會取代舊有嘅 Chirp 3 模型。根據 Google 公佈嘅數據,新模型喺串流音訊嘅字詞錯誤率(WER)降至 4%,預錄檔案更低至 2.6%。核心優勢包括智能轉錄,能夠自動移除「um」、「ah」等填充詞,並自動格式化文字。此外,模型支援超過 85 種語言及地區口音,並具備多說話者識別功能,可為預錄音訊中最多三位說話者提供字級時間戳記,非常適合用於會議記錄或播客轉錄。模型亦支援自訂詞彙,能夠準確識別專業術語或獨特拼寫。
Instead of typing out every thought, Gemini 3.5 Transcribe works with the way you actually talk:
— Google (@Google) August 26, 2026
✅ Seamlessly handles self-corrections
✨ Removes filler words to deliver clean, formatted text
🎯 Understands your natural intent and speaking style
🔊 Accurately captures audio in… pic.twitter.com/17YcsDi7Q0
實用應用場景與平台整合
喺應用層面,Gemini 3.5 Transcribe 已經開始整合至多項 Google 服務,包括 Search Live、Gemini Live、Docs、Keep、Gmail、Gemini 應用程式同埋 Gboard。值得留意嘅係,Google 表示未來將會喺 Chrome 瀏覽器實現「語音輸入至任何網頁欄位」嘅功能,讓用戶可以直接透過語音指令撰寫電郵或填寫表格。開發者亦可透過 Google AI Studio 同 Gemini API 調用呢項功能,企業客戶則可透過 Gemini Enterprise Agent Platform 進行部署。
Gemini 3.5 Live Translate 實時語音翻譯
除咗語音轉文字,Google 同步推出 Gemini 3.5 Live Translate,提供超過 70 種語言嘅近乎實時語音對語音翻譯。同傳統輪流翻譯系統唔同,新模型會持續生成翻譯語音,保留說話者嘅語氣、節奏同音調,減少尷尬嘅停頓。呢項功能將會率先喺 Google Meet 嘅企業版進行私人預覽,並將翻譯語言組合由以往嘅 5 種大幅擴展至超過 2000 種,滿足跨國會議需求。
流動設備整合與安全機制
對於流動裝置用戶,Google Translate 應用程式(支援 Android 同 iOS)亦會更新支援此模型。Android 用戶更會獲得全新嘅「聆聽模式」,只需將手機貼近耳邊,即可透過聽筒直接接收翻譯音訊,適合喺嘈雜環境或需要私隱嘅場合使用。為確保資訊安全,所有由模型生成嘅音訊均會嵌入 SynthID 隱形浮水印,以便識別 AI 生成內容,防止誤導性資訊傳播。
總結
綜合而言,Gemini 3.5 系列音訊模型嘅推出,顯示 Google 持續喺語音處理同跨語言溝通領域投入資源。對於需要頻繁進行會議記錄、跨國溝通或日常語音輸入嘅用戶而言,呢啲功能嘅整合將會提供更具效率嘅解決方案。隨著功能逐步擴展至更多平台,預期未來嘅數碼溝通體驗將會更加無縫同自然。