Google 發表 Gemini 3.5 Transcribe 語音轉文字服務
2026/08/28
Google 推出以 Gemini 3.5 為基礎的語音轉文字服務 Transcribe,強化其在語音處理領域的產品線。在 AI 應用逐步走向語音介面的趨勢下,轉錄品質正成為決定使用體驗的關鍵環節。
語音轉文字的技術難度,往往被使用者低估。乾淨錄音下的單人朗讀已接近解決,而實際場景的挑戰在於:多人重疊發言、背景噪音、口音與語速差異、專業術語與人名地名、以及語言之間的切換。這些條件在會議、訪談與客服等真實應用中同時存在。
以大型語言模型為基礎的轉錄,與傳統的專用語音模型有本質差異。傳統方法把語音辨識視為獨立的訊號處理任務,輸出的是逐字結果;而具備語言理解能力的模型,能運用上下文推斷模糊的發音、修正明顯的辨識錯誤,並在專業領域中選擇正確的術語寫法。這在專業內容的轉錄上帶來明顯改善。
不過,這種能力也帶來新的風險。當模型能「推斷」使用者可能說了什麼,它同樣可能在聽不清楚時補上一個合理但錯誤的內容——而這種錯誤比傳統辨識的錯誤更難察覺,因為輸出讀起來完全通順。對於法律紀錄、醫療對話或新聞訪談等準確度要求高的場景,這是實質的問題。
從應用面看,高品質的轉錄是許多下游功能的基礎。會議摘要、通話分析、影音內容的檢索與字幕生成,都建立在轉錄結果之上;轉錄的錯誤會沿著這條鏈路累積放大。這使得轉錄品質的改善,其價值不僅在於單一功能,而在於整條應用鏈路的可靠度。
競爭態勢方面,這個領域的參與者相當多元——大型雲端業者、專業語音服務商與開源模型都在其中。而差異化的空間主要在幾個面向:特定語言與口音的支援深度、專業領域的術語準確度、即時處理的延遲,以及與既有工作流程的整合便利度。
對企業採用者而言,評估的重點應放在自身場景的實測,而非通用基準的分數。不同服務在不同語言、領域與錄音條件下的表現差異相當大,而通用測試的結果未必能反映實際使用的品質。
後續觀察重點包括:多語言與口音支援的實際表現、在專業領域的準確度驗證,以及與既有工具的整合方式。