Google 推出 Gemini 3.5 Transcribe 系列語音轉文字模型,支援超過 85 種語言,提供即時串流與預錄檔版本。官方引用 Artificial Analysis 測試,串流模型字錯率約 4.0%、預錄模型約 2.6%,並表示最終逐字稿延遲相較 Chirp 3 改善約 70%。這些是特定資料集和測試方法下的結果,不能直接保證每一段台灣口音都同樣準。

對影片、Podcast、會議與採訪工作,速度只是第一關。繁體中文、英文夾雜、品牌名、人名、台語口音、多人重疊說話和現場噪音,才最容易拉開實際差距。若模型能提供穩定時間碼、說話者分離與低延遲,創作者可以更快完成字幕初稿、搜尋長訪談與整理精華,不必先把整段音訊人工聽完。

Google 透過 API 提供模型,代表它主要是能力元件,不是直接取代完整剪輯軟體。使用者仍要考慮音訊是否上傳雲端、資料保存政策、費用、單檔長度與敏感內容。企業會議、未公開訪談和個資音訊不應只因辨識方便就直接送出,權限與保密流程必須先確認。

準備導入的團隊可先用自己最難的十段素材做小規模比較:同一段音檔測 Gemini、Whisper 與既有字幕服務,計算改字時間,而不是只看官方 WER。真正省錢的不是模型跑得多快,而是人工校對能減少多少。對台灣內容創作者,繁中標點、專有名詞和雙語切換會比英文排行榜更有決策價值。

資料來源:Google Gemini 3.5 Transcribe 官方介紹Ars TechnicaAndroid Authority

← 返回研製所首頁