
Gemini 3.5 Transcribe Live 與 Gemini 3.5 Transcribe:您的應用程式應該呼叫哪個端點
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123智能49程式
當 Google 在 2026 年 8 月 26 日推出 Gemini 3.5 Transcribe 系列時,它提供了兩個共享名稱與使命、但為對話不同階段而建的模型:Gemini 3.5 Transcribe Live,即透過 Live API 提供的串流端點;以及 Gemini 3.5 Transcribe,即透過 Interactions API 提供的預錄端點。大多數團隊在第一週犯下的錯誤,是把它當作一個有兩個按鈕的模型。其實它是兩個 SKU——不同的 API、不同的價格、不同的嚴格限制——而且兩者之間的準確度比較並非公平對決,因為它們是在不同規則下衡量的。本文將兩者並列,讓決策取決於你的工作負載,而不是排行榜。
兩者一覽
• API — Gemini 3.5 Transcribe Live 運行於 Live API(WebSocket、雙向串流),而 Gemini 3.5 Transcribe 則運行於 Interactions API(檔案輸入、轉錄輸出)。
• 工作 — 即時對話、字幕、語音代理 vs 會議、通話記錄、存檔音訊。
{{1}}準確度 — 串流模式 WER 4.0% 對比非串流模式 WER 2.6%,依據 Artificial Analysis 的數據,由 Google 引用;兩者採用不同的測量機制,無法直接比較。{{/1}}
• 延遲 — 語音結束後 0.40 秒即可產生最終轉錄稿,而非對完整檔案進行批次處理。
• 工作階段 — 每次即時工作階段的上限為 10 分鐘,相對於最長 60 分鐘的檔案(若啟用說話者分離與時間戳記,則為 30 分鐘)。
• 說話者 — 串流端沒有,預錄端則最多三名說話者,且具備逐字時間戳記。
• 價格 — 混合費率約每分鐘 $0.009,對比混合費率約每分鐘 $0.005。

架構決策:Interactions API 或 Live API
這兩個模型都屬於 Google 的 Gemini Audio 家族,且目前皆處於公開預覽階段。差異從傳輸層開始。gemini-3-5-transcribe-live 會開啟一個 WebSocket 並保持連線:原始音訊持續流入——常見的封裝格式是 16 kHz 或 24 kHz 的 16-bit PCM 區塊——而模型會在你說話時回傳部分轉錄,並在語音結束時為每個話語回傳最終轉錄。gemini-3-5-transcribe 則接收完整檔案,進行處理,然後回傳包含說話者標記和字詞級時間戳記的已完成轉錄。
傳輸方式的決定牽動其他一切。如果你的產品會以詞語被說出的當下即時呈現文字——例如即時字幕、在句子進行中讀取意圖的語音代理、在通話進行當中採取行動的通話助理——你就是走在 Live 路徑上。如果你的產品產出的是紀錄——例如會議記錄、通話紀錄、歸檔資料——你就是走在 Interactions 路徑上。會令人混淆的是,兩者都會產出文字;差別在於,那些文字是即時狀態,還是最終成品。
準確性:串流稅確實存在
Artificial Analysis,這個獨立評測機構的數據被 Google 在發布文章中引用,其測得串流端點的平均詞錯誤率為 4.0%,非串流端點則為 2.6%。在 FLEURS 多語言基準上,Google 報告串流為 5.50%,非串流為 5.04%。2.6% 這個數字讓 Gemini 3.5 Transcribe 在推出時名列 AA 的 WER 排行榜第 5 名,落後於 ElevenLabs Scribe v2 的 2.2% 和 Microsoft 的 MAI-Transcribe-1.5 的 2.4%——這些是 AA 的測量結果,而非 Google 的宣稱。
串流數據並不是同一個測試的較差版本。它是不同的運作模式:模型在聽到句子結尾之前就先行決定用詞,並為此付出代價。不要只根據準確度在兩者之間做選擇,因為在任何特定工作負載下,差距都可能翻轉。要根據限制條件來選擇:串流端點有 10 分鐘的工作階段上限、不提供說話者分離,也沒有時間戳記;預錄端點則能處理長達一小時的檔案、標記最多三位說話者,並回傳詞級時間戳記。如果你的應用程式需要說話者標籤,串流模型根本無法勝任,無論它的 WER 是多少。

他們共同之處
這兩個端點共用「智慧轉錄」引擎,而在共享功能方面,兩者之間的選擇是中性的:
• 支援 85 種以上語言的自動偵測,包括在 Live 路徑上的串流中語言切換。
• 不流利清理 — 刪除填充詞,解決自我修正(「星期二——不,星期三」最終會以修正後的日期呈現)。
• 自動格式化 — 將標點符號、大小寫與段落結構套用於輸出。
• 自訂詞彙 — 最多 1,000 個術語,適用於專業術語和產品名稱,而 Google 的文件建議約 100 個以獲得最佳效果。
一個適用於兩者的注意事項:讓輸出內容可讀的「智慧」清理,是以犧牲逐字忠實度為代價的設計決策。彆扭的措辭會被修飾;文字是模型對意圖的解讀,而非法庭記錄。若要取得精確的逐字稿,你需要在有提供逐字選項的地方使用該選項,並且無論如何都應自行驗證在你的音訊上的表現。
每分鐘成本:直播溢價
Google 以代幣為音訊計價,每秒 25 個音訊代幣,輸出則約為每分鐘逐字稿 175 個文字代幣。以牌價計算,每分鐘音訊的綜合成本約為 gemini-3-5-transcribe 0.005 美元,gemini-3-5-transcribe-live 約 0.009 美元——輸入部分為每百萬代幣 2 美元對比 3.50 美元,輸出部分為每百萬代幣 12 美元對比 21 美元。兩者目前皆提供免費方案。
溢價買的是即時路徑,而不是更高的準確度:你為串流端點每分鐘多付約 80% 的費用,而且它的轉錄 WER 較高。這就是誠實的框架。預錄模型既更便宜又更準確;串流模型之所以存在,是因為有些產品無法等待檔案處理完成。
你應該在哪個端點上進行建置?
• 即時字幕與字幕 — Gemini 3.5 Transcribe Live;若你需要時間對齊的輸出,請檢查「無時間戳記」限制。
• 語音代理 — 在句子中途使用 Gemini 3.5 Transcribe Live 來辨識意圖;長期工作階段請規劃 10 分鐘上限。
• 會議、訪談、檔案保存 — Gemini 3.5 Transcribe,具備2.6%的字錯誤率(WER)、發言者歸屬,以及詞級時間戳。
• 通話後分析 — Gemini 3.5 Transcribe 用於已完成的記錄;僅在分析必須於通話期間執行時使用 Gemini 3.5 Transcribe Live。
• 長時間連續音訊 — 使用 Gemini 3.5 Transcribe,因為處理一個 60 分鐘的檔案,勝過手動拼接十段 10 分鐘的即時錄音。

位於轉錄稿上方的圖層
這兩種模型都不是 OrcaRouter 所託管的——我們目前不提供語音轉文字的轉發服務,無論你選擇哪個端點,都得直接呼叫 Google 的 API。路由層對語音管線的作用,是位在轉錄文字之上:摘要器、實體抽取器,以及把串流轉化為決策的行動項目模型。而這一層正是 OrcaRouter 的價值所在——單一 API 涵蓋 200 多種模型,依供應商定價計費、不另加價,跨供應商自動容錯轉移,還有能將多個模型組合成單一呼叫的路由 DSL。你可以依工作負載選擇轉錄端點,再用同一把金鑰執行讀取轉錄內容的模型。
底線
Gemini 3.5 Transcribe Live 和 Gemini 3.5 Transcribe 屬於同一個家族,但兩者是不同的產品。當轉錄稿必須在對話結束前產生,且你能接受 10 分鐘的會議、無說話者標籤、無時間戳記時,請選擇 Live。當輸出是一份紀錄,且準確性與歸屬比速度更重要時,請選擇 Transcribe——它更便宜、更準確,且限制少得多。唯一錯誤的答案就是假設一個端點能同時做到兩者。
