
使用 Gemini 3.5 Transcribe 進行智慧型轉錄
- 智谱新Z.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 每百萬 tokens
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
Gemini 3.5 Transcribe 於 2026 年 8 月 26 日進入公開預覽,這是第一個真正以 Gemini 模型形式銷售的 Google 語音轉文字模型:你可以透過 Gemini API 以模型 ID 呼叫它,音訊以 token 計價,Google 並在定價頁面上列出每分鐘音訊的成本。最後這個細節正是消費者報導輕輕帶過的部分。發布當日的新聞重點在於 Gboard 中的填充詞移除與語音編輯,但對開發者來說,實際的改變在於轉錄功能現在與 Gemini 系列的其他部分位於同一 API 介面上,且說話者歸屬和詞級時間戳記內建於基礎模型中,而非另外的附加元件。這篇文章讀起來像一份 API 參考文件,因為那是第一波報導留下來的空白。
先提出兩點提醒,以免以下數字造成誤導。Google 並非稱 Gemini 3.5 Transcribe 為「我們所擁有最準確的語音轉文字模型」——該說法是指它是最精確的智慧語音互動模型,這是不同的說法,而當你閱讀 WER 數據時,這個差異就很重要。此外,這裡所述的一切都是指公開預覽版:兩個模型 ID、價格和基準數字都是 Google 現今所提供的,而且這些在正式發布(GA)前都可能變動。
兩個 API 路徑 — 以及要記住的模型 ID
Gemini 3.5 Transcribe 以兩個端點的形式提供,而選擇正確的端點是團隊所做的第一個架構決策:
• gemini-3-5-transcribe — 透過 Interactions API 的預錄音訊處理路徑。傳送檔案後,即可取得包含說話者標記(最多三位說話者;三位以上為實驗性功能)與逐字時間戳記的文字紀錄。這是批次與非同步處理的主力工具。
• gemini-3-5-transcribe-live — 透過 Live API 的即時路徑。具亞秒級延遲的雙向串流,旨在支援即時對話、字幕生成與語音驅動介面。
這種區分方式與 Gemini Audio 系列其他產品的配置如出一轍,而且這點很重要,因為「live」是一個獨立的 SKU,擁有自己的定價。對這次發布的幾則早期解讀都假設同一款型號能兩者兼顧;但事實並非如此。

「智慧轉錄」的真正含義
Google 的發布文章將此定位為超越語音準確性、邁向理解。從該定位出發所推出的功能,才是應評估的重點,而非定位本身:
• 不流利處理 —— 「嗯」和「啊」會被刪除,自我修正也會被解決。「我們星期二見——不,星期三」會被轉錄為修正後的日期,而不是虛假開頭的轉錄文本。這是模型所做的決定,也就是 Google 稱之為「智慧」的意義所在。
• 自動格式化 — 輸出會以潤飾過的文字呈現:套用標點符號、大小寫及段落結構,而非原始的 token 串流。
• 多說話者識別 — 預錄音訊中最多可識別三位說話者,並提供逐字時間戳記;三位以上說話者則屬實驗性功能。此功能內建於基礎模型中,而非獨立的說話者分離服務。
• 自訂詞彙 — 您可以提供詞彙來讓辨識結果偏向行話、產品名稱和特殊拼寫,這是垂直領域的運作機制。
• 85+ 種語言 — 自動偵測,並明確標示區域口音和方言。
• 函式呼叫——模型可以將影像生成或檔案分析等工作委派給其他 Gemini 模型,這使轉錄成為更大代理中的一個元件,而非最終步驟。
• 實體擷取 — Google 宣稱在嘈雜的真實世界音訊以及郵遞區號、訂單編號等英數實體上表現優異。
媒體報導也提到 96,000 個 token 的上下文視窗(約可容納一小時的會議音訊,無需分段)以及情緒偵測。兩者都與發表時的定位一致,但 Google 發布的模型卡並未將其列為重點,因此在 GA 規格表出現之前,應將這些視為報導內容而非經證實的功能。

標記的準確度數字
Google 引用的 WER 數據來自 Artificial Analysis:串流轉錄的平均字詞錯誤率為 4.0%,非串流轉錄為 2.6%。在 FLEURS 多語言基準測試中,Google 報告串流的 WER 為 5.50%,非串流為 5.04%。Google 還聲稱,與前一代 Chirp 3 相比,最終轉錄時間改善了 70%。
誠實的解讀是:這些量測結果確實是獨立的——就 Artificial Analysis 不是 {{1}}Google{{/1}} 這點而言——但這些是 {{2}}Google{{/2}} 挑選的數據,刊載於 {{3}}Google{{/3}} 自家的公告中,而該模型才剛開放呼叫一天。除了 {{4}}Google{{/4}} 之外,還沒有人針對它與多數團隊用來比較的開放權重模型進行過對抗性的正面對決;發表資料中也沒有與 Whisper 系列或 NVIDIA Parakeet 產品線的直接比較。比 Chirp-3 快 70% 的這個數字純屬供應商宣稱,如此而已。請把 2.6% 和 4.0% 視為強而有力的早期訊號,而非已定案的事實。
費用是多少
Google 的定價頁面以 tokens 和估計的音訊分鐘數來報價每個模型。對於 gemini-3-5-transcribe,混合估計約為每分鐘音訊 $0.005(依牌價),輸入約 $0.003/分鐘,輸出約 $0.002/分鐘。對於 gemini-3-5-transcribe-live,混合估計約為每分鐘 $0.009。兩者目前都有免費方案。
那些每分鐘的數字是根據假設的 token 速率(輸入每秒 25 個音訊 token,輸出每分鐘 175 個文字 token)推算出的估計值,因此若 Google 改變 token 的計算方式,這些數字也會隨之變動。真正穩固的是原則:列表價格就是最終價格。這正是 OrcaRouter 這類穿透式路由器所依循的原則——0% 加價、直接以供應商列表價格傳遞——所以如果 Google 在預覽版到正式版(preview-to-GA)期間調降轉錄價格,我們這端也會在同一天立即生效,而不是等經銷商更新價目表之後才跟上。
正在推出之處
對開發者而言,今日的公開預覽意味著兩個方面:Google AI Studio 中的 Gemini API,以及用於企業工作負載的 Gemini Enterprise Agent Platform。在消費者端,Gemini 3.5 Transcribe 已經驅動 Android 上 Gboard 中的 Rambler 聽寫功能,以及 macOS 上的 Gemini 應用程式。接下來是 Chrome——可在任何網頁欄位中語音輸入——隨後是 Search Live、Gemini Live、Docs、Keep 和 Gmail。對於正在評估它的團隊,實際的答案更簡單:如今在 Gemini API 可用的地區,即可透過程式碼以英文呼叫它。

這對您的管線意味著什麼。
真正的新東西不是 WER 數字。而是 Google 現在在基礎模型中銷售轉錄服務,並附帶了兩個過去需要團隊自行拼接的功能——說話者標籤和詞級時間戳——而且是在支援函式呼叫的 Gemini API 介面上。如果你過去是用單純的轉錄器、外加獨立的說話者分離器,再加上一個格式化處理,來建構具說話者分離的會議記錄流程,那麼這是第一個把這些步驟整合起來的 Google 模型。尚未解答的問題是,2.6% 非串流 WER 在你自己的音訊上是否依然成立;在出現獨立重現結果之前,生產團隊負責任的做法是透過 API 執行一份真實樣本,而不是依照 Google 自選的基準來編列預算。至於在轉錄結果之上執行的 LLM 工作——摘要、結構化萃取、行動項目——這正是路由能體現其價值的層級,也是 OrcaRouter 所涵蓋的層級:一個 API 涵蓋 200 多個模型、跨供應商自動故障轉移,以及一個可將多個模型組合成單一呼叫的路由 DSL。轉錄這一步本身,你應該用自己的音訊測試過,再相信任何人的對外宣稱數字。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
