
Gemini 3.5 Transcribe 與 Whisper Large v3 Turbo:基準需要更換嗎?
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
Whisper Large v3 Turbo 是業界很大一部分在提到「語音轉文字」時預設會想到的模型,而 Gemini 3.5 Transcribe 是第一個明確作為該基準挑戰者、而非通用語音 API 推出的 Google 轉錄模型。自 2026 年 8 月 26 日起公開預覽的 Gemini 3.5 Transcribe 將轉錄重新定義為一項推理任務——它會自行處理自我修正、格式化輸出、標示說話者,並自行呼叫其他 Gemini 模型。Whisper Large v3 Turbo 是 OpenAI 以 8.09 億參數從 Whisper Large-v3 蒸餾而來的版本,採用 MIT 授權、可自架、支援 99 種語言,視硬體而定,速度約為被蒸餾原始模型的四到八倍。前者是覆蓋在音訊上的受管智慧層;後者則是一個免費、廣為人知、想在哪裡執行就在哪裡執行的元件。這個頁面要回答的問題,比「哪個比較好」更聚焦、也更有用:這個基準什麼時候會不夠好?
基準線,以防你忘了它有多好
Whisper Large v3 Turbo 值得成為預設,所以先說明支持它的理由:
• 它可在任何地方運行 — MIT 授權、開放權重,可安裝於筆電、單一 GPU 或 Serverless 函式。無供應商依賴、無計量收費、資料不會離開您的網路。
• 它很快——蒸餾解碼器(32 個編碼器層、4 個解碼器層,從 32 層縮減)使其在典型硬體上大約比 Whisper Large-v3 快四倍,在某些硬體上甚至更快,同時保留了大部分準確度。OpenAI 自己的數據是在 A100 上約快八倍。
• 它涵蓋 99 種語言的轉錄,比 Gemini 3.5 Transcribe 的 85+ 更廣泛。
• 其準確度已有充分紀錄:在 LibriSpeech test-clean 上 WER 為 2.1%,test-other 為 4.2%,Common Voice 英語為 9.1% —— 這些數字多年來已在社群中獲得重現。
• 這個生態系統非常龐大——faster-whisper、whisper.cpp、ONNX 匯出,以及你已經在使用的各種推論框架。只要能執行模型,就能執行這一個。

對於英語及近似英語的大規模批次轉錄,Whisper Large v3 Turbo 之所以是現行首選,出於結構性原因,這是任何基準測試差距都難以輕易扭轉的:它免費、它屬於你、而且它無所不在。

Gemini 3.5 Transcribe 在原有基礎上新增的內容
受管理的挑戰者的價值,不在於它在純淨英語上擊敗了基準——那是一場連數字都還無法妥善解決的戰鬥。它的價值在於文字之上所進行的那些工作,而 Whisper 明確地不做這些事:
• 說話者歸屬 — 基礎模型最多可辨識三位說話者,並提供詞級時間戳。Whisper 轉錄單一語音串流;它沒有區分說話者的概念。
• 智慧格式化 — 移除不流暢處、處理自我修正、套用標點符號與大小寫。Whisper 回傳的是實際說出的話語,包括「嗯」之類的語氣詞。
• 自訂詞彙 — 偏向術語和特殊拼寫。Whisper 沒有這種機制;你需要後處理或微調。
• 函式呼叫 — 轉錄內容可交接給其他 Gemini 模型,使轉錄成為代理管線中的一個步驟,而非最終輸出。
• 長時段處理 — 單次處理約一小時的音訊(據媒體報導為 96K 上下文),對照 Whisper 在實務上需分割並拼接長檔案的需求。
那是不同的產品。這正是Google所謂的「智慧轉錄」,也是這項比較中不依賴基準測試計算的部分。
至今尚無人能明確回答的準確性問題
這兩個模型的頭條數字實際上並未正面交鋒。Gemini 3.5 Transcribe 的 2.6% 非串流 WER,是 Google 引用的 Artificial Analysis 評測結果,涵蓋 85 種以上語言;Whisper Large v3 Turbo 的 2.1% LibriSpeech test-clean,則是 OpenAI 自家蒸餾論文中的英文基準,且已被廣泛複現。兩者語料庫不同、語言覆蓋不同、供應商也不同。可以誠實說的是:在乾淨的英文語音上,開源基線與受管挑戰者大致落在同一水平;而受管模型的優勢在於其多語言與結構性功能,並非已獲證實的英文 WER 勝績。Google 的發布資料中沒有與 Whisper 系列模型的正面對比,且由於 Gemini 3.5 Transcribe 才公開一天,目前也不存在獨立的對抗性比較。在這樣的比較出現之前,準確度王座無人認領;任何宣稱這兩個數字能定出 WER 贏家的文章——包括本文——都是言過其實。

費用:免費執行,相較於每分鐘 $0.005
Whisper Large v3 Turbo 有硬體成本,但沒有計量收費。如果你在自己既有的 GPU 上執行,每轉錄一分鐘的邊際成本接近零;如果租用 GPU,成本就是運作期間的執行個體費用。Gemini 3.5 Transcribe 對混合音訊的收費約為每分鐘 0.005 美元,即時 SKU 約每分鐘 0.009 美元,並提供免費額度。若處理一千小時的音訊,在 Gemini 計費表上大約是 300 美元,而在開放基準上只需幾美元的 GPU 時間。這個差距才是這場對決真正的成本故事,也是為什麼開放基準在大量英文批次處理工作中,能長時間維持其預設地位的原因。受管模型的經濟效益,只有在它所捆綁的功能——說話者分離、格式整理、詞彙控制——若你要在 Whisper 之上自行組裝,會耗費工程時間時,才會拉近差距。
語言與串流
Whisper Large v3 Turbo 列出 99 種語言,而 Gemini 則有 85+ 種,但實際的多語言表現卻不同:Whisper 能單次處理全部 99 種語言的轉錄,不需自動偵測,且其準確度在低資源和噪音較多的語言上下降最多——這是蒸餾模型的取捨。Gemini 會在其 85+ 種語言中自動偵測,Google 也強調對地區口音和方言的支援。在串流方面,Whisper 沒有原生的即時模型;即時部署通常使用 faster-whisper 或類似框架,並運行在你自己的硬體上,而 Gemini 3.5 Transcribe 則提供專為即時設計的端點,宣稱具亞秒級延遲,價格也相應較高。如果你的工作負載是即時且多語言的,受管端點較易操作;若是批次且僅需英文,開源基礎方案則更便宜。
判決,不過如此
Whisper Large v3 Turbo 仍然是大規模英文批次轉錄的正確預設首選,也適用於任何必須在自己基礎設施上運行的任務,以及想要一個凍結、可稽核產物的團隊。當你需要的轉錄結果不只是一串文字——包括說話者標籤、整潔的格式、領域詞彙、多語言涵蓋,或一個代理程式掛鉤(agent hook)——而且你願意為這些功能按表付費時,Gemini 3.5 Transcribe 才是正確的選擇。兩者可以並存,而讓這種並存成本低廉的模式是一條路由邊界:先選擇適合該音訊的轉錄器,再由 LLM 層決定文字接下來要如何處理。OrcaRouter 操作的正是這一層——一個 API 串接 200+ 模型、跨供應商自動容錯移轉,以及一套路由 DSL,讓你把多個模型組合成單一呼叫。這兩個語音模型都不是由我們代管;轉錄的選擇就在你的 GPU 與 Google 的計費表之間,而兩者在未來很長一段時間內都還會繼續存在。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
