「Gemini 3.5 Transcribe 對比 Whisper Large v3 Turbo」的主視覺標題卡片,副標題為「基準需要被取代嗎?」,左側顯示標示為 Gemini 3.5 Transcribe 的託管 API 卡片(非串流 WER 2.6%);右側顯示標示為 Whisper Large v3 Turbo 的開放權重卡片(LibriSpeech clean 2.1%,附 MIT 徽章與 809M 標籤),右下角為 OrcaRouter 標誌。
Guides & Insights

Gemini 3.5 Transcribe 與 Whisper Large v3 Turbo:基準需要更換嗎?

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Whisper Large v3 Turbo 是業界很大一部分在提到「語音轉文字」時預設會想到的模型,而 Gemini 3.​5 Transcribe 是第一個明確作為該基準挑戰者、而非通用語音 API 推出的 Go​ogle 轉錄模型。自 2026 年 8 月 26 日起公開預覽的 Gemini 3.​5 Transcribe 將轉錄重新定義為一項推理任務——它會自行處理自我修正、格式化輸出、標示說話者,並自行呼叫其他 G​emini 模型。Whisper Large v3 Turbo 是 Ope​nAI 以 8.09 億參數從 Whisper Large-v3 蒸餾而來的版本,採用 MIT 授權、可自架、支援 99 種語言,視硬體而定,速度約為被蒸餾原始模型的四到八倍。前者是覆蓋在音訊上的受管智慧層;後者則是一個免費、廣為人知、想在哪裡執行就在哪裡執行的元件。這個頁面要回答的問題,比「哪個比較好」更聚焦、也更有用:這個基準什麼時候會不夠好?

基準線,以防你忘了它有多好

Whisper Large v3 Turbo 值得成為預設,所以先說明支持它的理由:

• 它可在任何地方運行 — MIT 授權、開放權重,可安裝於筆電、單一 GPU 或 Serverless 函式。無供應商依賴、無計量收費、資料不會離開您的網路。

• 它很快——蒸餾解碼器(32 個編碼器層、4 個解碼器層,從 32 層縮減)使其在典型硬體上大約比 Whisper Large-v3 快四倍,在某些硬體上甚至更快,同時保留了大部分準確度。OpenAI 自己的數據是在 A100 上約快八倍。

• 它涵蓋 99 種語言的轉錄,比 Gemini 3.5 Transcribe 的 85+ 更廣泛。

• 其準確度已有充分紀錄:在 LibriSpeech test-clean 上 WER 為 2.1%,test-other 為 4.2%,Common Voice 英語為 9.1% —— 這些數字多年來已在社群中獲得重現。

• 這個生態系統非常龐大——faster-whisper、whisper.cpp、ONNX 匯出,以及你已經在使用的各種推論框架。只要能執行模型,就能執行這一個。

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

對於英語及近似英語的大規模批次轉錄,Whisper Large v3 Turbo 之所以是現行首選,出於結構性原因,這是任何基準測試差距都難以輕易扭轉的:它免費、它屬於你、而且它無所不在。

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Gemini 3.5 Transcribe 在原有基礎上新增的內容

受管理的挑戰者的價值,不在於它在純淨英語上擊敗了基準——那是一場連數字都還無法妥善解決的戰鬥。它的價值在於文字之上所進行的那些工作,而 Whisper 明確地不做這些事:

• 說話者歸屬 — 基礎模型最多可辨識三位說話者,並提供詞級時間戳。Whisper 轉錄單一語音串流;它沒有區分說話者的概念。

• 智慧格式化 — 移除不流暢處、處理自我修正、套用標點符號與大小寫。Whisper 回傳的是實際說出的話語,包括「嗯」之類的語氣詞。

• 自訂詞彙 — 偏向術語和特殊拼寫。Whisper 沒有這種機制;你需要後處理或微調。

• 函式呼叫 — 轉錄內容可交接給其他 Gemini 模型,使轉錄成為代理管線中的一個步驟,而非最終輸出。

• 長時段處理 — 單次處理約一小時的音訊(據媒體報導為 96K 上下文),對照 Whisper 在實務上需分割並拼接長檔案的需求。

那是不同的產品。這正是Go​ogle所謂的「智慧轉錄」,也是這項比較中不依賴基準測試計算的部分。

至今尚無人能明確回答的準確性問題

這兩個模型的頭條數字實際上並未正面交鋒。Gemini 3.​5 Transcribe 的 2.6% 非串流 WER,是 Go​ogle 引用的 Artificial Analysis 評測結果,涵蓋 85 種以上語言;Whisper Large v3 Turbo 的 2.1% LibriSpeech test-clean,則是 Ope​nAI 自家蒸餾論文中的英文基準,且已被廣泛複現。兩者語料庫不同、語言覆蓋不同、供應商也不同。可以誠實說的是:在乾淨的英文語音上,開源基線與受管挑戰者大致落在同一水平;而受管模型的優勢在於其多語言與結構性功能,並非已獲證實的英文 WER 勝績。Go​ogle 的發布資料中沒有與 Whisper 系列模型的正面對比,且由於 Gemini 3.​5 Transcribe 才公開一天,目前也不存在獨立的對抗性比較。在這樣的比較出現之前,準確度王座無人認領;任何宣稱這兩個數字能定出 WER 贏家的文章——包括本文——都是言過其實。

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

費用:免費執行,相較於每分鐘 $0.005

Whisper Large v3 Turbo 有硬體成本,但沒有計量收費。如果你在自己既有的 GPU 上執行,每轉錄一分鐘的邊際成本接近零;如果租用 GPU,成本就是運作期間的執行個體費用。Gemini 3.5 Transcribe 對混合音訊的收費約為每分鐘 0.005 美元,即時 SKU 約每分鐘 0.009 美元,並提供免費額度。若處理一千小時的音訊,在 Gemini 計費表上大約是 300 美元,而在開放基準上只需幾美元的 GPU 時間。這個差距才是這場對決真正的成本故事,也是為什麼開放基準在大量英文批次處理工作中,能長時間維持其預設地位的原因。受管模型的經濟效益,只有在它所捆綁的功能——說話者分離、格式整理、詞彙控制——若你要在 Whisper 之上自行組裝,會耗費工程時間時,才會拉近差距。

語言與串流

Whisper Large v3 Turbo 列出 99 種語言,而 G​emini 則有 85+ 種,但實際的多語言表現卻不同:Whisper 能單次處理全部 99 種語言的轉錄,不需自動偵測,且其準確度在低資源和噪音較多的語言上下降最多——這是蒸餾模型的取捨。G​emini 會在其 85+ 種語言中自動偵測,Go​ogle 也強調對地區口音和方言的支援。在串流方面,Whisper 沒有原生的即時模型;即時部署通常使用 faster-whisper 或類似框架,並運行在你自己的硬體上,而 G​emini 3.​5 Transcribe 則提供專為即時設計的端點,宣稱具亞秒級延遲,價格也相應較高。如果你的工作負載是即時且多語言的,受管端點較易操作;若是批次且僅需英文,開源基礎方案則更便宜。

判決,不過如此

Whisper Large v3 Turbo 仍然是大規模英文批次轉錄的正確預設首選,也適用於任何必須在自己基礎設施上運行的任務,以及想要一個凍結、可稽核產物的團隊。當你需要的轉錄結果不只是一串文字——包括說話者標籤、整潔的格式、領域詞彙、多語言涵蓋,或一個代理程式掛鉤(agent hook)——而且你願意為這些功能按表付費時,Gemini 3.5 Transcribe 才是正確的選擇。兩者可以並存,而讓這種並存成本低廉的模式是一條路由邊界:先選擇適合該音訊的轉錄器,再由 LLM 層決定文字接下來要如何處理。OrcaRouter 操作的正是這一層——一個 API 串接 200+ 模型、跨供應商自動容錯移轉,以及一套路由 DSL,讓你把多個模型組合成單一呼叫。這兩個語音模型都不是由我們代管;轉錄的選擇就在你的 GPU 與 Google 的計費表之間,而兩者在未來很長一段時間內都還會繼續存在。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube