「Gemini 3.5 Transcribe vs Whisper Large v3 Turbo」のヒーロータイトルカード。サブタイトルは「ベースラインを置き換える必要があるか?」。左側には「Gemini 3.5 Transcribe」とラベル付けされたマネージドAPIカードが表示され、非ストリーミングでWER 2.6%。右側には「Whisper Large v3 Turbo」とラベル付けされたオープンウェイトカードが表示され、LibriSpeech cleanで2.1%、MITバッジと809Mタグ付き。右下隅にはOrcaRouterのロゴが配置されている。
Guides & Insights

Gemini 3.5 Transcribe vs Whisper Large v3 Turbo:ベースラインを置き換える必要はあるか?

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Whisper Large v3 Turboは、業界の大部分にとって「speech-to-text」という言葉がデフォルトで意味するモデルであり、Gemini 3.​5 Transcribeは、一般的な音声APIとしてではなく、そのベースラインへの挑戦者として明確に位置づけられた最初のGo​ogle文字起こしモデルです。 Gemini 3.​5 Transcribeは、2026年8月26日からパブリックプレビューで提供されており、文字起こしを推論タスクとして再定義します — 自己修正を解決し、出力を整形し、話者を割り当て、他のGeminiモデルを自ら呼び出します。 Whisper Large v3 Turboは、Ope​nAIによるWhisper Large-v3の8億900万パラメータの蒸留版であり、MITライセンス、セルフホスト可能、99言語対応、ハードウェアに応じて元のモデルの約4〜8倍高速です。 一方は音声に対するマネージドなインテリジェンス層であり、もう一方は無料でよく理解された、好きな場所で実行できるコンポーネントです。 このページが答えようとしている問いは、「どちらが優れているか」よりも狭く、より有用です。すなわち、ベースラインがいつ十分でなくなるのか、ということです。

その良さを忘れてしまった場合に備えて、これがベースラインです。

Whisper Large v3 Turbo はデフォルトとしての地位にふさわしい。そこで、まずその根拠を述べる:

• どこでも動作します — MITライセンス、オープンウェイト、ラップトップ、単一GPU、またはサーバーレス関数にインストール可能。ベンダーもメーターもなく、データがネットワーク外に出ることもありません。

• 高速です — 蒸留デコーダ(エンコーダ32層、デコーダは32層から4層に削減)により、一般的なハードウェアではWhisper Large-v3よりも約4倍高速で、条件によってはそれ以上、しかも精度の大部分を維持します。OpenAI自身の数値では、A100上で約8倍です。

「{{1}}99言語{{/1}}の文字起こしに対応しており、{{2}}Gemini 3.5 Transcribeの{{/2}}85以上よりも広いリストです。」

その精度は広く文書化されています。LibriSpeech test-cleanでWER 2.1%、test-otherで4.2%、Common Voice英語で9.1%——これらの数値は、長年にわたりコミュニティ全体で再現されてきたものです。

エコシステムは巨大です — faster-whisper、whisper.cpp、ONNXエクスポート、そしてあなたがすでに使っているあらゆる推論フレームワーク。{{1}}モデルを実行できるなら、このモデルも実行できます。{{/1}}

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

大規模な英語およびニア英語のバッチ文字起こしにおいて、Whisper Large v3 Turboは構造的な理由から現行標準であり、ベンチマークギャップが簡単に覆すことはできない。それは無料であり、あなたのものであり、どこにでもあるからだ。

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Gemini 3.​5 Transcribe がさらに追加するもの

マネージドチャレンジャーの価値は、きれいな英語でベースラインを上回ることにあるのではない——それは数字だけではまだきれいに決着できない戦いだ。その価値は、Whisperが明示的に行わない、言葉の上で行われる仕事にある。

• 話者属性 — ベースモデルでは、単語レベルのタイムスタンプ付きで最大3話者まで対応。Whisperは単一の音声ストリームを書き起こすもので、誰が何を言ったかという概念はありません。

• インテリジェントな整形 — 言い淀みを除去し、言い直しを修正し、句読点と大文字小文字を適用します。Whisperは話された言葉をそのまま返します。「あー」「えーと」もすべて含めて。

• カスタム語彙 — 専門用語や特殊な綴りに偏りがち。Whisperにはそのような仕組みはないため、後処理またはファインチューニングを行う必要がある。

• 関数呼び出し — 文字起こし結果を他のGeminiモデルに引き渡すことができ、文字起こしを最終出力ではなくエージェントパイプラインの一ステップにすることができます。

• 長時間のセッション — 1回のパスで約1時間の音声(報道では96Kコンテキスト)に対し、Whisperは長いファイルをチャンク分割してつなぎ合わせる必要がある。

それは別の製品です。それは、Go​ogleが「インテリジェント文字起こし」と呼んでいるものであり、比較のうちベンチマーク計算に依存しない部分です。

まだ誰も明確に答えられない精度の問題

{{1}}この2つのモデルの見出しとなる数値は、実際には正面から比較したものではありません。{{/1}} {{2}}Gemini 3.​5 Transcribeの2.6%という非ストリーミングWERは、Go​ogleが引用したArtificial Analysisの測定結果であり、85以上の言語を対象に算出されたものです。{{/2}} {{3}}Whisper Large v3 Turboの2.1%というLibriSpeech test-cleanの数値は、Ope​nAI自身の蒸留論文に由来する英語ベンチマークであり、広く再現されています。{{/3}} {{4}}コーパスも、言語のカバー範囲も、ベンダーも異なります。{{/4}} {{5}}正直に言えることは、クリーンな英語において、オープンなベースラインとマネージド型の挑戦者はおそらく同等の水準にあり、マネージドモデルの強みは多言語対応や構造的特徴にあるのであって、実証された英語WERでの勝利ではないということです。{{/5}} {{6}}Go​ogleの発表資料にはWhisper系モデルとの直接比較は含まれておらず、Gemini 3.​5 Transcribeが公開されてからまだ1日しか経っていないため、独立した対抗比較もまだ存在しません。{{/6}} {{7}}そのような比較が登場するまで、精度の王座は誰のものでもなく、この2つの数値からWERの勝者を断定する記事は、本記事も含めて、過剰な主張です。{{/7}}

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

コスト:実行は無料(1分あたり$0.005に対して)

Whisper Large v3 Turboは、ハードウェアコストがかかるがメーター制ではない。既に所有しているGPUで実行すれば、文字起こし1分あたりの限界費用はほぼゼロだ。GPUをレンタルする場合は、動作中にかかるインスタンス費用がそのままかかる。Gemini 3.5 Transcribeの従量課金は、音声1分あたり平均で約0.005ドル。ライブSKUは1分あたり約0.009ドルで、無料枠もある。音声1,000時間の場合、Geminiのメーターでは約300ドルになるのに対し、オープンなベースラインのGPU時間では数ドルだ。この差が今回の対決における本当のコスト面の話であり、大量の英語バッチ処理においてベースラインが長期間デフォルトの地位を維持する理由でもある。マネージドモデルのコスト差が縮まるのは、同モデルにバンドルされている機能(話者分離、フォーマット整形、語彙制御)を、Whisperの上に自前で組み立てるのにエンジニアリング時間がかかる場合だけだ。

言語とストリーミング

Whisper Large v3 Turboは{{1}}G​emini{{/1}}の85以上に対して99言語をサポートしていますが、実際の多言語対応の事情は異なります。Whisperは自動検出なしで99言語すべてを一度のパスで文字起こししますが、精度が最も低下するのは低リソース言語とノイズの多い言語です。これは蒸留モデルのトレードオフです。{{2}}G​emini{{/2}}は85以上の言語から自動検出し、{{3}}Go​ogle{{/3}}は地域のアクセントや方言を強調しています。ストリーミングに関しては、Whisperにはネイティブのリアルタイムモデルがありません。リアルタイムでの導入には、faster-whisperや同様のフレームワークを自社ハードウェアで使用します。一方、{{4}}Gemini 3.​5 Transcribe{{/4}}は、サブ秒のレイテンシーを謳う専用ライブエンドポイントを備え、価格もそれに見合ったものとなっています。ワークロードがライブかつ多言語であれば、マネージドエンドポイントの方が運用は簡単です。バッチ処理で英語のみであれば、オープンなベースラインの方が安価です。

評決、といっても大したものではないが

Whisper Large v3 Turboは、大規模な英語バッチ文字起こし、自社インフラで実行する必要があるもの、そして凍結された監査可能な成果物を求めるチームにとって、依然として適切なデフォルトです。Gemini 3.5 Transcribeは、文字起こしが単なる言葉以上のものを求められる場合——話者ラベル、きれいな書式、専門用語、多言語対応、またはエージェントフックなど——そして、それらの機能に対して従量課金を支払う意思がある場合に、適切な選択です。この2つは共存し、その共存を安価にするパターンはルーティング境界です。つまり、オーディオに適合する文字起こしモデルと、その後テキストの扱いを決定するLLMレイヤーです。OrcaRouterが運営するのはまさにそのレイヤーで、200以上のモデルに対応する単一のAPI、プロバイダー間の自動フェイルオーバー、複数のモデルを1回の呼び出しに合成するためのルーティングDSLを備えています。どちらの音声モデルも当社側ではホストされていません。文字起こしの選択は、お客様のGPUとGoogleの従量課金のどちらを利用するかという選択であり、その両方が長く存在し続けるでしょう。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube