
Gemini 3.5 Transcribe vs Whisper Large v3 Turbo:ベースラインを置き換える必要はあるか?
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
Whisper Large v3 Turboは、業界の大部分にとって「speech-to-text」という言葉がデフォルトで意味するモデルであり、Gemini 3.5 Transcribeは、一般的な音声APIとしてではなく、そのベースラインへの挑戦者として明確に位置づけられた最初のGoogle文字起こしモデルです。 Gemini 3.5 Transcribeは、2026年8月26日からパブリックプレビューで提供されており、文字起こしを推論タスクとして再定義します — 自己修正を解決し、出力を整形し、話者を割り当て、他のGeminiモデルを自ら呼び出します。 Whisper Large v3 Turboは、OpenAIによるWhisper Large-v3の8億900万パラメータの蒸留版であり、MITライセンス、セルフホスト可能、99言語対応、ハードウェアに応じて元のモデルの約4〜8倍高速です。 一方は音声に対するマネージドなインテリジェンス層であり、もう一方は無料でよく理解された、好きな場所で実行できるコンポーネントです。 このページが答えようとしている問いは、「どちらが優れているか」よりも狭く、より有用です。すなわち、ベースラインがいつ十分でなくなるのか、ということです。
その良さを忘れてしまった場合に備えて、これがベースラインです。
Whisper Large v3 Turbo はデフォルトとしての地位にふさわしい。そこで、まずその根拠を述べる:
• どこでも動作します — MITライセンス、オープンウェイト、ラップトップ、単一GPU、またはサーバーレス関数にインストール可能。ベンダーもメーターもなく、データがネットワーク外に出ることもありません。
• 高速です — 蒸留デコーダ(エンコーダ32層、デコーダは32層から4層に削減)により、一般的なハードウェアではWhisper Large-v3よりも約4倍高速で、条件によってはそれ以上、しかも精度の大部分を維持します。OpenAI自身の数値では、A100上で約8倍です。
「{{1}}99言語{{/1}}の文字起こしに対応しており、{{2}}Gemini 3.5 Transcribeの{{/2}}85以上よりも広いリストです。」
その精度は広く文書化されています。LibriSpeech test-cleanでWER 2.1%、test-otherで4.2%、Common Voice英語で9.1%——これらの数値は、長年にわたりコミュニティ全体で再現されてきたものです。
エコシステムは巨大です — faster-whisper、whisper.cpp、ONNXエクスポート、そしてあなたがすでに使っているあらゆる推論フレームワーク。{{1}}モデルを実行できるなら、このモデルも実行できます。{{/1}}

大規模な英語およびニア英語のバッチ文字起こしにおいて、Whisper Large v3 Turboは構造的な理由から現行標準であり、ベンチマークギャップが簡単に覆すことはできない。それは無料であり、あなたのものであり、どこにでもあるからだ。

Gemini 3.5 Transcribe がさらに追加するもの
マネージドチャレンジャーの価値は、きれいな英語でベースラインを上回ることにあるのではない——それは数字だけではまだきれいに決着できない戦いだ。その価値は、Whisperが明示的に行わない、言葉の上で行われる仕事にある。
• 話者属性 — ベースモデルでは、単語レベルのタイムスタンプ付きで最大3話者まで対応。Whisperは単一の音声ストリームを書き起こすもので、誰が何を言ったかという概念はありません。
• インテリジェントな整形 — 言い淀みを除去し、言い直しを修正し、句読点と大文字小文字を適用します。Whisperは話された言葉をそのまま返します。「あー」「えーと」もすべて含めて。
• カスタム語彙 — 専門用語や特殊な綴りに偏りがち。Whisperにはそのような仕組みはないため、後処理またはファインチューニングを行う必要がある。
• 関数呼び出し — 文字起こし結果を他のGeminiモデルに引き渡すことができ、文字起こしを最終出力ではなくエージェントパイプラインの一ステップにすることができます。
• 長時間のセッション — 1回のパスで約1時間の音声(報道では96Kコンテキスト)に対し、Whisperは長いファイルをチャンク分割してつなぎ合わせる必要がある。
それは別の製品です。それは、Googleが「インテリジェント文字起こし」と呼んでいるものであり、比較のうちベンチマーク計算に依存しない部分です。
まだ誰も明確に答えられない精度の問題
{{1}}この2つのモデルの見出しとなる数値は、実際には正面から比較したものではありません。{{/1}} {{2}}Gemini 3.5 Transcribeの2.6%という非ストリーミングWERは、Googleが引用したArtificial Analysisの測定結果であり、85以上の言語を対象に算出されたものです。{{/2}} {{3}}Whisper Large v3 Turboの2.1%というLibriSpeech test-cleanの数値は、OpenAI自身の蒸留論文に由来する英語ベンチマークであり、広く再現されています。{{/3}} {{4}}コーパスも、言語のカバー範囲も、ベンダーも異なります。{{/4}} {{5}}正直に言えることは、クリーンな英語において、オープンなベースラインとマネージド型の挑戦者はおそらく同等の水準にあり、マネージドモデルの強みは多言語対応や構造的特徴にあるのであって、実証された英語WERでの勝利ではないということです。{{/5}} {{6}}Googleの発表資料にはWhisper系モデルとの直接比較は含まれておらず、Gemini 3.5 Transcribeが公開されてからまだ1日しか経っていないため、独立した対抗比較もまだ存在しません。{{/6}} {{7}}そのような比較が登場するまで、精度の王座は誰のものでもなく、この2つの数値からWERの勝者を断定する記事は、本記事も含めて、過剰な主張です。{{/7}}

コスト:実行は無料(1分あたり$0.005に対して)
Whisper Large v3 Turboは、ハードウェアコストがかかるがメーター制ではない。既に所有しているGPUで実行すれば、文字起こし1分あたりの限界費用はほぼゼロだ。GPUをレンタルする場合は、動作中にかかるインスタンス費用がそのままかかる。Gemini 3.5 Transcribeの従量課金は、音声1分あたり平均で約0.005ドル。ライブSKUは1分あたり約0.009ドルで、無料枠もある。音声1,000時間の場合、Geminiのメーターでは約300ドルになるのに対し、オープンなベースラインのGPU時間では数ドルだ。この差が今回の対決における本当のコスト面の話であり、大量の英語バッチ処理においてベースラインが長期間デフォルトの地位を維持する理由でもある。マネージドモデルのコスト差が縮まるのは、同モデルにバンドルされている機能(話者分離、フォーマット整形、語彙制御)を、Whisperの上に自前で組み立てるのにエンジニアリング時間がかかる場合だけだ。
言語とストリーミング
Whisper Large v3 Turboは{{1}}Gemini{{/1}}の85以上に対して99言語をサポートしていますが、実際の多言語対応の事情は異なります。Whisperは自動検出なしで99言語すべてを一度のパスで文字起こししますが、精度が最も低下するのは低リソース言語とノイズの多い言語です。これは蒸留モデルのトレードオフです。{{2}}Gemini{{/2}}は85以上の言語から自動検出し、{{3}}Google{{/3}}は地域のアクセントや方言を強調しています。ストリーミングに関しては、Whisperにはネイティブのリアルタイムモデルがありません。リアルタイムでの導入には、faster-whisperや同様のフレームワークを自社ハードウェアで使用します。一方、{{4}}Gemini 3.5 Transcribe{{/4}}は、サブ秒のレイテンシーを謳う専用ライブエンドポイントを備え、価格もそれに見合ったものとなっています。ワークロードがライブかつ多言語であれば、マネージドエンドポイントの方が運用は簡単です。バッチ処理で英語のみであれば、オープンなベースラインの方が安価です。
評決、といっても大したものではないが
Whisper Large v3 Turboは、大規模な英語バッチ文字起こし、自社インフラで実行する必要があるもの、そして凍結された監査可能な成果物を求めるチームにとって、依然として適切なデフォルトです。Gemini 3.5 Transcribeは、文字起こしが単なる言葉以上のものを求められる場合——話者ラベル、きれいな書式、専門用語、多言語対応、またはエージェントフックなど——そして、それらの機能に対して従量課金を支払う意思がある場合に、適切な選択です。この2つは共存し、その共存を安価にするパターンはルーティング境界です。つまり、オーディオに適合する文字起こしモデルと、その後テキストの扱いを決定するLLMレイヤーです。OrcaRouterが運営するのはまさにそのレイヤーで、200以上のモデルに対応する単一のAPI、プロバイダー間の自動フェイルオーバー、複数のモデルを1回の呼び出しに合成するためのルーティングDSLを備えています。どちらの音声モデルも当社側ではホストされていません。文字起こしの選択は、お客様のGPUとGoogleの従量課金のどちらを利用するかという選択であり、その両方が長く存在し続けるでしょう。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
