記事のヒーローカードは「Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo」と表示され、バッジは「モデル比較」、サブタイトルは「無料のベースラインが依然として優れている点」で、チップには「2.7% vs 4.07% WER」「1時間あたり$0.20 vs MITのウェイト」「0.49秒 vs 1~5秒(セルフホスト)」「マネージド vs 自社所有」と表示され、白から青へのグラデーション上に、右下にOrcaRouterのロゴが配置されている。
Guides & Insights

Grok Voice Transcribe 2.0 対 Whisper Large v3 Turbo:無料ベースラインが依然として優れている点

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Whisper Large v3 Turbo は、2024年10月1日にMITライセンスの下でリリースされて以来、「文字起こしが必要だ」という要望に対する既定の答えであり続けており、Grok Voice Transcribe 2.0 の登場によってその理由が変わることは何もない。SpaceXAIの新モデルは2026年9月18日に提供開始され、文字起こし性能は明らかに大幅に優れている — Artificial AnalysisのAA-WER Streamingボードで、最終文字起こしの単語誤り率は2.7%、最初の部分結果では3.4%であり、一方Whisperファミリーの数値は非ストリーミングボードで4.07%、Turbo自体は通常、蒸留元であるフルLarge v3より0.数ポイント劣る。また、バッチでは音声1時間あたり0.10ドル、ストリーミングでは1時間あたり0.20ドルで提供されている。Whisper Large v3 Turboは8億900万パラメータの1.6 GBファイルで、自分のハードウェア上で動作し、利用量の計測もなく、音声をどこにも送信せず、レート制限も、同時実行数の上限も、非推奨化の予定もない。比較は、より優れたモデルとより劣るモデルの間のものではない。精度を借りることと、コンポーネントを所有することの間のものである。

32秒のウィンドウこそがアーキテクチャのすべてだ

Whisper Large v3 Turbo は、すべての Whisper モデルの構造を引き継いでいます。音声は固定の 30 秒ウィンドウで処理され、エンコーダーはウィンドウごとに 1 回実行され、デコーダーはそのチャンクのテキストを出力します。Turbo はそれをより安価にしました — デコーダー層は 32 ではなく 4 で、Large v3 より約 8 倍高速、VRAM は 10 GB ではなく約 6 GB — しかし、その形は変わりませんでした。モデル内部には「ここまでの文」という概念はありません。ウィンドウをまたいだ永続的な状態が存在しないからです。

その単一の設計上の事実が、後続のすべてを説明する。ネイティブなストリーミングは存在しない。なぜなら、ストリーミングは発話の途中で部分的な出力を確定することを必要とするが、モデルにはその仕組みがないからだ。リアルタイムのWhisperデプロイは存在するが、それはチャンク分割と音声アクティビティ検出、そして誰かが書いて今も保守しているつなぎ合わせ層であり、そのパイプラインから生じるレイテンシは、Grok Voice Transcribe 2.0が達成する0.5秒ではなく、秒単位で測られる。話者ダイアライゼーションは存在しない。なぜなら、ダイアライゼーションは、何が言われたかではなく誰が話しているかに関する別個の問題だからだ。そしてTurboバリアントは特にプレーンテキストを返す——タイムスタンプも、信頼度スコアも、話された数字やメールアドレスを書き言葉の形式に変換する逆テキスト正規化もない。

Grok Voice Transcribe 2.0 は逆の方向で構築された。ストリーミングが主要なトランスポートであり、バッチは同じ重みを REST エンドポイントの背後に置いたもので、機能一覧は Whisper がアプリケーション側に任せていたもののリストのように読める。単語ごとの信頼度を伴う単語レベルのタイムスタンプ、追加コストなしで含まれる話者ダイアライゼーション、最大 8 つの独立チャネルにわたるマルチチャネル文字起こし、リクエストごとに最大 100 のドメイン用語を指定できるキータームバイアス、25 言語にわたる逆テキスト正規化、フィラーワード除去、音声エージェント向けの Smart Turn によるターン終了検出。Whisper の周辺でチャンク化とスティッチングのパイプラインを保守してきたなら、そのリストはあなたが書いたコードの説明そのものだ。

精度のギャップ、そしてそれが見た目より小さい理由

• 最終トランスクリプト精度(ストリーミング) — Grok Voice Transcribe 2.0 は AA-WER Streaming で WER 2.7% である一方、Whisper Large v3 Turbo はエントリなし。これは、同モデルがネイティブにストリーミングできないため

• バッチ精度 — Grok Voice Transcribe 2.0 は Artificial Analysis の非ストリーミングボード上で 2.29% の AA-WER に対し、Whisper Large v3 は 4.07% であり、独立したテストでは Turbo は通常フル Large v3 より 0.4~0.6 ポイント後れを取っています

• クリーンな英語音声 — Whisper Large v3 TurboはLibriSpeech test-cleanで約2.1%のWER、test-otherで約4.2%を達成するため、スタジオ品質の音声では最先端APIとの差はほとんどなくなる

• 実環境の音声 — 同じ独立系ベンチマークでは、Turbo は2話者のビジネス通話で約4.6%、ノイズのある音声で8~12%となり、ここでフロンティアモデルとの差が開きます

• バッチスループット — Grok Voice Transcribe 2.0 は単体のそこそこのコンシューマーGPU上でおよそリアルタイムの162倍、Whisper Large v3 Turbo はおよそ80倍で、より高速なサービングハードウェアではその数倍に達する

• ストリーミングレイテンシ — Grok Voice Transcribe 2.0 では最初の部分結果まで0.49秒、一方、セルフホスト型 Whisper ストリーミングパイプラインでは1~5秒。これはモデルの能力ではなく、グルーコードと VAD によるもの

そのリストを正直に読み解けば、支払うことの精度面の根拠は本物だが、条件付きだということになる。クリーンで単一話者、録音状態のよい英語では、Whisper Large v3 Turboは十分に近く、その差が結果を変えることはほとんどない。8 kHzのテレフォニー、雑音の多いコールセンター音声、アクセントのある発話、短いドメイン固有フレーズ——SpaceXAIが2.0をチューニングする相手とした、まさにそのデータセットで、同社自身の報告値はテレフォニーで10.6%から7.1%へ、短い多言語コマンドで20.6%から6.8%へと動いた——では、その隔たりは、ルーティングに使える文字起こしと、読まなければならない文字起こしの違いになる。これらは自社音声についての会社報告の数値であり、SpaceXAIの外部では誰も再現しておらず、それが指し示す方向は、劣化音声に対するWhisperのあらゆる独立テストと一致している。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

コスト比較は$0.10対$0ではありません

Whisperのライセンスは無料だが、実行にはコストがかかる。1.6 GBのモデルを6 GBのVRAMに収め、約80倍速で文字起こしするGPUインスタンスこそが実際のコスト項目であり、一般的なクラウドGPU料金では、継続的なワークロードにおいて、ホスト型APIとほぼ同じ桁の費用になる。ただし重要な例外として、音声が流れていようといまいと、容量に対して支払うことになる。ホスト型Whisperエンドポイントは、安いもので1,000分あたり$1.20未満から数ドルまで、幅広い価格帯で存在しており、そのばらつきは、「Whisper」がモデルであり、サービスレベルではないことを思い出させる有用な指標だ。Artificial Analysisの正規化価格表では、最も安いホスト型Whisper Large v3エンドポイントが1,000分あたり$0.50と$1.15であり、どちらもGrok Voice Transcribe 2.0のバッチ料金$1.67を下回るが、しかし、これらのエンドポイントはどちらもあなたのものではなく、どちらも他人のレート制限と保持ポリシーが付いている。

セルフホスティングが完全に有利になるのは、負荷が断続的に急増する大量処理の場合だ。1万時間分のメディアアーカイブは、1週間で処理しようと1年で処理しようと、自分のGPU上ではコストが同じで、判断している間も時間単位のメーターは動かない。音声を絶対にネットワーク外へ送ってはならないコンプライアンスパイプラインには、どんな価格でもホスト型の代替手段は存在しない。その要件は金銭的というよりアーキテクチャ上のものだからだ。そしてファインチューニングは、重みを保持している場合にのみ利用できる。WhisperのMITライセンスにより、809Mパラメータのモデルを入手して、単一の話者、単一のアクセント、あるいは狭い分野の語彙に適応させられる。これは、どの価格帯のAPIも公開していない能力だ。

裏返しの構図は、ホスト型モデルの価格があなたの足元で動きうるということだ。SpaceXAIは1.0から2.0へ移行した際に料金を据え置いた——価格そのままのモデル改善——そしてMicrosoftのMAI-Transcribe-2は音声1時間あたり同一の$0.10で登場し、これがフロンティアの下限がどこにあるかを教えてくれる。OrcaRouter経由でルーティングすれば、それらのリスト価格は0%のマークアップでそのまま通過するので、ベンダーの値下げは再価格設定サイクルを経た後ではなく、それが起きた当日にあなたの請求に届く。それはこの比較におけるレンタル側の真の利点であり、無料側はそもそも請求書を一切送ってこないという事実と天秤にかける価値がある。

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

それぞれが実際に何のためのものか

音声がすでにファイルになっていて、音量が大きいか不規則で、録音がそれなりにクリーンであり、データをネットワーク外に出せない、または予算が時間単位の課金に対応できない場合は、Whisper Large v3 Turbo を維持してください。オフラインアーカイブ、1.6 GB のモデルを量子化すれば収まるエッジやオンデバイスの文字起こし、レイテンシではなくスループットが制約となるバッチパイプライン、そして自分の音声でファインチューニングすることが必要な精度への道であるあらゆるプロジェクトにとって、依然として正しい選択です。それを取り巻くツール群 — エッジ向けの whisper.cpp、本番向けの faster-whisper、メモリ制約向けの GGUF ビルド — には 2 年間のコミュニティによる堅牢化の蓄積があり、これは生まれて 2 日の API にはない信頼性の一形態です。

Grok Voice Transcribe 2.0 への移行が適しているのは、音声がまだ届いている最中、録音が劣化しているとき、誰がいつ話したかを知る必要があるとき、ドメイン語彙をファインチューニングではなくバイアスで調整しなければならないとき、あるいは話者が話し終える前にアプリケーションが部分的な文字起こしに基づいて動作するときです。アップグレードの道筋は、既存の統合ではパラメータが1つ増えるだけで、うまくいかなければ 1.0 にピン留めして戻せるため、試すのは安く済みます。ただし、逆方向の移行は安く済まない点には注意が必要です。話者分離と発話ターン検出を備えたストリーミング API 向けに書かれたコードは、プレーンテキストを返すバッチモデルへと優雅に縮退するわけではなく、これはパイプラインを本格採用する前に、実際の音声の一部でホスト型の経路を検証しておくべき根拠となります。

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

実際に意思決定が行われる場所

Whisperをどの規模であれ運用しているチームのほとんどは、この2つのモデルのどちらかを選んでいるのではなく、ハイブリッド構成を取っています。アーカイブ用途にはWhisperを、無料でクリーンな音声なら十分な精度があるからです。ライブ経路にはフロンティアAPIを、部分WER 3.4%でストリーミングできるものは他にないからです。そして下流には3つ目のモデルを置き、出力されたテキストを要約したり分類したり、それに基づいて処理を行います。大抵の場合はこの3つ目のステップで構成が肥大化します——推論モデル用に2つ目のベンダー契約、2セット目の認証情報、監視すべき2つ目のレート制限。OrcaRouterはそのレイヤーを畳み込みます。200以上のモデルにまたがる1つのキー、プロバイダーが劣化した際の自動フェイルオーバー、そして同じ文字起こしを複数のモデルに通して比較してから選びたい場合のためのルーティングDSLです。文字起こしの呼び出し自体は、選んだベンダーにそのまま送られます。増え続けるのをやめるのは、その後に続くすべてです。

Whisper側で注目すべきは、新しいチェックポイントではない——このファミリーはTurbo以降動いておらず、OpenAIの関心はGPT Transcribe系へ移っている。そうではなく、注目すべきはサービング層だ。セルフホスト型のツールは年々速くなり、必要なハードウェアは年々小さくなっており、そこでの改善のたびに、時間単位で支払う理由は狭まっていく。SpaceXAI側で注目すべきはデフォルトの切り替えだ。2.0がデフォルトになり1.0が非推奨になれば、モデルを一切指定していなかったすべての統合が、レイテンシも含めて一斉に移行する。どちらの進展も、根本的な分離を変えるものではない。自分で所有して調整するモデルが1つ、借りて呼び出すモデルが1つ、そして正直な答えは、ほとんどのプロダクションスタックが最終的に両方を動かすことになる、というものだ。