
Muse Voice Transcribe vs Whisper Large v3 Turbo: 無料のデフォルトがストリーミングの挑戦者と出会う
この2年の大半にわたり、Whisper Large v3 Turboは「自分たちで無料で文字起こしする」に対する既定の答えだった。そしてMetaの新しいMuse Voice Transcribeは、その既定が直面した中で最も信頼に値するストリーミング系の挑戦者だ。Whisper Large v3 TurboはOpenAIのオープンウェイト文字起こしモデルであり、8億900万パラメータ、MITライセンス、99言語に対応し、ラップトップからGPUファームまであらゆる環境でセルフホスト可能だ。ハードウェアを所有していれば実行は無料となる。Meta Superintelligence Labsが2026年9月1日にリリースしたMuse Voice Transcribeは、クローズドでホスト型のストリーミングモデルであり、料金は音声1,000分あたり3.00ドルだ。両者は精度を競うライバルではない。もっと基本的な軸で競っているのだ。つまり、文字起こしパイプラインを自前のハードウェアでバッチジョブとして実行するか、それとも他人のAPIを通じてライブ機能としてストリーミングするか、という軸である。
無料のベースライン、そしてそれがなぜ持続し続けるのか
Whisper Large v3 Turboは、Whisper Large v3の蒸留版にあたる兄弟モデルです。エンコーダは同じ32層を維持しつつ、デコーダは32層から4層に削減されています。これにより、パラメータ数は809Mに減り、GPU上での速度は約4倍に向上しながらも、精度はほぼ維持されています。重みがMITライセンスであり、モデルもワークステーションで実行できるほど小さいため、ミーティングボットから字幕ツールに至るまで、組み込み型文字起こしエンジンの標準となりました。その弱点も同様によく知られています。翻訳用には明示的に訓練されていないため、translateタスクでは性能が大幅に低下します。また、難しい音声に対する精度はばらつきがあり、コミュニティのテストではノイズの多い音声に対してWERがおよそ8〜12%です。さらに、これはバッチ処理向けのモデルです。音声ファイルを受け取って文字起こしを返すように設計されており、発話に合わせて逐次的に単語を出力するものではありません。

ストリーミングこそが本当の違いです。
これこそが勝敗を決める軸であり、その差は歴然としている。Whisper Large v3 Turboはバッチ処理向けであり、セルフホスト型のストリーミング実装では一般的に1〜5秒のレイテンシとなり、電話エージェントやライブキャプションに求められる800ミリ秒未満という基準を、大掛かりなエンジニアリングなしには満たせない。Muse Voice Transcribeはストリーミングネイティブである。音声を80ミリ秒のチャンクで取り込み、強化学習で獲得した「アダプティブディレイ」を用いて、モデルが確信を持った時点で各単語を確定し、話者が話し終えてから0.16秒後に最終的な文字起こしを完了するとされている。相手がまだ話している間に言葉が必要な製品——ライブキャプション、音声エージェント、リアルタイムの会議要約——にとって、Museが提供するのは、Whisper Turboが大量のカスタムグルーコードを積み重ねてようやく近似できるにすぎない機能である。
1時間あたり$0.18で得られるもので、無料では手に入らないもの
2つ目の構造的なギャップは機能です。Whisper Large v3 Turboが提供するのはテキストのみで、それ以外は何もありません。話者ダイアライゼーションはなく、デフォルトでは句読点や大文字化もなく、エンドポイント検出もキーワードバイアシングもありません。Whisperを基盤にした本番スタックでは、これらの部品を別々に組み立てる必要があります。ダイアライザー、句読点モデル、音声アクティビティ検出器などで、それぞれが独自の障害モードとレイテンシを追加します。Muse Voice Transcribeにはこれらが最初から組み込まれています。ストリーミングパスの一部として20以上の話者ダイアライゼーション、ターンが実際に完了したことをアプリケーションに伝えるエンドポインティング、そして言語・キーワード・コンテキストのバイアシングを備えています。複数話者のライブオーディオの場合、「無料の」Whisperは、その周りに構築して実行しなければならないダイアライゼーションやVADシステムを数えれば、決して無料ではありません。

正確さ、そして情報源は明確に
• Whisper Large v3 Turbo — LibriSpeech test-cleanではWER 2.1%、test-otherでは4.2%。Open ASRリーダーボードの複合スコアはおよそ7.7%で、フル版のLarge v3より約1ポイント劣る。コミュニティテストでのノイズの多い音声では8〜12%。これらはオープンウェイトであるため、これらの数値は音声認識分野で最も独立して再現されている。
• Muse Voice Transcribe — 発話終了後0.16秒での最終文字起こしにおけるWER 3.1%、および最初の途中結果における3.6%は、MetaがArtificial Analysisのストリーミングリーダーボードを引用して発売当日に主張した数値である。ベンダー報告に基づき、未再現であり、Whisper Turboには直接相当するものがないストリーミング経路で測定された。
この2つは現状のままでは比較できません。Whisperの数値はバッチ処理に基づくもので、ノイズの多い音声に対する弱点は文書化されています。一方、Museの数値はストリーミング処理に基づくもので、ベンダー以外による検証はまったく行われていません。公平に言えるのは、Museの主張はクリーンなストリーミング音声に関しては妥当であり、Whisperの強みは監査済みでオープンな実績——文書化された弱点も含めて——にあるということ、そして、どちらもあなたの音声と同種の音声でテストするまでは、そのような音声で信頼できる理由を与えてくれないということです。
言語: 99 vs 25 検証済み
Whisper Large v3 Turboは99言語の文字起こしに対応しています。低リソース言語や声調言語では精度が落ちます(タイ語、広東語、ウェールズ語がよく挙げられる弱点です)が、その言語リストの背後には長年にわたるコミュニティ再現の実績があります。Muse Voice Transcribeは70以上の言語でトレーニングされていますが、ローンチ時点で検証済みなのは25言語です。その差別化要因はネイティブなコードスイッチング、すなわち指示なしに文の途中で言語を切り替えられることです。今日の時点で幅広い多言語カバレッジが必要なら、Whisperの99言語のほうが安全な主張です。実際に複数の言語が混ざる会話、たとえば香港のサポート窓口やスペイン語と英語が混在する営業フロアなどを扱うなら、MuseのコードスイッチングはWhisperにはまったくない機能です。

料金:ほぼ無料 vs 従量課金
Whisper Large v3 Turbo は実行自体は無料で、コストはハードウェアのみです。faster-whisper Turbo を単一の T4 で運用する場合、GPU の相場レートで音声 1 時間あたりおよそ $0.05~$0.10 かかり、月間 100,000 分のワークロードでは GPU インフラ費用が月額およそ $400~$1,200 になる可能性があります。これはダイアライゼーションや句読点のスタックを追加する前の金額です。Muse Voice Transcribe は音声 1 時間あたり $0.18 で、全機能込み、プロビジョニング不要のハードウェアなし。1,000 時間あたり $180 です。損益分岐点は単に処理量だけの問題ではありません。オープンウェイトのスタックを実行・維持するエンジニアリング時間を重視するかどうか、そしてワークロードがライブ(セルフホストのストリーミング遅延により Whisper がまったく候補にならない可能性がある)か、バッチ(Whisper のスループットと追加 API コストがゼロという利点が生きる)かにも左右されます。
ハイブリッド構成と、それらにとってのルーティングの意味
最も一般的な実世界の構成は「どちらか」ではなく「両方」です。{{1}}高トラフィックのバッチ処理レーン向けにセルフホストのWhisper Large v3 Turbo{{/1}}、そして{{2}}Whisperが要求レイテンシでは処理できないライブの多話者トラフィック向けにマネージド型ストリーミングAPI{{/2}}を備える構成です。{{3}}この分割こそ、ルーティング層がその価値を発揮するポイントです{{/3}} — {{4}}スタック内のホスト型モデルにまたがる単一のAPI{{/4}}、{{5}}プロバイダーの定価を0%マークアップでそのまま透過適用{{/5}}、そして{{6}}プロバイダーのエンドポイントが劣化した場合にライブレーンがストリーミングを継続できるようにする自動フェイルオーバー{{/6}}を備えます。{{7}}セルフホストのWhisperインスタンスはお客様のハードウェア上に残ります{{/7}}。{{8}}ゲートウェイは、スタックの従量課金側がもう一つの統合プロジェクトにならないようにするだけです{{/8}}。
どれを選ぶべきですか
事前録音された大量の音声であり、主に英語または対応範囲の広い言語であるなら、Whisper Large v3 Turbo を選びましょう。経済性、MITライセンス、オープンな監査証跡は非の打ちどころがなく、バッチ処理ではストリーミング機能がなくても問題になりません。音声がライブで複数話者による場合、話された言葉をそのまま必要とする場合、または会話がコードスイッチングを伴う場合は、Muse Voice Transcribe を選びましょう。1時間あたり0.18ドルのストリーミング、20以上の話者分離、そしてエンドポインティング——これらがあるからこそ、無料のデフォルトに今や挑戦者が現れたのです。そして、自分のワークロードに正直に向き合えば、答えが両方であることも多いと気づくでしょう。オープンな世界とホステッドな世界は、まさにその両方を並行して運用する構成を、今では簡単に実現できるようにしているのです。
