
VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo:Microsoftのストリーミングチェックポイントがオープンウェイトのデフォルトに加えるもの
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
この2年間のほとんどにおいて、「自分たちで安く文字起こしする」という問いへの答えは、Whisper Large v3 Turboだった。OpenAIによる8億900万パラメータのオープンウェイトモデルであり、MITライセンス、99言語対応、ワークステーション上で動作するほど小型で、ハードウェアを所有していれば無料である。2026年9月2日、Microsoft Researchはその既定路線に挑戦者をアップロードした。VibeVoice-ASR-Streaming-7Bだ。Hugging Face上にあるMITライセンスのストリーミングチェックポイントで、音声が届くと同時に文字起こしを行い、話者属性付きの出力を謳っている。そして、多くのチームがすでに運用しているモデルとは異なり、バッチジョブとして設計されたことは一度もない。両モデルとも大手研究所によるオープンウェイトである。それ以外のほとんどすべてはトレードオフであり、このページは、あなたが実際にどちらのトレードをしているのかについてのものである。
この比較全体を左右する非対称性が一つあるため、それを最初に述べる。Whisper Large v3 Turbo は、世界で最も独立に再現されている音声モデルである。そのワードエラー数値は、何年にもわたって何千ものチームが公開ベンチマークと自社の音声で再実行しており、その弱点も強みと同様に文書化されている。VibeVoice-ASR-Streaming-7B は登場から1日しか経っておらず、どこにも独立したベンチマークがなく、Microsoft もストリーミングのワードエラー率を読み取り可能なテキストで公開していない。以下の Microsoft 側の記載はすべて、リポジトリ(設定、モデルカード、Microsoft のストリーミングドキュメント)から読み取ったものであり、その旨を明記している。
オープンウェイトのデフォルト、そしてそれがなぜ永続するのか
Whisper Large v3 Turboは、Whisper Large v3の蒸留版にあたる兄弟モデルです。32層のエンコーダーは維持しつつ、デコーダーを32層から4層に削減することで、パラメータ数は809Mにまで減り、GPU上でのスループットはおよそ4倍に向上しながらも、精度はそれに近い水準を保っています。重みがMITライセンスで公開され、モデルも小さいことから、ミーティングボット、字幕ツール、通話記録パイプライン向けの組み込み型文字起こしエンジンの標準的な選択肢となりました。その限界も広く知られています。これはバッチモデルであり、音声ファイルを受け取って書き起こしテキストを返す方式で、発話に合わせて単語をリアルタイムに生成するものではありません。翻訳用には訓練されておらず、翻訳タスクでは品質が大幅に劣化します。ノイズの多い音声、なまりのある発音、または重なり合った発話に対する精度は安定せず、返されるのは平文のみです。このバリアントには、既定では句読点や大文字化がなく、話者ダイアリゼーションも、タイムスタンプも、キーワードバイアシングもありません。Whisperを基盤にした本番システムでは、これらの要素をそれぞれ別途組み込むことになり、そのたびに独自のレイテンシと障害モードが追加されることになります。

仕様ギャップ
パラメータ — 蒸留デコーダーは809M、それに対しこちらは合計約9B(Qwen2-7B言語バックボーンに音声エンコーダーを加えた構成)。「7B」はLLMをカウントした数値で、Hugging Faceのページには9Bと記載されている。
• ライセンス — MIT、オープンウェイト、その両方。
• ストリーミング — 設計上はバッチ処理:セルフホスト型のストリーミング実装は通常、1〜5秒の遅延になるのに対し、ストリーミングネイティブでは約2.9秒のチャンクを約0.5秒の先読みで処理し、チャンクごとにテキストを出力、コンテキストはKVキャッシュに保持される。
• 言語 — 長年にわたりコミュニティによる再現が行われてきた99言語 vs 公式に宣言された10言語(en, zh, es, pt, de, ja, ko, fr, ru, it)。
• 文字起こし以外 — デフォルトでは何もなし vs. 主張されているストリーミングでの発言者別出力とカスタマイズ済みホットワード(未確認)。
• 印刷物上の精度 — LibriSpeech test-clean で WER 2.1%、test-other で 4.2%、Open ASR 複合で約 7.7%、コミュニティテストでのノイズ音声で 8〜12%。これらはすべて独立に再現されている。一方、ストリーミング WER の数値はテキストとして公開されていない。
• フットプリント — ノートPCまたは単一のそこそこ性能のGPUで動作。一方、KVキャッシュ前のbf16ウェイトは約18 GB。24 GBクラスのGPUを想定しておくこと。

ストリーミングが実際に加えるもの
Whisper Large v3 Turbo をあえて見送る理由は、ライブ対応の領域にある。そしてこの領域では、両モデルを同列に論じることはできない。Whisper はバッチ指向だ。話者がまだ話している最中に単語を取得するには、チャンキング、音声アクティビティ検出、グルーコードを追加で組み込む必要があり、セルフホストのストリーミング実装は通常、遅延が1〜5秒になる。そのため、本格的なエンジニアリングなしには、電話エージェントやライブキャプションが求める1秒未満の水準に達しない。VibeVoice-ASR-Streaming-7B は、その領域のために作られている。その設定では、音声は3,200分の1に圧縮され、毎秒7.5フレームのトークンストリームになる。処理は22フレームのチャンク単位で行われ、4フレームの先読みを伴う――つまり1チャンクあたり約2.9秒の音声だ。各チャンクが解決されるたびにテキストが出力され、以前のコンテキストはKVキャッシュに保持されるため、セッションごとに最初から再計算する必要はない。この処理ペースは設定から導き出された設計上のものであり、実測レイテンシではない。まだエンドツーエンドの数値を公表した者もいない。だが、そのアーキテクチャは、Whisper がそうではないという点で、紛れもなくライブ文字起こし向けのアーキテクチャである。
Whisperの記録は長く公開されているが、新しいチェックポイントの記録は空白だ。
{{1}}精度の面では、Whisper Large v3 Turboの古さがむしろ強みとなっている。{{/1}} {{2}}LibriSpeech test-cleanでのWER 2.1%とtest-otherでの4.2%は、オープンウェイトの数値として数多くのチームが再現した実績を持つ。{{/2}} {{3}}Open ASRリーダーボードの複合スコアでは約7.7%で、完全版のLarge v3に約1ポイント及ばない。{{/3}} {{4}}また、ノイズの多い音声に対する8〜12%という数値がコミュニティテストで記録されており、この結果に誰も驚かない。{{/4}} {{5}}そうした弱点もまた実績の一部であり、モデルを土台に構築する前に、どこで支援が必要かを正確に示してくれる。{{/5}}
VibeVoice-ASR-Streaming-7Bには、そうした実績が皆無である。そのモデルカードには評価図が画像として付属し、Microsoftのストリーミング技術レポートはPDFだが、本文中に引用可能なストリーミング版のワードエラー率は記載されていない。このファミリーで唯一の数値的根拠は、バッチ版VibeVoice-ASRカードにベンダーが記載した表——8つの英語テストセットで平均WER 7.77%、LibriSpeech cleanで2.20%——であり、これはこのチェックポイントの数値ではない。さらに、バッチモデル自体もコミュニティでの評価は賛否両論で、そのまま使えるダイアリゼーションは称賛された一方、重く、時折ハルシネーションを起こしやすいと批判されている。そうした知見はストリーミングモデルには一切引き継がれない。そこがまさに要点だ。Whisperなら失敗のパターンを事前に把握できるが、VibeVoice-ASR-Streaming-7Bの場合、あなたが最初のテスターなのである。
言語とフットプリント:99対10、0.8B対9B
切り替えにかかる最も具体的なコストは、対応言語とモデルサイズの2つです。Whisper Large v3 Turboは99言語を文字起こしできます。低リソース言語や声調言語では精度が低下し、タイ語、広東語、ウェールズ語が弱点としてよく挙げられます。ただし、この対応言語リストはコミュニティによる長年の再現検証に支えられています。VibeVoice-ASR-Streaming-7Bは10言語のみ対応です。英語、中国語、スペイン語、ポルトガル語、ドイツ語、日本語、韓国語、フランス語、ロシア語、イタリア語。自社のトラフィックがこの10言語に含まれるなら、カバレッジは問題になりません。含まれないなら、ここで比較は終了です。2つ目のコストはサイズです。809Mパラメータならラップトップで動作しますが、総パラメータ約9Bをbf16で運用すると、KVキャッシュを除く重みだけで約18GBとなり、快適にサービスを提供するには24GBクラスのGPUが必要です。すでに控えめなハードウェアでWhisperを運用しているチームにとって、これはインフラの大幅な増強を意味し、真のライブ文字起こし要件がある場合にのみ正当化されます。
無料が目的ではないとき
{{1}}Whisper Large v3 Turboは実行自体は無料です。コストがかかるのはハードウェアと、その周辺のエンジニアリングです。{{/1}} {{2}}faster-whisperを単一のT4にデプロイした場合、GPUの市場価格で音声1時間あたり約0.05~0.10ドルで動作します。さらに、継続的なワークロードでは、Whisperがプレーンテキストしか返さないために自前で構築する必要があるダイアリゼーション(話者分離)と句読点を処理するスタックが追加で必要になります。{{/2}} {{3}}VibeVoice-ASR-Streaming-7Bも実行自体は無料ですが、より高価なハードウェアが必要です。その代わりに、Whisperに欠けている話者属性とコンテキスト制御を備えると主張するストリーミングアーキテクチャを提供します。ただし、独立したベンチマークが存在しないため、その主張は自分で検証することになります。{{/3}} {{4}}大量のバッチ文字起こしでは、Whisperのスループットと小さなフットプリントが依然として優位です。{{/4}} {{5}}文字起こしが会話中に届く必要があるライブの複数話者音声では、Whisperはその設計に逆行しますが、ストリーミングチェックポイントは設計に沿って機能します。もっとも、そもそも機能するかどうかは別問題であり、まさにそれを自分のGPUで自分の音声を使って検証する必要があります。{{/5}}

実用的な技術スタック
最も一般的な実世界での答えは「どちらか一方」ではなく「両方」であり、ここでの推奨もそれです:{{1}}Whisper Large v3 Turboを高容量バッチレーンとして維持し、その実績とフットプリントにより他を圧倒する形にし、VibeVoice-ASR-Streaming-7BをWhisperが必要なレイテンシで対応できないライブレーンで評価します——明確な評価ゲートを設けた上で、というのは、頼れるベンチマークが存在しないからです。{{/1}}{{2}}両モデルは1つのGPU予算と1つのコードベースを共有できます。そのスタックにおいてルーティング層が価値を発揮するのは、文字起こし自体ではなく文字起こしより上の層です:OrcaRouterは現在音声からテキストへの変換をルーティングしておらず、どちらのモデルもそのカタログには含まれていませんが、ライブの文字起こしを消費する要約機能、アラートルール、エージェントプランナーこそ、それが単一のAPIでプロバイダー定価リストをマークアップなしで透過的に中継し、プロバイダー間の自動フェイルオーバーを提供する200以上の言語モデルそのものです。{{/2}}{{3}}ベンチマークが一つも付属せずに出荷されるストリーミングチェックポイントは、実証されていないモデルが受けるべきのと同じ扱いに値します——フォールバックの背後にある実際のトラフィックの一部として、モデルカードではなく自社の会議の証拠に基づいて信頼を得るか失うか、ということです。{{/3}}{{4}}
