記事のヒーローカードは「Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B」と表示し、バッジは「モデル比較」、サブタイトルは「マイクロソフトが公表しなかった数字」。チップにはストリーミングWER 2.7%、最初の部分結果まで0.49秒、話者属性付き2.9秒チャンク、18 GBのMITライセンス重みが表示され、白から青へのグラデーションの上、右下にOrcaRouterのロゴ。
Guides & Insights

Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B:Microsoftが公表しなかった数字

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

VibeVoice ASR Streaming 7BはMicrosoftの統合ストリーミング音声認識モデルで、2026年9月2日にHugging Faceへアップロードされ、翌日にはmicrosoft/VibeVoiceリポジトリでMITライセンスの下で発表された。そして、Grok Voice Transcribe 2.0も競合の大半もやらないことを実現している。すなわち、音声が到着するにつれて話者帰属付きテキストを出力し、別個の話者分離段階を必要としない。Microsoftの技術レポートによれば、7Bチェックポイントは5つの評価セット全体で平均WERとCERが最小であり、13の評価設定のうち12で最高または同率最高の話者帰属を達成している。モデルカードがしていないのは、テキストで数値を一つも公表することだ。WERもRTFもレイテンシ値もない。結果はレポート内の画像としてのみ存在する。それより16日後の2026年9月18日に登場したGrok Voice Transcribe 2.0は、バッチで音声1時間あたり0.10ドル、ストリーミングで1時間あたり0.20ドルで、すべてを公表している。Artificial Analysisのストリーミングボードで最終文字起こしWER 2.7%、最初の部分結果WER 3.4%、それぞれ0.49秒だ。したがって、この比較の正直な出発点は、2つのモデルのうち一方が他方より測定可能なほど文書化が優れているということであり、その非対称性自体がこの対決で意思決定に最も関連する事実である。

マイクロソフトが公開したもの、そして読者がそれをどう活用できるか

VibeVoiceの報告書は本物の研究であり、そこに記された主張は、値はともかくとして、形としては具体的だ。AliMeeting、AISHELL-4、AMI-SDM、AMI-IHMという4つの会議ベンチマークに加え、MLC-Challengeを、9言語にわたって評価し、2つの主要な結果を報告している。7Bモデルが5つのセット全体で平均WER/CERが最も低かったこと、そして13の評価設定のうち12で話者帰属が最良または同率最良だったことである。どちらも相対的な主張であり、これは意味のある種類の主張だ。「これら5つのセット全体で最も低い」は順序についての記述であり、順序こそ買い手が必要とするものである。

欠けているのは、あらゆる絶対的数値だ。何かと比較できる WER のパーセンテージはなく、スループットの数値も、レイテンシの測定値も、テキストによるセット別の内訳もない。VibeVoice を Grok Voice Transcribe 2.0 の隣に並べ、Microsoft のモデルに数値を割り当てる比較表は、その数値をでっち上げているにすぎない。言えるのは、VibeVoice が自らの 5 セット評価で勝利したということであり、Microsoft の外部でそれを再実行した者は誰もいないということだ — 独立したベンチマークも、第三者評価も、執筆時点ではこのモデルを掲載しているホスト型推論プロバイダーも存在しない。したがってこの比較は、文書化された数値と文書化されていないランキングの間のものだが、文書化されていないランキングが、小数点を欠いているというだけの理由で両者のうち弱い方なのではない。

Grok Voice Transcribe 2.0のドキュメントは、逆の問題を抱えている。その2.7%と3.4%は、Artificial AnalysisのAA-WER Streamingボードに由来する。これはAA-AgentTalkを50%、VoxPopuliとEarnings22をそれぞれ25%で加重合成した複合指標であり、約8時間分のエージェント型の英語会話音声を、独立して実行したもので、ベンダー自身の評価よりも真に信頼できる出所だ。だが、それは英語のごく狭い一部分にすぎず、ボードのページ自体、SpaceXAIが32モデル中1位だと主張する際に数えている33モデルのうち27モデルしかプロットしていない。狭いテストにおける精密な数値と、より広範なテストにおける不正確な主張は直接比較できるものではなく、本記事はそうでないふりをするつもりはない。

2.5秒 対 0.5秒です

レイテンシ比較は、データセットに関する但し書きを一切付けずに2つのモデルを並べて比較できる唯一の場面である。なぜなら、両モデルともストリーミング設定を公開しており、その違いはチューニングの選択ではなくアーキテクチャによるものだからだ。

VibeVoice ASR Streaming 7B はチャンク単位で動作します。公開されているチェックポイントはチャンクあたり22の潜在フレームを使用し、これはモデルの毎秒7.5潜在フレームではチャンクあたり約2.9秒の音声に相当します。また、4つの潜在フレームの先読み、つまりおよそ0.5秒分の未来の音声があり、想定される話者帰属レイテンシは約2.00秒です。テキストはチャンクごとに一度出力されます。これは実際のストリーミングシステムですが、そのケイデンスはミリ秒ではなく秒単位で測られます。

Grok Voice Transcribe 2.0 は、話者が話すのをやめてから 0.49 秒後に最初の部分文字起こしを返し、発話終了から 0.49 秒後に確定する。それはその速度を精度と引き換えに手に入れた——最初の部分文字起こしの誤り率はバージョン 1.0 の 18.3% から 2.0 では 3.4% に下がり、その代償として同じ指標で 0.25 秒から 0.49 秒になった。

並べて表示:

• ストリーミングのテンポ — Grok Voice Transcribe 2.0 は最初の部分結果を0.49秒のレイテンシで継続的に出力するのに対し、VibeVoice ASR Streaming 7B は約2.9秒ごとにテキストを1チャンク出力します

• 話者特定のレイテンシー — 同じ0.49秒の経路内に含まれるのに対し、設計上は約2.00秒

• ルックアヘッド — 未公開 vs 4つの潜在フレーム、約0.5秒先のオーディオ

• 実用的な効果 — 音声エージェントは発話途中の文に対して行動を起こせるのに対し、3秒ごとに話者ラベル付きの段落を受け取るシステムとは対照的

どちらも間違ってはいない。2.9秒のチャンクは、会議の文字起こしにとってはまったく合理的な設計だ。そこでは出力は文書であり、価値はその文書が会議の後ではなく会議中に届くことにある。しかし対話エージェントにとっては間違った設計だ。そこでは3秒の沈黙は間ではなく、失敗である。二つのテンポの差はおよそ6倍であり、それは会話を文字起こしすることと、会話に参加することの違いにほぼ正確に対応している。

Screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B, showing the MIT licence tag, the 10 languages and Streaming tags, the model card opening line 'a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the 9B parameter and BF16 tensor type fields, a notice that no inference provider deploys it, and the architecture diagram showing 2.9 second chunks with 0.5 second lookahead.

話者帰属はパイプラインの段階ではなく出力である

ここが Microsoft モデルが真に優れているところであり、この設計は理解する価値がある。なぜなら、それがチャンク分割が粗い理由だからだ。

VibeVoiceは2つの事前学習済みトークナイザー — 音響エンコーダーと意味エンコーダー — を使用し、24 kHzで動作して3,200倍のダウンサンプリングを行い、毎秒7.5個の潜在フレーム、つまり133ミリ秒ごとに1フレームを生成する。これらのフレームはQwen2.5言語モデルバックボーンに射影され、入力音声と生成テキストは単一のシーケンスとしてインターリーブされ、以前に観測された音声とテキストはモデルのコンテキスト内に保持される。その結果、話者アイデンティティが別個の問題になることは決してない。モデルは文字起こしをしてから誰が話したかを判断しているのではなく、声が依然として含まれている音声履歴に条件付けられてテキストを生成しているのだ。だからこそ、位置合わせすべきダイアリゼーション段階が存在せず、13設定中12設定における話者帰属に関するMicrosoftの主張が、後付けの結果ではなくアーキテクチャ上信頼できるものになっている。

その設計の代償は、録音長に比例して線形に増大する履歴保持であり、だからこそ公開されているチェックポイントは最長8分の録音を対象としている。これは紛れもない上限であり、率直に明言されている。このことは、2時間の決算説明会やコンタクトセンターの丸一日分の音声といった長時間の用途から、このモデルを排除する——自前でセグメンテーションと再初期化を実装しない限りは。だがそれは、このアーキテクチャが取り除くために設計された複雑さを、まさにそのまま呼び戻すことになる。

Grok Voice Transcribe 2.0は、同じ問題を異なる方法で、異なる一連の制約のもとで解決する。追加費用なしでダイアライゼーションを含み、単一のリクエストで最大8つの独立した音声チャンネルをサポートする。コンタクトセンターのテレフォニーでは、各参加者が多くの場合それぞれのチャンネルで届くため、チャンネル分離はダイアライゼーションよりも信頼性が高く、エラー率を伴わない。混合音声の場合、それはダイアライゼーションの品質に依存する。また、平均17.5%のダイアライゼーション誤り率を公表したMetaのMuse Voice Transcribeとは異なり、SpaceXAIはダイアライゼーションの数値をまったく公表していない。したがって、どちらのモデルもダイアライゼーションの証拠に空白を残している。一方は値のないランキングを公表し、もう一方は測定値のない機能リストを公表している。

18ギガバイト、10言語、MIT

デプロイに関する事実はあまりにも完全に異なっており、もはや比較にならないほどだ。VibeVoice ASR Streaming 7Bは約18 GBのbf16ウェイトで、Hugging Faceのカードには7Bという名前のチェックポイントについて総パラメータ数9Bと記載されており、約5.6 GBの1.5Bの兄弟モデルも存在する。MITライセンスで、Pythonデモとサービング用のvLLMプラグインを備える。対応言語は10言語:中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語。Microsoftはこれを研究・開発向けと位置づけている。

Grok Voice Transcribe 2.0は、ダウンロードすべき重みがないマネージドエンドポイントで、8 kHzの電話音声から48 kHzまでの12の入力フォーマット、最大8チャンネル、リクエストあたり100個のキーターム、録音中の切り替えを伴う自動言語検出、25言語にわたる逆テキスト正規化、最大500 MBのファイル、そしてサービス制限として1秒あたり10リクエストとチームあたり100の同時ストリーミングセッションを備えています。稼働するのはus-east-1のみです。

• 重み — MIT、18 GB、どこでも自由に実行可能 vs なし、ベンダーホストのみ

• 言語 — 名前付き10言語 対 自動検出、25言語にわたる書式設定サポート付き

• キータームバイアス — ホットワードによるサポート 対 リクエストあたり最大100個のキーターム

• 録画長 — 履歴保持が制約となるまでのチェックポイントあたり約8分 対 公表された上限なし、ファイルは500 MBまで

• リージョン制御 — デプロイ先が何であれ、us-east-1 との比較

• コスト — ライセンス料なし。加えて18 GBのGPUメモリとサービングスタックが必要となるのに対し、バッチ処理1時間あたり$0.10、ストリーミング1時間あたり$0.20

18 GBのモデルはラップトップで動かすものではなく、vLLMプラグインは実メモリを搭載したGPUを意味する。それに対して、その規模のモデルにMITライセンスが付くのは異例であり貴重だ。ベンダーとの関係が一切なく自社ネットワーク内で実行できるのは、二つのうちこれだけであり、規制対象の音声にとってそれは好みではなく要件である。マネージドの代替手段は1時間あたり安価で、オンプレミスには展開できない。

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, cadence continuous partials, diarization included with no figure published, $0.10 per batch hour, managed in us-east-1. The right column gives VibeVoice ASR Streaming 7B the rows: WER lowest of five sets but unpublished, speaker attribution about 2.00s, cadence 2.9 second chunks, diarization built into streaming, MIT weights at about 18 GB, recordings up to 8 minutes. A footer reads 'VibeVoice figures Microsoft-reported with no absolute values published; Grok figures per Artificial Analysis.'

ルーティング判定を置くべき場所

コストこそ、両モデルが最終的に数字として比較できる形で並ぶポイントだ。Grok Voice Transcribe 2.0のバッチ経路は音声1時間あたり$0.10、1,000分あたり約$1.67、ストリーミング経路は$0.20、約$3.33。VibeVoice ASR Streaming 7Bにはライセンス費用が一切ない。その代わりにあるのは、常駐GPUメモリ約18 GBと、自分で運用するvLLMサービングスタックだ。そのサイズの7Bクラスモデルは、レンタルハードウェア上で音声1時間あたりを安く済ませられるものではなく、稼働率の曲線は容赦ない――ピークトラフィックのために温め続けたGPUは、文字起こし中でもアイドル中でも同じコストがかかる。

それは内製か購入かをめぐる議論のよくある構図であり、処理量と、音声を自社ネットワークの外に出してよいかどうかによって結論は変わる。この1か月で変わったのは、答えが動く速さだ。ストリーミング精度の首位は3週間で2度入れ替わり、9月初旬にリリースされたモデルは9月中旬には取って代わられていた。モデル選択を覆すのに高くつくアーキテクチャは、今やこのカテゴリにとって誤ったアーキテクチャだ。

OrcaRouter は、その逆転を低コストで実現する場所です。OpenAI 互換のキー 1 つで 200 以上のモデルをカバーし、プロバイダー間で自動フェイルオーバーが働くため、単一リージョンのマネージドエンドポイントが落ちてもそれは障害ではなくルーティング上のイベントにすぎず、プロバイダーの定価は 0% のマークアップでそのまま適用されます — つまり、ベンダーの価格変更や新しいチェックポイントは同日中に当社側で反映されます。自社の音声で VibeVoice を Grok Voice Transcribe 2.0 と比較テストしたいチームにとっても、セルフホストのフォールバックをマネージドのプライマリと同じインターフェースの背後に置いておきたいチームにとっても、呼び出し側を変更する必要はなくなります。

Screenshot of the microsoft/VibeVoice GitHub repository showing the description 'Open-Source Frontier Voice AI' and the MIT licence in the About sidebar, the file listing with demo and vibevoice directories both updated with streaming ASR inference code and a vllm_plugin directory, the repository's 53.6 thousand stars, and a GitHub Trending badge reading number 1 Repository Of The Day.

正直な結論としては、VibeVoice ASR Streaming 7B はより興味深いモデルであり、Grok Voice Transcribe 2.0 はより実用的な製品だ。そしてこの二つの文の間の隔たりは、一方のベンダーがグラフを公開し、もう一方が数値を公開していることによって完全に説明できる。オンプレミスで、8分未満の会議の話者属性付き文字起こしが必要なら、この二つのうち該当するのは Microsoft のチェックポイントだけだ。会話の間のうちに応答する音声エージェントが必要なら、2.9秒のチャンク周期の時点で、精度の話をする前に候補から外れる。そして、決着をつける比較——同じ音声を両モデルに通し、どちらの会社の社員でもない人物が採点する——を待っているなら、その測定はまだ存在しない。次に表が VibeVoice の名の隣に数値を載せるときは、それを思い出す価値がある。