「VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe」を比較するヒーロータイトルカード。オーバーラインは「Streaming ASR - 2026年9月」。サブタイトルは、1日違いで登場した2つのストリーミングASR挑戦者、Metaの1時間あたり0.18ドルのAPIと、ホスティング先を持たないMicrosoftのMITチェックポイントについて説明している。チップは「MITウェイト - 9月2日」「Meta API - 9月1日」「両者とも未検証」。脚注は「同じ見出しのうたい文句」。右下にはOrcaRouterのロゴが合成されている。
Guides & Insights

VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe:公開が1日違いのストリーミング系2大挑戦者

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月上旬のおよそ36時間の間に、2つの大手研究所が同じ見出しを飾る約束を掲げたストリーミング音声認識モデルをリリースした——それは、言葉が話されている最中に、誰が何を言ったかも教えてくれるライブ文字起こしだ。9月1日、Meta Superintelligence Labsはホスト型APIとしてMuse Voice Transcribeをリリースした。料金は1,000音声分あたり3.00ドル(1時間あたり約0.18ドル)で、ストリーミング認識、20人以上の話者ダイアリゼーション、エンドポインティングが1回のパスに統合されている。9月2日、Microsoft ResearchはVibeVoice-ASR-Streaming-7BをHugging Faceにアップロードした。MITライセンスのオープンウェイト、発表のないまま、ホットワードと10言語に対応したストリーミング話者属性付き文字起こしを謳うモデルカードが添えられ、ホスト型の提供先はどこにもない。同じ売り文句、正反対のビジネスモデル、そしてどちらの研究所も気づかれたくないほどに薄いエビデンスが両側に存在する。

このページは現時点で判明している事実に基づいて執筆されています。というのも、どちらのモデルも第三者による検証済みの精度数値が存在しないためです。Muse Voice Transcribeの数値はMetaの発表当日の主張であり、ベンダーによる報告に基づくもので、第三者による再現はされていません。VibeVoice-ASR-Streaming-7Bは、ストリーミング精度の数値をテキストとして一切公開していません。したがって、以下の比較は構造的かつ確認可能な事項—アーキテクチャ、価格、ライセンス、文書化された動作—に依拠しており、数少ないベンダー提供の数値が登場する箇所にはその旨を明記しています。

バッチパイプラインへの2つの挑戦者、1日違いで

どちらのモデルも、同じ前提を攻撃している。すなわち、音声テキスト変換は完成した録音に対して実行するものだという前提だ。Muse Voice Transcribe は、Meta が「リアルタイム音声知覚モデル」と呼ぶ最初の製品である。これは、認識と、20以上の声にわたる話者ダイアリゼーションと、話者が間を置いたのではなく実際に話し終えたかどうかを判定するエンドポイント検出を、1回のストリーミングパスで行う。しかも、Meta Model API(音声1時間あたり0.18ドル)、Fnキーを押し続けると任意のアプリケーションでディクテーションできる Mac 向け Meta AI、そして Muse Code という、3つのサーフェスで同時に提供される。一方、Microsoft の VibeVoice-ASR-Streaming-7B は、オープンな VibeVoice ファミリーのストリーミング対応メンバーであり、そのリリースのありさまははるかに静かだ。9月2日に作成された Hugging Face リポジトリ(タイムスタンプは15:46 UTC、その3分後に最終更新)、MIT ライセンスの下にある8つの safetensors シャード、そして microsoft/VibeVoice GitHub リポジトリの9月3日付ニュースログの1行——そこには「音声が届くにつれて誰が何を話したかを継続的に文字起こしする統合ストリーミングASRモデルで、カスタマイズされたホットワードと10言語に対応している」と記されている。アップロードから1日後も、そのダウンロード数はゼロのままだった。

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

機能の衝突

• ストリーミングの仕組み — Muse Voice Transcribe は音声を80ミリ秒単位のチャンクで消費し、単語が安定するたびに確定する。一方、VibeVoice-ASR-Streaming-7B は約0.5秒の先読みを伴う約2.9秒単位のチャンクを処理し、確定したチャンクごとにテキストを一度出力する。

• 話者帰属 — 1回のパスで20人以上の話者に対応。ベンダー報告では平均ダイアリゼーション誤り率17.5%で、モデルカードで主張されているストリーミングの「誰が何を言ったか」出力と比較されているが、未検証。

• エンドポインティング — 組み込み: ストリームは発話終了の境界を伝える vs 出力信号としては文書化されていない

• コンテキスト制御 — 言語、キーワード、コンテキストのバイアス設定 vs コンテキストプロンプト(--context_info)によるカスタムホットワード

• 言語 — 70以上の言語でトレーニングされ、そのうち25言語はローンチ時に広範囲に検証済み。ネイティブなコードスイッチングは、宣言された10言語(en, zh, es, pt, de, ja, ko, fr, ru, it)と比較して実現。

• 証拠 — 発売日当日のベンダーによる主張:発話後0.16秒時点の最終結果におけるWER 3.1%、最初の部分結果では3.6%。根拠としてArtificial Analysisのストリーミングリーダーボードを挙げているが、テキストとして公開されたストリーミングWERやレイテンシーの数値は存在しない。

• コストとライセンス — オーディオ1時間あたり0.18ドル(ホスト型、クローズドウェイト)に対し、ウェイトは0ドル(MITライセンス)、約18GBのbf16、セルフホスト型。

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): business model - open weights MIT self-hosted; streaming cadence - ~2.9 s chunks, config-derived; speaker output - claimed who-said-what, unverified; endpointing - not documented; languages - 10 declared; price - $0 weights, ~18 GB bf16. Right column Muse Voice Transcribe (released Sep 1, 2026 - Meta Model API): hosted API closed weights; 80 ms chunks, adaptive delay, finals 0.16 s (vendor); 20+ speakers, 17.5% avg DER (vendor); built-in turn-end signal; 25 verified (70+ trained); $0.18 per audio-hour. Footer: 'Muse figures are vendor-reported launch-day claims. VibeVoice specs read from the HF repo. Neither is independently benchmarked.'

「ストリーミング」に関する、まったく異なる2つの考え方

{{1}}ストリーミングという言葉は幅広い速度範囲を指しており、この2つの間の隔たりは、それぞれの上に構築できるものを変えるほど大きい。{{/1}} {{2}}Muse Voice Transcribeは単語単位でストリーミング処理を行う。{{/2}} {{3}}Metaのアーキテクチャは、音声を80ミリ秒のチャンクで消費し、同社が「適応的遅延」と呼ぶ手法を用いる。これは強化学習で獲得された遅延ポリシーであり、モデルが確信を持った単語はすぐに確定させる一方、確信が持てない単語はより多くの文脈を保持したうえで確定させるもので、固定のレイテンシ予算を適用するのではなくこの方式を採用している。{{/3}} {{4}}同社によれば、話者が話し終えてから0.16秒後に最終文字起こしが得られ、開始から0.13秒後に最初の部分結果が得られるという。{{/4}} {{5}}この速度は、ライブ字幕、ディクテーション、完了した発話にほぼ即座に応答する必要がある音声エージェントなど、インタラクティブなループのために設計されている。{{/5}}

VibeVoice-ASR-Streaming-7B は、より粗い粒度でストリーミングを行う。その前処理構成では、音声が24kHzで到着し、毎秒約7.5フレームのトークンへ3,200×圧縮され、その後、4フレームの先読みを伴う22フレームのチャンクに処理される。これはチャンクあたり約2.9秒の音声、約半秒の先読みに相当し、実測レイテンシではなく構成から導き出された数値である。テキストは各チャンクが解決されるたびに出力され、以前のチャンクのコンテキストはKVキャッシュを通じて保持されるため、長時間のセッションでも初期状態から再計算されることはない。約3秒単位で成長する文字起こしは、会議録や通話分析には十分であるが、ライブ会話向けのサブ秒単位のワードストリーミングとは別の製品である。どちらのラボも、ストリーミングチェックポイントのエンドツーエンドのレイテンシ測定を公開していないため、そのケイデンスは設計上のものとして捉え、実際の使用感は未検証として扱うべきである。

話者ラベルとエンドポインティング:一方は実装済み、もう一方は謳い文句のみ

話者属性の付与は、ストリーミング製品が最も頻繁に過大評価する点であり、この2つの製品はいずれもその主張をしている。Muse Voice Transcribeの実装は、具体的かつ構造的だ。ダイアリゼーションが認識と同じストリーミングパス内で動作するため、20人が参加する通話の録音でも、「アップロードして待ち、話者情報を受け取る」という別工程なしに、話者ごとのラベルを付与できる。Metaは平均ダイアリゼーション誤り率17.5%を報告している——これは再現されていないベンダー数値だが、実際のメカニズムに結びついた数値ではある。さらに、この製品はエンドポイント境界も出力する。これはあまり注目されない機能だ。アプリケーションは、音声活動検出器を自作しなくても、「この話者のターンが終了した」という明確なシグナルを得られる。生のASR上に構築された音声エージェントがユーザーの発話を遮ってしまうことが非常に多いのは、まさにこのためだ。

VibeVoice-ASR-Streaming-7B はそのモデルカードで、ストリーミング方式の「誰が何を言ったか」出力を主張しており、バッチ処理の VibeVoice-ASR が出力する構造化された Who/When/What(誰が/いつ/何を)と軌を一にしています。しかし、ストリーミングチェックポイントについては、この主張は未検証であり、独立したテストによる再現もなく、Muse が備えているような、文書化されたエンドポインティング信号も存在しません。実際の複数話者によるライブ音声を扱うワークロードであれば、Muse は現在、より完全な仕組みを提供しています。一方、オープンウェイトのモデルが、自分で管理するハードウェア上で同じ役割を果たせるかを評価しているなら、VibeVoice の主張は、信じる前に自分の会議録音でテストすべき典型例です。

証拠:ブランクカードに対する発売日の主張

各陣営が実際に持っているものを正確に述べる価値はある。なぜなら、どちらも買い手が本当に欲しいものを持っていないからだ。Muse Voice Transcribeは、ベンダーによる数値の密集したセットを公表している。最終文字起こしの単語誤り率3.1%、最初の部分結果で3.6%、最終レイテンシー0.16秒、平均ダイアライゼーション誤り率17.5%――これらはすべて、Metaが発表当日に公表し、Artificial Analysisのストリーミング音声認識リーダーボードを示すもので、Metaはそこで首位を主張している。これらは主張であり、研究所の外では誰も再現していないが、反証できるほどには具体的であり、それは一種の進歩である。

VibeVoice-ASR-Streaming-7Bには、そうした情報は一切ありません。そのモデルカードには評価結果の図が画像として掲載され、ストリーミング技術レポートはPDF形式ですが、散文として引用可能なストリーミングWERやレイテンシの数値は示されていません。VibeVoiceファミリーで唯一の数値的根拠は、バッチ処理向けVibeVoice-ASRカードに記載されたベンダー報告の表—8つの英語テストセットで平均WER 7.77%、LibriSpeech cleanで2.20%—ですが、これは明示的にこのチェックポイントの数値ではありません。発表時の主張が空白のカードと向き合うとき、正直な決め手となるのは、見出しのWER以外のすべて、つまり価格、ライセンス、ストリーミングの間隔、そして各側が実際に文書化している機能です。

言語: 宣言10件に対して検証済み25件

対応言語の範囲は、2つの差を、見出しの精度の主張以上に明確にする。Muse Voice Transcribeは70以上の言語でトレーニングされたが、Metaがローンチ時に検証するのは25言語だ。本番環境でのカバレッジとなるのは、トレーニングリストではなく検証済みリストであり、その差別化要因はネイティブなコードスイッチングである。つまり、指示なしに文の途中で言語を切り替えるよう設計されている。VibeVoice-ASR-Streaming-7Bはモデルカードで10言語(英語、中国語、スペイン語、ポルトガル語、ドイツ語、日本語、韓国語、フランス語、ロシア語、イタリア語)を宣言しており、バッチ版VibeVoice-ASRの50以上の言語とは対照的だ。トラフィックにコードスイッチング会話が含まれるなら、Museのほうがより具体的な提案を持っている。トラフィックがその10言語内に収まるなら、Microsoftモデルのカバレッジは少なくとも明示的であり、それはほとんどのローンチ資料が提供する以上のものだ。

コストと手元に残るもの

ビジネスモデルの違いこそ、判断するうえで最も明快な基準になる。Muse Voice Transcribeは、音声1時間あたり0.18ドルという価格で、リスト価格の面では主要なストリーミング文字起こしAPIをすべて下回る。GPUも運用も不要、ウェイトはクローズドで、価格はMetaが設定する。一方、VibeVoice-ASR-Streaming-7Bはダウンロード自体は無料だが、24GBクラスのGPUでセルフホストするには、KVキャッシュを除いたbf16ウェイトだけで約18GBが必要だ。文書化されたサービング経路はmicrosoft/VibeVoiceのデモスクリプトかvLLMプラグインで、このモデルをホストしている推論プロバイダーはまだない。MITライセンスこそが長期的に価値を持つ資産である。ウェイトを保持してファインチューニングできるという点は、どのAPIサブスクリプションにもない利点だ。価格をめぐる構図が面白くなるのも、まさにこの点だ。どこかのプロバイダーがオープンチェックポイントをホストした瞬間、時間あたり$0.18という価格は、単一ベンダーのリスト価格ではなく市場価格になる。これはまさに、パススルールーターが存在価値を発揮する状況である。OrcaRouterは現時点では音声テキスト変換(STT)のルーティングには対応しておらず、これらのモデルもどちらもそのカタログには載っていない。OrcaRouterが実際に行っているのは、ライブ文字起こしを入力として利用する200以上の言語モデルについて、プロバイダーのリスト価格を0%のマークアップでそのまま通すことだ。つまり、スタック内のどこかのベンダーが値下げを発表したその日に、買い手側にも反映される。

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

よくある質問

Muse Voice Transcribeの3.1% WERは、VibeVoice-ASR-Streaming-7Bよりも正確であることを意味しますか?

いいえ、まだその比較は有意義ではありません。Metaの3.1%は、ストリーミング経路に関する発表当日の主張であり、ベンダーが報告したもので、再現性は確認されていません。VibeVoice-ASR-Streaming-7Bは、ストリーミング精度の数値をテキストで一切公開していません。両モデルが同じ公開ハーネスで同じ音声に対して実行されるまでは、正直に言えるのは、Museにはテスト可能な具体的な主張があり、VibeVoiceにはまだそれがないということだけです。

録音済みの音声に対して、どちらのモデルも使用できますか?

はい、両方とも可能です。その実現の形は異なります。Muse Voice Transcribe は、1時間を超える録音を同じストリーミングAPIで処理できます。VibeVoice-ASR-Streaming-7B の vLLM プラグインは、WebSocketのストリーミング用エンドポイントに加えて、ファイル全体を一括で文字起こしするエンドポイントも公開しています。ただし、両者ともライブ(リアルタイム)用途向けに設計され、価格もその前提で設定されています。Muse はストリーミング専用のビジネスモデルをとっており、VibeVoice は音声が到着するたびに結果を出力するチャンク方式のアーキテクチャを採用しているためです。したがって、ワークロードが純粋にバッチファイル処理だけなら、ファイル文字起こし専用のAPIを使うほうが、通常はどちらよりも安価で、測定(品質評価)の面でも優れています。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube