「Grok Voice Transcribe 2.0 vs Muse Voice Transcribe」と表示された記事ヒーローカード。バッジは「モデル比較」、サブタイトルは「17日間の支配と0.25秒」。チップには、最終WER 2.7% 対 3.1%、発話後0.49秒 対 0.16秒、ストリーミング1時間あたり$0.20 対 $0.18、バッチは半額と表示。白から青へのグラデーション上に、右下にOrcaRouterロゴ。
Guides & Insights

Grok Voice Transcribe 2.0 対 Muse Voice Transcribe:17日間の君臨と4分の1秒

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月1日、MetaはMuse Voice TranscribeがArtificial Analysisのストリーミング音声認識評価で首位に立ち、最終的な単語誤り率は3.1%だと述べ、その主張は17日間、誰にも異議を唱えられなかった。9月18日、SpaceXAIはGrok Voice Transcribe 2.0をリリースし、同じリーダーボードで2.7%を記録してその座を奪った。2つのモデル、1つのランキング、17日の隔たり——そしてより興味深い比較は、精度の0.4ポイント差ではない。なぜならMetaのモデルは依然として文を確定するまでが約3倍速く、発話終了後0.16秒に対し、Grok Voice Transcribe 2.0は0.49秒だからだ。Muse Voice Transcribeは、Meta Superintelligence LabsがMeta自社製品内で動作させるために構築したリアルタイム音声知覚モデルであり、そこでは0.25秒が、その場にいるように感じさせるアシスタントと、遅く感じさせるアシスタントを分ける差になる。Grok Voice Transcribe 2.0は、誰もが呼び出せるように作られた文字起こしAPIであり、バッチ処理を現実的なものにする価格帯だ。どちらの数値もローンチ日にベンダーが報告したものであり、その後、2つのうち独立して公開リーダーボードに掲載されたのは1つだけだ。

リーダーボードが今実際に示していること

AA-WER Streamingボードは加重合成指標だ——AA-AgentTalkが50%、VoxPopuliが25%、Earnings22が25%で、大半がエージェント形式の英語音声である約8時間分から成る——そして両モデルがこれで測定される。だからこそ、数値が少なくとも比較可能な、珍しい直接対決になる。並べると、ベンダー報告値も含めて:

• 最終的な文字起こし精度 — Grok Voice Transcribe 2.0がWER 2.7%に対し、Muse Voice Transcribeは3.1%

• 最初の部分トランスクリプト精度 — 3.4% 対 3.6%

• 最初の部分的な結果が表示されるまでの時間 — 0.49秒 対 0.13秒

• 発話終了から最終的な文字起こしまでの時間 — 0.49秒 対 0.16秒

• 話者ダイアライゼーション誤り率 — 含まれるが、数値は公表されていないのに対し、Metaの評価全体の平均は17.5%

精度の行とレイテンシの行は別々に読んでください。なぜなら、それらは逆方向を指しており、どちらも真実だからです。精度では、両モデルは最終トランスクリプトで互いに0.4ポイント以内、最初の部分結果で0.2ポイント以内に収まっています。この差は、どちらかの会社の次のリリースで逆転してもおかしくないほど小さく、これだけを根拠に合理的な人が両者を選び分けるべきではないほど小さいものです。レイテンシでは、両者は近くありません。Metaのモデルは約8分の1秒で部分結果を返し、約6分の1秒で確定しますが、SpaceXAIのモデルは部分結果の返却と確定のどちらも約0.5秒です。

これが比較のすべてを一行で表している。Grok Voice Transcribe 2.0はレイテンシを犠牲にして精度を買い、Muse Voice Transcribeはその逆を行った。SpaceXAIは初回部分結果のエラー率をバージョン1.0の18.3%から2.0では3.4%まで下げたが、その代償として同じ指標が0.25秒から0.49秒になった。Metaのモデルは逆方向に設計されており、80ミリ秒の音声チャンクと、テキストとして確定するまでどれだけ待つかを決める強化学習による適応遅延を備えている——その仕組みの目的は、確定を高速に保ちながら精度を維持することにある。どちらの選択も間違いではない。それらは異なる問いへの答えなのだ。

あなたが尋ねているのはどの質問ですか?

文字起こしが、会話の間合いの中で応答しなければならない音声エージェントに供給されるなら、0.16秒と0.49秒は別物の製品です。人間のターン交代は、やり取りに違和感が出始めるまで数百ミリ秒のギャップを許容し、レイテンシ予算は共有されます — まず文字起こし、次に推論、そして音声合成です。6分の1秒で最終的な文字起こしを返すモデルは、パイプラインの残りのための余地を残します。0.5秒かかるモデルは、モデルが何かを考える前に予算の大半を消費してしまいます。Metaが狙って作ったのはそういうことであり、このモデルが他の人たちのパイプライン向けのエンドポイントとして主に提供されるのではなく、Mac上のMeta AI内やMuse Code内で動作するのはそのためです。

文字起こしがドキュメント――通話録音、会議、動画ライブラリ、コンプライアンスアーカイブ――であるなら、0.5秒は何でもなく、精度の差もやはり何でもない。唯一意味を持つ数字は、音声1時間あたりのコストだ。そしてここで、この2つは大きく食い違う。しかも、ストリーミング料金だけを見ている人々を驚かせる方向へ。

バッチでは半額、ストリーミングでは1割増し

MetaはMuse Voice Transcribeを音声1時間あたり$0.18、つまり1,000分あたり$3.00で提供しています。Grok Voice Transcribe 2.0はバッチ処理が1時間あたり$0.10、ストリーミングが1時間あたり$0.20です。つまり:

• ストリーミング — Grok Voice Transcribe 2.0 は1時間あたり$0.20、Muse Voice Transcribe は$0.18なので、Metaの方が約10%安い

• バッチまたは録画 — 1時間あたり$0.10 対 $0.18、つまりSpaceXAIは44%安い

• 定価に含まれる — SpaceXAI側では話者分離、信頼度付き単語タイムスタンプ、キータームバイアス、逆テキスト正規化。一方Meta側ではストリーミング文字起こし、話者分離、エンドポイント検出が単一モデルとして

• 無料枠かセルフホスト — どちらでもない、どちらの点でも

ストリーミングしか行わないチームは、価格では両者に差がないはずで、レイテンシーで選ぶべきだ。つまりMetaということになる。意味のある量の録音音声を扱うチームは、バッチ行を見るべきだ。なぜなら、1時間あたり$0.08は積み重なるからだ。月5,000時間なら、一方は$500、もう一方は$900になり、両者の精度差はどちらの数値の丸め誤差よりも小さい。

ライセンス上の立場は、重要な点では同一であり、重要でない点では異なっている。どちらもクローズドウェイトだ——Muse Voice Transcribe はプロプライエタリで、Meta のホスト型 API を通じてのみ利用でき、Grok Voice Transcribe 2.0 はダウンロード不可の商用 API である。音声が自分で管理するインフラの外に一切出ないことが要件なら、どちらも選択肢にはならない。そしてどちらも、ベンダーが価格、モデルバージョン、廃止スケジュールをあなたの足元で変更するリスクにあなたをさらす。これは仮定の話ではなく、現実に考慮すべきことだ。Grok Voice Transcribe 1.0 は、その後継版がリリースされてから 2 週間も経たないうちに、すでに非推奨化の道筋に入っている。

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

話者分離——どちらも前面には押し出していない機能だ

両モデルとも話者帰属を単一パスで行うが、2年前にはこれは後から接ぎ木された別個のシステムだった。そしてここでの比較が異例なほど具体的なのは、Metaが数値を公表し、SpaceXAIは公表しなかったからだ。

Metaは、その評価全体で平均17.5%のダイアライゼーション誤り率を報告しており、ポストプロセッシングなしで20人以上の話者を処理し、それらを下流のステップとしてではなくストリーミングモデルの一部として扱う——「誰が何を言ったか」はテキストの後にではなく、テキストとともに届く。これはストリーミングの文脈では本当に難しいことだ。話者のターンは、十分に聞いて初めて特定できるようになるからである。そして17.5%は現実の数字であり、現実の但し書きがある。それはMeta自身の数字であり、Metaが選んだ評価セットで平均したものである。

SpaceXAIのモデルには追加料金なしの話者分離が含まれており、1回のリクエストで最大8つの独立したオーディオチャンネルにも対応している。これは同じ課題に対する別の解決策だ。音声が参加者ごとに別々のチャンネルで届く場合——コンタクトセンターの電話通信ではよくあることだが——チャンネル分離のほうが話者分離より信頼性が高く、エラー率はまったく必要ない。音声が1つのミックスストリームで届く場合は、話者分離の品質に依存することになり、この2社のうち片方だけが、その品質がどの程度かを示している。

注目すべき二次的な違いがある。Muse Voice Transcribe は、話者分離、文字起こし、エンドポイント検出を、1つの出力を生成する1つのモデルとして扱う。つまり、各コンポーネントが独立して失敗することはない。Grok Voice Transcribe 2.0 では、チャンネル、キーワード、話者分離を別々のレバーとして扱える。単一モデルは実行が簡単で、デバッグは難しい。

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

言語、そして2つのモデルカードが比較できなくなる箇所

MetaはMuse Voice Transcribeを70以上の言語でトレーニングし、ローンチ時にそのうち25言語を広範囲に検証した。文内および文間でのネイティブなコードスイッチングと、1時間を超える音声のサポートを備えている。Grok Voice Transcribe 2.0は、録音中の切り替えを伴う自動言語検出を処理し、逆テキスト正規化 — 話された日付、通貨、電話番号、メールアドレスを書かれた形式でレンダリングする — を25言語にわたって適用する。

重なり合う部分とは、一方では徹底的に検証された25言語、もう一方では正規化対象の25言語であり、両方の集合は同じ25言語ではなく、どちらのベンダーもそのリストを公開していない。「70以上の言語でトレーニング済み」と「フォーマットをサポートする25言語」は比較可能な主張ではなく、互いから差し引くべきではない。言えるのは、Metaはより広範な多言語の主張をしており、SpaceXAIはより狭いがより運用向けの主張をしているということだ。言語を検出することは最低条件であり、モデルが聞き取った内容を下流システムが解析できる形にフォーマットすることが、それが欠けると統合を壊す部分なのである。

その選択、そしてそれがあなたのものではないかもしれない理由

宣伝文句を剥ぎ取れば、判断はたった3つの文に集約される。文字起こしが会話の中でリアルタイムに消費されるなら、Muse Voice Transcribeを選べ。0.16秒は些細な話ではないからだ。大量の録音音声があるなら、Grok Voice Transcribe 2.0を選べ。バッチ価格が半額というのも、同じく些細な話ではないからだ。どちらの極端も必要ないなら、他に制約となるもの——地域、契約、既存の統合——で選べばいい。精度の差が決め手になることはないからだ。

厄介なのは、この2つのモデルのうち一方は、通常の意味では実際に販売されているわけではないということだ。Muse Voice Transcribe は Meta 自身のアシスタントを高速に感じさせるために存在しており、Meta Model API を通じて利用できるのは、主に Meta が、エコシステムにおいて露出することの価値が独占の価値より大きいと判断したからだ。それは変わりうるし、しかも急速に変わりうる。Meta は同じ週を、Muse のコネクタプラットフォームをサードパーティ開発者に開放することに費やした。これは、他社にとっての中立的な供給元であるというより、自社の流通チャネルに投資している企業だということだ。競合他社の内部モデルに本番環境で依存することは、条件が変わらないという賭けであり、その賭けには悪い前歴がある。

その非対称性こそが、どちらもハードコードすべきでないことの根拠になる。OrcaRouterは、単一のOpenAI互換キーの背後に200以上のモデルを公開し、プロバイダー間の自動フェイルオーバーと、プロバイダー表示価格に対する0%のマークアップを実現している。だからこそ、SpaceXAIがデフォルトを2.0に切り替えて1.0を非推奨にしても、あるいはMetaが音声APIの位置づけを変えても、変更は移行プロジェクトではなくモデル文字列の書き換えで済む。3週間でリーダーの座が2度入れ替わったカテゴリーでは、スタックの中で安定しているべきなのはルーティング層であり、安定しているべきでないのはモデルのほうだ。

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

今後1か月で注目すべきことのひとつは、Grok Voice Transcribe 2.0がMuse Voice Transcribeを追い落とした今、Artificial Analysisがストリーミング・ボード上でMuse Voice Transcribeを再測定するかどうかだ。Metaの3.1%とSpaceXAIの2.7%はどちらもローンチ時に報告されたが、独立に評価されたのはSpaceXAIの数値だけだ。誰かが再測定したときにMetaの数値が持ちこたえれば、精度差は見た目どおり小さく、レイテンシ差がすべてを決める。そうならなければ、17日間の君臨が物語のすべてだったということになる。