記事のヒーローカードには「Grok Voice Transcribe 2.0 vs MAI Transcribe 2」と表示され、バッジは「モデル比較」、サブタイトルは「2つのレーン、2つのライバルではない」。チップには「3.4% vs ストリーミングSKUなし」「2.29% vs 2.04% バッチWER」「162倍 vs 333倍 リアルタイム」「それぞれ1,000分あたり$1.67」と表示され、白から青へのグラデーション上、右下にOrcaRouterロゴがある。
Guides & Insights

Grok Voice Transcribe 2.0 対 MAI Transcribe 2:2つの路線であり、2つのライバルではない

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これら2つのモデルは15日違いでリリースされ、価格は1セント単位まで同じでありながら、同じ調達判断で比較されることはほとんどない。SpaceXAIが2026年9月18日にリリースしたGrok Voice Transcribe 2.0は、音声がまだ到着している最中に呼び出すモデルだ——WebSocketでストリーミングし、およそ500 msごとに中間結果を出力し、Artificial AnalysisのAA-WER Streamingボードで、最終文字起こしの単語誤り率2.7%、最初の部分結果で3.4%を記録して首位に立つ。Microsoft AIが2026年9月3日にリリースしたMAI-Transcribe-2は、音声がすでにファイルになっているときに呼び出すモデルだ——バッチ専用であり、Artificial Analysisの非ストリーミングボードでは、測定されたマネージドモデルの中で最も高精度でAA-WER 2.04%を記録し、Grok Voice Transcribe 2.0の2.29%を上回り、スループットは約2倍高速だ。どちらも音声1時間あたり$0.10、1,000分あたり約$1.67で掲載されている。要件がリアルタイムなら、比較する余地はない。要件がファイルなら、比較する余地がある。

どちらのベンダーも、あなたの代わりに引いてはくれない一線

ストリーミング対応は機能のオン/オフを切り替えるものではない。Grok Voice Transcribe 2.0 は、録音ファイル向けには REST 経由で、ライブ音声向けには `wss://api.x.ai/v1/stt` 経由で同じモデルを提供するので、アーカイブで計測した精度がそのままライブ通話でも得られる。MAI-Transcribe-2 にはストリーミング SKU がそもそも存在しない。マイクロソフトの発表資料はこれを長尺音声およびバッチ音声向けとして明示的に位置づけており、モデルカードにはアプリケーションシナリオとしてリアルタイム字幕が挙げられているものの、そこに至る道筋は音声をセグメントに分割し、各セグメントをバッチ API に通すというもので、それは自分で構築・運用するパイプラインであって、購入できるレイテンシ保証ではない。マイクロソフトが掲げる約411倍というリアルタイム比のスループットは処理速度を示す数字であって応答時間を示す数字ではなく、今回のリリースに関する報道ではこの2つが絶えず混同されている。

実用的な帰結:ターンテイキング音声エージェント、ライブキャプション、あるいは進行中の音声に人間やモデルが反応するようなものを構築しているなら、MAI-Transcribe-2 はその精度がどれほど優れていても候補にはならない。事後の会議、夜間のコンタクトセンター録音、メディアアーカイブ、コンプライアンスのバックログなどを文字起こしするのであれば、ストリーミングは無駄な重荷であり、バッチの数値がすべてを物語る。

MAI-Transcribe-2が真に優れている点

まずはファイルの精度から。2.04%対2.29%の差は、同じ独立系ハーネス — Artificial AnalysisのAA-WER v2、すなわちAA-AgentTalkが50%、VoxPopuliとEarnings22がそれぞれ25% — で測定されており、この比較で最も明快な事実となっている。差は0.25ポイントで、1000語あたりおよそ2.5個少ない誤りに相当する。それが重要かどうかは、文字起こしを何に使うかによる。検索可能なアーカイブなら重要ではなく、法律や医療の記録なら重要かもしれない。

スループットでは2位で、しかもその差は精度差よりも大きい。実時間の333倍に対し、Grok Voice Transcribe 2.0は162倍だ。どちらの数値も、ベンダーの主張ではなく、1秒あたりに文字起こしされる入力音声の秒数をArtificial Analysisが測定したものだ。この速度なら、1000時間のアーカイブはMicrosoftモデルでは約3時間の計算で、SpaceXAIのものでは約6時間で完了する。単発の移行ではそれは重要ではないが、継続的に取り込むパイプラインでは、所要時間が半分になることは実際の処理能力の差だ。

言語カバレッジ、3つ目。Microsoftは60言語を明示しており、自動検出、1つの録音内でのコードスイッチング、そしてそれら全体におけるFLEURSでの平均5.2%の単語誤り率を挙げている——これはベンダー報告の数値であり、独立に再現されたものではないが、少なくとも明示された言語リストにわたる多言語のケースを描写してはいる。SpaceXAIは、録音途中での切り替えと25言語にわたる書き言葉形式のフォーマットに対応する数十の言語を文書化している。あなたの音声が、十分にカバーされた英語および主要ヨーロッパ言語の集合の外にあるなら、FLEURSの数値のほうが、英語に偏重しエージェントの発話が多いリーダーボードよりも有益である。

運用面で重要な違いがさらに2つある。MAI-Transcribe-2は設定可能な文字起こしスタイルを提供する。逐語的(非流暢さを保持する)とクリーン(それらを取り除く)の対比だ。一方、Grok Voice Transcribe 2.0は同じ問題をフィラーワード除去フラグで処理する。そしてMicrosoftのモデルはMicrosoft Foundry上でパブリックプレビュー段階にあり、つまりSLAはなく、GAになるまで本番使用を控えるよう常に推奨されている。SpaceXAIのモデルは一般提供されており、公開されたレート制限は毎秒10リクエストおよびチームあたり100の同時ストリーミングセッションである。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2 — the scoreboard': the left column gives Grok Voice Transcribe 2.0 WebSocket streaming with 500ms interim results, 2.29% batch WER, 162x real time throughput, $1.67 per 1,000 minutes, included diarization and general availability; the right column gives MAI Transcribe 2 no announced streaming, 2.04%, 333x, a $1.67 launch offer, included diarization and public preview with no SLA.

Grok Voice Transcribe 2.0が真に優れている点

• リアルタイムストリーミング — 約500 msごとに中間結果を返すWebSocketエンドポイント。リアルタイムSKUが発表されていないバッチ処理のみの場合とは対照的

• 最初の部分トランスクリプト精度 — AA-WER Streamingにおいて0.49秒時点でWER 3.4%、MAI-Transcribe-2が参戦していないカテゴリ

• エージェントトーク音声におけるバッチ精度 — 全体では2.29%だが、ノンストリーミングボードのAA-AgentTalkサブセットでは、その順位は見出しが示唆するよりも僅差であり、ストリーミングボードのエージェント中心の構成ではGrokが完全に首位に立っている

• 音声エージェントの基盤 — Smart Turn のターン終了検出とフィラー語除去はモデルに搭載されるのに対し、MAI-Transcribe-2 はターンロジックを呼び出し側に委ねる

• マルチチャンネル音声 — 1回の処理で最大8つの独立したチャンネルを文字起こしでき、ステレオ録音や多地点通話の録音で重要になります

• 単語レベルの信頼度 — タイムスタンプは単語ごとに信頼度スコアを保持するため、信頼度の低い範囲にはフラグを立て、等しく信頼するのではなく注意を促すことができます

• 可用性条件 — 公開された同時実行制限付きの一般提供(SLA なしのパブリック プレビューとは対照的)

• 価格の持続性 — 1時間あたり$0.10はバッチと$0.20のストリーミングティアの基準額の両方において恒常的な料金であり、マイクロソフトの同一の$0.10は期間限定のローンチオファーで、2027年の標準料金は発表されていない

その最後の点こそ、ほとんどの比較が見落としているところだ。両モデルのコストは現在同じだが、そのうち一方の価格には有効期限があり、もう一方にはない。Microsoftはプロモーション終了後の料金を公表しておらず、このオファーが2026年末まで続くのか、それとも終了時期がまったく明示されていないのかについて、報道の見解も分かれている。Microsoftの1,000分あたり1.67ドルを前提に3年分の文字起こし予算をモデル化しているなら、あなたはベンダーが確約していない数字を前提にしていることになる。

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard, showing MAI-Transcribe-2 at 2.04% AA-WER and 333x real time, Grok Voice Transcribe 2.0 at 2.29% and 161.77x, Gemini 3.5 Transcribe at 2.60%, GPT Transcribe at 3.31% and Whisper Large v3 at 4.07%.

重複は実際に存在し、それは機能リストの大半を占めている

ストリーミングの話は脇に置いておくと、この2つの製品は大きく収束する。どちらも話者ダイアリゼーションを行う。どちらも単語レベルのタイムスタンプを返す。どちらも逆テキスト正規化 — 数字、日付、通貨、連絡先情報を書かれた形でレンダリングすること — に対応する。どちらもドメイン用語を受け付ける。Grok Voice Transcribe 2.0 はリクエストごとに最大100のキーターム、MAI-Transcribe-2 はドメイン用語と略語リストとして。どちらも言語を自動検出し、録音中に話者が言語を切り替えるのにも追従する。どちらも8 kHzの電話音声を扱える。これはほとんどの文字起こしモデルがひっそりと失敗するケースであり、SpaceXAIが最も力を入れて調整した対象でもある — その社内電話音声セットはバージョン間でWERが10.6%から7.1%に改善した。これは自社音声に関する同社報告の数値だ。

どちらもまた、単に予算だけでなくアーキテクチャを形作る入力制限を備えています。Grok Voice Transcribe 2.0 は、8 kHz から 48 kHz までのサンプルレートを持つ 12 種類の音声フォーマットにわたり、最大 500 MB のファイルを受け付けます。MAI-Transcribe-2 の制限はモデルではなく Foundry パスによって設定されるため、チームは専用の STT サービスとの同等性を前提とするのではなく、現在の上限について Microsoft 自身のドキュメントを読むべきです。

その収束が意味するのは、判断が順に3つの問いに帰着するということだ。ライブである必要があるか、実際に何言語あるのか、そして精度の差がどれだけのコストになるか。最初の問いは二者択一で、一方の選択肢を完全に排除する。2番目は通常、自分の音声サンプルから答えられる。3番目は十分小さく、ほとんどのファイルベースのワークロードでは何も決定づけない——0.25ポイントの差は現実だが、両モデルがこれまでに誰かが測定した最良の数値から0.5ポイント以内に収まっているという事実もまた現実だ。

Screenshot of the Microsoft learn.microsoft.com MAI-Transcribe-2 model page, showing the September 3 2026 launch, the 60-language list with automatic detection and code-switching, the 5.2% FLEURS word error rate, the configurable verbatim and clean transcription styles, and the public-preview availability on Microsoft Foundry.

これをどうすればいいですか

二者を真っ向勝負の関係ではなく、2レーンのスタックとして扱いましょう。ライブのエージェント支援と夜間のコンプライアンスアーカイブを運用するコンタクトセンターは、Grok Voice Transcribe 2.0 と MAI-Transcribe-2 のどちらかを選んでいるのではなく、両方を動かしています。問題は、それが2つのベンダー関係、2組の認証情報、2つの請求書、2つのレート制限を伴うかどうかだけです。現在、どちらのモデルも OrcaRouter のカタログにはないため、文字起こしの呼び出し自体は各ベンダー独自の API に送られます。OrcaRouter の1つのキーがカバーするのは、その下流のすべてです。要約ツール、分類器、文字起こしを推論するエージェント、そして同じ録音に対する2社の出力を比較する評価ジョブです。最後の点こそが重要な理由です。これらのモデルをリーダーボードから判断することはできません。リーダーボードは8時間の英語のエージェント通話であり、あなたの音声はそうではないからです。

注視すべき点が2つある。第一に、ローンチオファーの終了時にMicrosoftがMAI-Transcribe-2へ標準価格を設定するかどうか。恒久的に1,000分あたり1.67ドルになるなら、コストだけでもバッチ処理の既定の選択肢になるし、MAI-Transcribe-1の1時間あたり0.36ドルへ戻るなら、この話はもっと短く済む。第二に、MicrosoftがストリーミングSKUを投入するかどうか。モデルカードはすでにリアルタイム字幕を対象シナリオとして挙げており、MAI-Transcribe-2とストリーミング路線の間に立ちはだかっているのはエンドポイントだけだ。それが実現すれば、この2つは別々の路線ではなくなり、ライバル同士になる。