記事のヒーローカードには「MAI-Transcribe-2-Streamingが公開中」と表示され、バッジ「新モデル · MICROSOFT AI」、サブタイトル「Microsoft、2.5% WERでストリーミング文字起こしの王座を獲得」があり、統計ストリップには、発話終了後0.13秒時点でのストリーミング単語誤り率2.5%が示され、カード上ではMicrosoftの主張であり、最終および部分文字起こしの両方で初と表示されています。60言語と自動連続言語検出、および1,000分あたり$9.00で、2026年まで導入価格として音声1時間あたり$0.54と説明されています。白から青へのグラデーション上、右下にOrcaRouterロゴ。
Guides & Insights

MAI-Transcribe-2-Streamingが公開:Microsoft、2.5% WERでストリーミング文字起こしの王座を獲得

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MAI-Transcribe-2-Streamingは、Microsoft AIが9月のリリースで未解決のままにした1つの疑問に対する答えであり、28日でそれに答えました。2026年10月1日にリリースされたMAI-Transcribe-2-Streamingは、ファイルが終了した後ではなく、単語が到着するにつれて文字起こしを行うリアルタイム音声テキスト変換モデルです。Microsoftによると、Artificial AnalysisのAA-WER Streaming評価において、最終および部分文字起こしの両方で精度第1位にランクされ、単語誤り率2.5%、音声終了後0.13秒で最終文字起こしが準備されます。これは、トラッカーが公開する行ではなく、トラッカーの方法論に基づくベンダーの主張です — 起草時点で、ボードの37モデルにはこれが含まれておらず、それが置き換えるモデルは、2.73%と0.49秒のGro​k Voice Transcribe 2.0(Streaming)です。それが基づいているモデルであるMAI-Transcribe-2は、9月3日にバッチモデルとしてWER 2.0%で出荷され、リアルタイムSKUはありませんでした。ストリーミングバリアントは、バッチバージョンを注目させるほどの精度をあまり犠牲にすることなく、そのギャップを埋めます。それが犠牲にするのは価格です。ストリーミングはローンチ時のバッチレートの5.4倍です。

Microsoftが望む見せ方は、ストリーミング・リーダーボードの完全制覇だ。数字が裏付ける見せ方は、より狭く、より興味深い——精度とレイテンシの両方で首位に立つと主張するモデルであり、その最前線では、リーダーボードで最も高精度なエントリーは最速のものたちよりも確定までが4倍遅く、それら高速なもののいずれも単語誤り率が3%未満ではなく、価格は既存製品と同等で、それを下回ってはいない。以下は、実際に行われた発表です。ベンダーの主張にはラベルを付けています。

Microsoftが10月1日にリリースしたもの

MAI-Transcribe-2-Streamingは、Azure AI Speechサービス内のMicrosoftの音声スタックを通じて提供され、ドキュメントはモデル自身の名前で公開されており、バッチリリースと同じAPI専用・重み非公開の配布モデルを採用しています。自動連続言語検出により60言語を文字起こしするため、ストリームの途中で言語が切り替わるセッションでも、事前に宣言する必要はありません。Microsoftは、Artificial Analysisのストリーミングチャートにおける精度対レイテンシのパレートフロンティア上にこれを位置づけています——これはベンダー自身によるトラッカーデータの解釈であり、トラッカー自身のチャートが裏付ける解釈でもあります。

ストリーミングモデルだけが今回のリリースではなかった。Microsoftはそれとともに2つの音声モデルを投入した。MAI-Voice-2.1は26ロケールにわたり23言語をカバーし、MAI-Voice-2.1-Flashは最大45秒の音声を約150 msのレイテンシーで処理する。一組として見れば、10月1日のリリースは、単一モデルの発表ではなく、聞く・理解する・話すを備えた完全なリアルタイム会話スタックだ。

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

ストリーミングリーダーボードを読み込み中

AA-WER Streamingはモデルごとに2つのことを測定する。完成した文字起こしがどれだけ誤っているかと、話者が話し終えてから完了するまでの時間だ。Microsoftの主張では、MAI-Transcribe-2-Streamingはその両方で首位に立つ。音声終了から0.13秒後の最終文字起こしで単語誤り率2.5%、最初の部分文字起こしでも0.12秒時点で同じ2.5%であり、Microsoftはこれが両方の精度で初だと述べている。これはベンダーによる数値として読むべきだ。執筆時点では、トラッカー自身のストリーミングボードにこのモデルはまだプロットされておらず、独立したMAI-Transcribe-2-Streamingの行は存在しない。ボードが実際に示しているのは、このモデルが打ち負かすと主張している競合領域であり、その領域は「王冠」という見方より僅差だ。

• Grok Voice Transcribe 2.0 — Artificial Analysisによると、発話終了から0.49秒時点での最終トランスクリプトWERは2.73%で、現在リーダーボードの首位。これはMicrosoftが公称する2.5%に0.23ポイント及ばず、確定まで約4倍遅い——追いつく字幕と遅れる字幕の違いだ。

• Muse Voice Transcribe — Artificial Analysisによると、0.16秒で3.06%。レイテンシーで最も近い競合は約30ミリ秒遅れており、精度はMicrosoftの主張より0.5ポイント低い。

• ElevenLabs Scribe v2 Realtime — Artificial Analysisによると、0.14秒で3.59%。速度では実質互角だが、精度では1ポイント以上後れを取っている。

• Gemini 3.5 Transcribe Live — 0.40秒でのストリーミングWERは4.00%。これはArtificial Analysisが公表し、Googleが自社のLive APIモデルについて引用している数値だ。それは1.5ポイントの差であり、今回のリリースが狙う比較対象でもある。

初回部分結果の列は、その主張がボードの残りと最も似ていない場所だ。同じトラッカー上では、Grok Voice Transcribe 2.0 の初回部分結果は 3.36%、Gemini 3.5 Transcribe Live のそれは 5.77% にある。部分結果は最終的な書き起こしより悪くなるはずで、多くの場合 1 ポイント以上悪化する。モデルが文が終わる前に確定してしまうからだ。初回部分結果が最終的な数値と一致するのは、Microsoft の発表の中で本当に異例な部分であり、それはトラッカー自身のデータではまだ確認できない部分でもある。行が存在するまでは、主張として引用すること。

正直に言えば、0.13秒と0.16秒は、キャプションを読む人間にとって同じ製品体験であり、現在リーダーボードをリードしている2.73%に対する2.5%は、1,000語あたり約2件のエラーにすぎない。その程度のリードは本物だが小さく、誰もが体感できるリードかどうかはワークロード次第だ。それが実際に効いてくるのはテールだ。コンタクトセンターのストリームを1日8時間、2.73%対2.5%で動かせば、年間で数万語分の余分な誤りが生じる。しかもトランスクリプト内の単語エラーは均等に分布しているわけではない。それらは、まさにトランスクリプトを有用にする固有名詞と数字に集中する。

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

$9.00で1,000分購入できるもの

ストリーミングはバッチよりコストがかかり、Microsoftはそれをリアルタイム層の下ではなく最上位に価格設定した。MAI-Transcribe-2-Streamingの価格は音声1時間あたり$0.54で、ストリーミング音声1,000分あたり$9.00に相当し、年末までの期間限定の導入価格と説明されている。比較すると、バッチのMAI-Transcribe-2は音声1時間あたり$0.10 — 1,000分あたり$1.67 — なので、同じ基盤ファミリーでリアルタイム文字起こしはファイルベース料金の約5.4倍、単語誤り率は0.5ポイント高い。これはMicrosoftが隠している上乗せ価格ではない。常時接続と、文が終わる前に正しくなければならない部分的な文字起こしに対する正直な価格なのだ。

ストリーミング層の他のモデルと比較すると、状況はまちまちだ。MAI-Transcribe-2-Streamingは、1,000分あたり約9ドルでGemini 3.5 Transcribe Liveと並ぶ——より正確で、同じ価格だ。それは、1,000分あたり約6.50ドルのElevenLabs Scribe v2 RealtimeとDeepgram Fluxより上に位置し、約4ドルのCartesia Ink-2より上、約3ドルのMuse Voice Transcribeの約3倍の価格だ。つまり、このローンチは同等価格での精度とレイテンシーを狙ったものであり、価格競争ではない。すでにより安価なストリーミングモデルを運用しているチームは、ドルをWERのポイントと引き換えにすることになる。

そのトレードオフは正確に名付ける価値がある。なぜなら、それはバッチのローンチが反転させたのと同じトレードオフだからだ。9月にMicrosoftは精度を安価にした。10月には、リアルタイム精度のコストを他社と同じにした。あなたのパイプラインが最終的に文字起こしを必要とするだけなら、10月1日によって請求が変わることは何もない。通話がまだ進行中の間にそれが必要なら、判断の基準はただ品質へ移っただけだ。

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

トランスクリプトを基盤に構築することは、その決定のもう半分であり、マルチモデルレイヤーがその価値を発揮する場面です。リアルタイムのトランスクリプトがパイプラインの終点であることはまれで、それは要約され、スコアリングされ、検索され、ルーティングされ、エスカレーションされ、これらのステップはそれぞれ異なるコストで異なるモデルを必要とします。OrcaRouterはそのレイヤーのために存在します。200以上のモデルにまたがる単一API、プロバイダーの定価を0%のマークアップでパススルー、自動フェイルオーバー、そしてルーティングDSLにより、2つ目の統合なしで、ライブトランスクリプトをコンプライアンス審査用にあるモデルへ、議事録用に別のモデルへ送信できます。MAI-Transcribe-2-Streaming自体はそのラインナップには含まれず、Microsoft自身の音声スタックを通じて提供されますが、それが生成するストリーミングトランスクリプトは、まさにその上のレイヤーをモデル非依存に保つべきだと裏付ける、大量かつレイテンシに敏感な入力の種類です。

まだ証明されていないこと

真に未解決な点が3つある。第一に、話者分離(ダイアライゼーション)だ。バッチモデルは話者帰属を同梱しているが、公開されたダイアライゼーション誤り率はない。そしてMicrosoftのストリーミング資料は、ダイアライゼーションについて一切主張していない。リアルタイムモデルがライブのエージェント支援やキャプションに供給する場合、「誰が何を言ったか」は、生のWERよりも重要になる機能であることが多い。第二に、多言語の内訳だ。自動継続言語検出を備えた60言語というのは広範な主張であり、ストリーミングモデルの言語ごとのレイテンシは、バッチ版よりもはるかに変動しうる。部分文字起こしの品質は、モデルがどれだけ早く言語を確定するかに依存するからだ。Microsoftは言語別のストリーミング表を公開していない。第三に、ストリーミングWERはクリーンなベンチマーク音声で測定されている。実際の導入を損なう故障モードは、ノイズの多い遠距離場(ファーフィールド)ストリームであり、ローンチ当日には独立したファーフィールド・ストリーミング比較は存在しなかった。

それがあなたのスタックをどのような状態に残すか

このローンチで興味深いのは、Microsoftが最も精度の高いストリーミング文字起こしを提供していることではない。リリースの刻み方だ。9月にバッチ、10月にストリーミング、同じファミリーで、同じドキュメントのサーフェス上、しかも同じ基盤能力に対して1,000分あたり$1.67から$9.00まで広がる価格体系を伴っている。これによりチームは初めて本当の選択肢を得る——リアルタイムが重要な場面でだけリアルタイムに課金し、それ以外はすべてバッチにする——が、同時に、文字起こしレイヤーは一度標準化するものではなく、ワークロードごとに調整するものになったということでもある。

見出しの主張を文字通りに読めば、ベンダーによる声明としては成り立つ。Microsoftは、MAI-Transcribe-2-Streamingが最終トランスクリプトと初回部分の両方の精度で首位であり、パレートフロンティア上に位置すると述べている。ただし注意すべき点は、トラッカーのボードにまだこのモデルがプロットされていないこと、現在のリーダーに対して主張するリードが再実行で消えるほど小さいこと、価格面の優位性がゼロであること、そして話者分離に関する話がまだ語られていないことだ。注視すべきはそれらであり、王冠ではない。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新