
MAI-Transcribe-2-Streaming 対 MAI-Transcribe-2:単語レベルのタイミングに5.4倍を支払う
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
MAI-Transcribe-2-StreamingとMAI-Transcribe-2は、同じモデルファミリーが2つの価格帯に分かれたもので、その分割は計画を立てるのに十分明確です。MAI-Transcribe-2は2026年9月3日にバッチモデルとしてリリースされました:Artificial Analysisの非ストリーミングのボードで単語誤り率2.0%、約411倍のリアルタイム速度、音声1時間あたり0.10ドル — 1,000分あたり約1.67ドルです。MAI-Transcribe-2-Streamingは2026年10月1日にリアルタイム版としてリリースされました:最終的な文字起こしまで0.13秒で、ストリーミングの単語誤り率は2.5%と主張されており、マイクロソフトはこれを、最終および部分的な文字起こしの両方の精度で初だと説明しています。これはArtificial Analysisのストリーミング手法で測定されたもので、まだトラッカーのボードに行としてプロットされてはいません。音声1時間あたり0.54ドル — 1,000分あたり約9.00ドルです。同じ60言語、同じAPIのみの提供、公開された重みはありません。ストリーミングはバッチ料金の5.4倍のコストで、マイクロソフト自身の数値では精度が0.5ポイント低いです。それがお買い得か負担かは、一つの疑問に完全に依存します:あなたのパイプライン内の何かが、文が終わる前に文字起こしを必要としていますか?
2つのモデルは同じベンダーと同じドキュメント体系から来ているため、この比較は異常なほどクリーンだ——機能同等性を推測する必要も、ベンチマークのバージョン不一致も、「彼らの数値対我々の数値」もない。単一のベンダーが同じ能力の2つの速度に値付けしているのであり、興味深いのは、安価なティアが実際にどのワークロードをカバーするかを見極めることだ。
家族、2列に並んで
• MAI-Transcribe-2 — バッチ、事前録音音声、2026年9月3日リリース。2.0% AA-WER、Artificial Analysisの非ストリーミングリーダーボードで2位。約411倍のリアルタイムで、これも2位。音声1時間あたり$0.10、1,000分あたり約$1.67で、年末までの期間限定オファーとなっており、標準価格は公表されていない。話者ダイアライゼーションを同梱し、単語レベルのタイムスタンプを返す。自動言語識別に対応した60言語。
• MAI-Transcribe-2-Streaming — リアルタイムのWebSocket方式による連続文字起こし、2026年10月1日リリース。Microsoftは、発話終了から0.13秒で最終文字起こしのWER 2.5%、最初の部分結果でも0.12秒で同じ2.5%を報告しており、これを両方の精度において初だと説明している——Artificial Analysisのストリーミング手法で測定されたベンダーによる主張だが、執筆時点ではトラッカー自身のボード(37モデル)にまだこのモデルはプロットされておらず、現在の首位はGrok Voice Transcribe 2.0で2.73%および0.49秒。音声1時間あたり$0.54、1,000分あたり約$9.00、年末までの導入価格。自動連続言語検出に対応する60言語。公開された話者分離の主張はなく、公開された単語タイムスタンプの主張もない。
速度や価格をめぐるものではない唯一の非対称性は、機能です。バッチモデルの話者分離と単語タイムスタンプは文書化された機能ですが、ストリーミングモデルのそれらは文書化されていません。これは0.5ポイントの精度差よりも重要であり、多くのチームが結局両方を動かすことになる理由でもあります。

5.4×が実際にもたらすもの
1,000分あたり1.67ドルの場合、この精度ティアでのバッチ文字起こしは、限界的にはほぼ無料に近い。1,000分あたり9.00ドルの場合、ストリーミングは実際の費目となる — 同じ音声を5回文字起こしするのとほぼ同じコストに、さらに0.5ポイントの精度が加わる。したがって、問題はリアルタイムがより価値があるかどうかではなく、どの特定の分がそれを必要とするかである。
それが明らかなワークロードは次の3つだ。話し手が話している間に人が読むライブキャプション——そこでは0.13秒かファイル末尾かが製品そのものを決める。リアルタイムのエージェント支援とコンプライアンス採点——通話が終わってから届く介入には価値がない。そして対話型音声アプリケーション——トランスクリプトが完成するまでターンを完了できない。この3つすべてにおいて、バッチモデルはより安価な選択肢ではなく、選択肢にすらならない——事後文字起こしがリアルタイムになる価格は存在しない。
明確にそうではないワークロードは次のとおりです。事後に処理される会議や通話の録音、メディアアーカイブ、コンタクトセンターのバッチQA、完了した通話のコンプライアンス審査、ポッドキャストと動画の字幕作成。これらはまさに、バッチモデルの411倍のリアルタイム性能と$1.67の料金が勝つために作られたパイプラインであり、誰も明日まで読まない文字起こしから数百ミリ秒を削るために5.4倍を支払うのは、明らかな無駄です。話者分離と単語タイムスタンプの機能を加えれば——バッチモデルでは文書化されており、ストリーミングモデルではそうではない——事後処理のケースは弱まるどころか、より強くなります。
興味深い中間領域は、この2つが真に補完し合うところにある。ライブサーフェスにはストリーミングを、記録にはバッチを走らせる。サポート通話をリアルタイムで文字起こししてエージェント支援パネルを動かし、その後、一晩かけてバッチで再文字起こしして、話者分離とタイムスタンプ付きのアーカイブ用トランスクリプトを生成する。これはバッチのみの場合に比べてわずかな追加コストで、両方の挙動が得られる。そのパターンは9月に初めて可能になり、10月のリリースがそれを完成させる。
二部構成が現れるところ
この家族について注目に値する点が二つある。それらは偶発的ではなく構造的なものだからだ。
第一に、精度の階層は通常のパターンとは逆転している。ストリーミングモデルは通常、リアルタイム出力のために相当な精度の代償を払う。ここでの代償は0.5ポイントで、バッチのボードでは2.0%だったものが、ストリーミングのボードでは2.5%と主張されている。マイクロソフトは、自社の数値上、リアルタイムモデルを自社のバッチ版フラッグシップの0.5ポイント以内に収めた。これが維持されるなら、10月リリースの実際のエンジニアリング上の成果はここにあり、ボード首位の順位ではない——ボード首位は、うまく再実行すれば動く可能性があり、トラッカーもまだ確認していない。
第二に、料金設定も通常のパターンとは逆になっている。ベンダーは通常、より大量利用の階層を割引するが、マイクロソフトはストリーミングをバッチの5.4倍に価格設定し、両方を同時に失効する導入料金のままにした。これは意図的なストリーミング割増というより、それぞれがローンチ割引を伴う2つの別個の立ち上げのように読め、どちらにも公表された標準料金がない。2027年の予算を計画しているチームは、両方の数値を暫定的なものとして扱うべきだ — 1.67ドルと9.00ドルはどちらも期間限定と表示されており、どちらにも後継価格は発表されていない。

まだ証明されていないこと
バッチモデルについて9月に浮上した未解決の疑問は、いまだに未解決のままだ。公表された話者ダイアライゼーション誤り率はなく、60言語という主張を裏づける言語別の内訳もなく、後継モデルの名も示されないままのプロモーション価格があるだけだ。ストリーミングモデルは、リアルタイム処理に固有の疑問をもう一つ加える。ストリーミングWERはクリーンな音声で測定されており、ノイズの多い遠距離(far-field)ストリームにおける部分的な文字起こしの品質こそ、実運用で最も重要でありながら、発表資料で最も触れられていない障害モードだ。さらにストリーミング部門の僅差も引き継いでいる。トラッカーの37モデルのボードでは上位3モデルが1ポイントの何分の1かの差に収まっており、つまり「首位」は再実行によって変わりうる状態にすぎない。そしてマイクロソフトの「首位」は、実測の1行ではなく主張である。
とはいえ、注視すべきはファミリーレベルの問いだ。Microsoftは今や同じ機能を、5倍の隔たりがある2つの価格で販売しており、高価格のティアには、廉価なティアが明記している2つの機能が欠けている。話者分離と単語タイムスタンプがストリーミングSKUに搭載されれば、差は純粋にレイテンシーと価格のトレードオフへと縮まり、判断はずっと単純になる。搭載されなければ、この2分割構造は恒久的なものとなり、アーキテクチャはそれを前提に構築されるべきだ。
これによって文字起こしスタックはどうなるのか

実際的な結論としては、文字起こしは9月に単一の明細項目であることをやめ、10月にはルーティング上の判断になった。かつては単一のAPIに標準化していたパイプラインが、今ではライブ向けにはストリーミング、記録向けにはバッチ、そしてどの音声がどの経路を通るかのルールを求めるようになっている。そしてそのルール自体がルーティング問題であり、あるベンダーのリリースサイクルに収まるには奇妙なほどの複雑さだ。
その負荷が最も重くのしかかるのは、文字起こしの上に位置する層だ。どの層がテキストを生成するにせよ、そのテキストはその後、要約され、分類され、秘匿化され、ルーティングされる。そしてそれらの処理は、それぞれ独自のレイテンシとコスト特性を持つ言語モデル上で実行される——ライブの文字起こしには高速で安価なモデルが求められ、アーカイブ用ならより強力なモデルを使う余裕がある。OrcaRouterはまさにその層をカバーする。200以上のモデルにまたがる単一API、プロバイダー定価を0%のマークアップでそのまま提供、自動フェイルオーバー、そしてパイプライン単位ではなくワークロード単位でモデルを選ぶルーティングDSLだ。MAI-Transcribe-2-StreamingもMAI-Transcribe-2も、そのラインナップには載っていない——どちらもMicrosoft自身の音声スタックを通じて提供されている——しかし、二部門構成の文字起こしレイヤーは、その下流にあるすべてをポータブルに保つための、これまでで最も強い論拠だ。
正直なまとめ:ストリーミングは、より優れた MAI-Transcribe-2 ではない。別の価格の第2の製品だ。本当にリアルタイムが必要な分数にはそれを買い、残りは安価なティアに残し、導入期間が終わって両方の料金が改定されることを想定して予算を組むべきだ。
