
MAI-Transcribe-2 が正式公開:マイクロソフト、1時間10セントで音声テキスト変換市場の支配を狙う
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 は、Microsoft AI が音声テキスト変換をプレミアム機能ではなくコモディティにすると賭けているモデルであり、同モデルに搭載された数値はその主張を裏付けるために設計されています。2026年9月3日に Microsoft Foundry、MAI Playground、Microsoft 自身の API サーフェス上でパブリックプレビューとしてリリースされた MAI-Transcribe-2 は、5か月間で3番目となる Microsoft 音声モデルです。4月にオーディオ1時間あたり0.36ドルで登場した MAI-Transcribe-1 と、6月の MAI-Transcribe-1.5 に続くものであり、チームが実際に比較検討する2つの指標において、名前を挙げたすべてのマネージド競合をリードする初めてのモデルでもあります。Artificial Analysis の非ストリーミング単語誤り率リーダーボードでは、AA-WER 2.0% で2位、約411倍リアルタイムでも2位となっており、これらが相まって精度と速度のパレートフロンティア上に位置します。このボード上で、より正確かつより高速なモデルは存在しません。発売価格は、自社の前モデルを約72%下回ります。
「世界で最も速く、最も正確で、最も安価な音声認識モデル」というのは、マイクロソフト自身がこのリリースに付けた見出しであり、元資料に付された注記(アスタリスク)は無視せずに読むべきだ。これは実際に起きた発表の経緯であり、ベンダーの主張にはラベルが付けられ、まだ証明が必要な部分は分離されている。
Microsoftが実際に出荷したもの
MAI-Transcribe-2は、録音済み音声を対象としたバッチ処理型の文字起こしモデルであり、会議、通話、メディアアーカイブ、コンタクトセンターの録音といった長時間音声に焦点を当てています。Microsoftは、スループットと1分あたりのコストが重視されるワークロードに、まさにこのモデルを位置づけています。自動言語識別により60言語の文字起こしに対応し、発言を正しい話者に割り当てる話者分離、単語レベルのタイムスタンプ、名前・略語・専門用語のためのキーワードバイアスを備えています。設定可能な2つの文字起こしスタイルは、一般的な使い分けをカバーします。「verbatim」(逐語)は、コンプライアンス対応の文字起こし用にフィラーや言い直しを保持し、「clean」(クリーン)は、字幕やメモ用に非流暢表現を除去します。またMicrosoftは、HinglishやSpanglishのような複数言語が混在する発話におけるコードスイッチングと、雑音の多い実環境の音声に対する頑健性も強調しています。

このモデルの提供のされ方は、機能一覧と同じくらい重要だ。マイクロソフトはこれをエンタープライズ向け音声スタックの背後に隠してはいない。モデルは今日からMAI Playgroundでデモ可能で、Microsoft Foundryを通じてパブリックプレビューとして提供される。FoundryのドキュメントはAzure AI Speechサービスの配下に置かれている。これは意図的な配布判断だ——フロンティアモデルを、開発者がキーひとつで叩ける場所に置くのであって、エンタープライズの営業サイクルによる承認を先に必要とする場所には置かない。マイクロソフトは重み(weights)を公開しておらず、発表資料を見る限り、今後公開する示唆もない。
見出しを文字通りに読む
「世界最速、最も正確、そして世界最安」は強さの異なる三つの主張であり、発表記事自体がそのうちの二つをひそかに格下げしている。それぞれの正直な言い方は、
• 正確性 — Artificial Analysisのリーダーボードでは、MAI-Transcribe-2はAA-WER 2.0%で2位であり、1位ではない。Microsoft自身の本文でも2位と述べられている。「最も正確」という表現は、「この水準で追跡されているマネージド・バッチAPIの中で」と読んだ場合にのみ成立するが、それでもこれは発表から4日しか経っていないモデルに関する主張であり、確固たる称号ではない。Microsoftは別途、FLEURS多言語ベンチマークにおいて、60言語全体で平均WER 5.2%と1位であると報告している。この数値はMicrosoftの発表記事からのものであり、言語ごとに独立して再検証されたものではない。
• 速度 — Artificial Analysis によると、MAI-Transcribe-2 はリアルタイムの約 411 倍の速度で動作し、そのボードでは 2 位です。不思議なことに、マイクロソフト自身の発表では絶対的な数値を一切示さず、代わりに「主要な競合他社よりも最大10倍高速な処理、特に長時間の音声において」といった、より親しみやすい相対倍率を前面に出しています。具体的には、OpenAI の GPT-Transcribe より 10 倍、ElevenLabs の Scribe v2 より 7 倍、Gemini 3.5 Transcribe より 5 倍高速です。これらの比率は、同じ Artificial Analysis のデータに対するマイクロソフトの枠組みであり、ベースレートが重要です。「Gemini 3.5 Transcribe より5倍高速」というのは、音声1時間あたりの計算時間を分に換算するまでは、控えめな差に聞こえます。
• 最安 — Microsoftが明確に述べている2つの制約内でのみ当てはまる。0.10ドルの料金は「年末までの期間限定オファー」であり、プロモーション終了後の標準価格は発表資料のどこにも開示されていない。また、高精度なマネージドAPIの中では最安だが、Whisper Large v3 Turboのようなセルフホストのオープンモデルは、実質的に電気代だけで文字起こしができる。コモディティ化という主張は現実的だ — ただ、見出しが示すより範囲が狭い。

1,000分あたり1.67ドルで買えるもの
音声1時間あたり$0.10の価格設定で、MAI-Transcribe-2は音声1,000分あたり約$1.67になります。この数字の意味が際立つのは、精度を競う他のマネージド型文字起こしAPIとの比較です。GPT-Transcribeは1,000分あたり$4.50で提供されています。Gemini 3.5 Transcribeのプリレコード(録音済み)音声向けプランは、Googleのトークン制料金で1,000分あたり約$5に相当します。ElevenLabsのScribe v2はそれよりもさらに高く設定されています。月間1,000時間の音声——コンタクトセンターやメディアのワークロードとして、かなりの規模ではあるが法外ではない量——を処理する場合、アーリーバード価格のMAI-Transcribe-2と定価のGPT-Transcribeの差は、精度の違いを考慮する前から毎月約$170になります。この価格差があれば、文字起こしはチームが最適化する費用項目ではなくなり、無視できる費用項目になります。
ここでは、2つの注意点を同じ文脈で述べておくべきだ。第一に、プロモーション価格は、恒久価格になるまでは価格実験である。$0.10というレートを前提に製品を構築しているチームは、標準レートが非開示であることを認識しておく必要がある。2027年度の予算を立てる際の正直な計画数値は、ローンチ時のオファー価格と、オファー終了時にマイクロソフトが提示する価格との間のどこかに位置するだろう。第二に、「この精度帯では最安」という点は、総所有コストについて何も語っていない。このモデルはAPI専用であるため、大量に利用するチームにとって重要な比較は、1,000分あたり1.67ドルという価格を、他のAPIと比較することではなく、自前のオープンウェイトのスタックを運用するための全込コストと比較することである。
スコアボードに凝縮すると、開始位置は次のようになります。下の各数値には、上記本文で付された出典ラベルが付いています。

まだ証明されていないこと
発表の主張は具体的とはいえ、依然として未解決な点が3つある。第一はストリーミングである。MAI-Transcribe-2はバッチモデルで、マイクロソフトの高速化の主張はファイルスループットに関するものであり、リアルタイム向けSKUは発表もデモもされていない。「411倍」はライブ文字起こしのレイテンシー数値ではない。第二はダイアライゼーション(話者分離)の品質である。話者帰属は同梱されているが、マイクロソフトはダイアライゼーション誤り率を公開しておらず、独立したテストでWER(単語誤り率)よりも悪い結果に見える可能性が最も高い機能でもある。第三は多言語の内訳である。60言語を対象にしたFLEURSの平均値ひとつで、言語ごとの大きなばらつきが隠れてしまう可能性があり、マイクロソフトは言語別の表も公開していない。これらの点はいずれも、発表から4日目を迎えた今もこの一件が決着していない理由である。
それがお使いの文字起こしスタックを離れる場所
今日、MAI-Transcribe-2を選ぶ必要があるわけではない。まさにそのため、この価格設定は、新しいベンダーを探しているチーム以外からも注目に値する。音声テキスト変換がパイプラインの終点になることは稀であり、文字起こしは要約され、アクションに変換され、検索され、ルーティングされる。そして、その下流レイヤーこそ、マルチモデル構成が真価を発揮する場だ。OrcaRouterのようなプラットフォームは、スタックのその半分を担うために存在する。200以上のモデルに単一APIでアクセスでき、プロバイダーのリスト価格を0%マークアップで透過的に適用し、自動フェイルオーバーを備え、さらにルーティングDSLにより、文字起こしをワークロードごとに異なるモデルへ送ることができる。議事録はある要約モデルへ、コンプライアンスレビューは別のモデルへ——追加の統合なしに。MAI-Transcribe-2自体は、現在このリストには載っていない。Microsoft自身のAPIと、Microsoftがリストアップする第三者のプラットフォーム上で提供されている。しかし、今回提示されたコモディティ価格は、文字起こしの先の部分をモデル非依存で構築するための、これまでで最も有力な論拠となる。
The launch price is the tell. Microsoft is not trying to win speech-to-text on features alone — it is trying to make high accuracy so cheap that the category stops being a line item. MAI-Transcribe-2 deserves the attention it is getting; just read "fastest, most accurate and cheapest in the world" with the three asterisks attached: second on AA-WER, promotional pricing through year-end, and a streaming story that has not been told yet.
