「MAI-Transcribe-2 vs GPT Transcribe」と表示された記事ヒーローカード。「MODEL COMPARISON」バッジ付き。サブタイトルは「Microsoft、トランスクリプトの全数値でOpenAIを下回る」。2.0% vs 3.31%のAA-WER、1,000分あたり$1.67 vs $4.50、約411倍 vs 約34倍のリアルタイム速度を比較するチップを掲載。白から青へのグラデーション背景、右下にOrcaRouterロゴ。
Guides & Insights

MAI-Transcribe-2 vs GPT Transcribe:マイクロソフト、OpenAIの文字起こしをあらゆる数字で下回る

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MAI-Transcribe-2をGPT Transcribeから隔てる3つの数字は、そのすべてが同じ方向を指している。Artificial Analysisの非ストリーミング単語誤り率リーダーボードでは、2026年9月3日にMicrosoftがリリースしたMAI-Transcribe-2がAA-WER 2.0%を記録したのに対し、GPT Transcribe(2026年7月28日にOpenAIがローンチした、録音済み音声向け文字起こしAPIで、5週間早く登場したもの)は3.31%だった。同じボードの速度係数では、MAI-Transcribe-2はおよそ実時間の411倍で動作し、GPT Transcribeの約34倍に対抗する。価格では、MAI-Transcribe-2はオーディオ1時間あたり0.10ドル(期間限定のローンチオファーとして1,000分あたり約1.67ドル)で、GPT Transcribeの1,000分あたり4.50ドルに対抗する。この最後の差は63%のアンダーカットであり、しかもOpenAIがつい数週間前に25%値下げしたばかりの製品に直撃する。これこそ、2番目のフロンティアラボが価格での競争を決めた瞬間のコモディティ市場の姿である。

ギャップを、一度にひとつの数字ずつ

正確性こそが第一だ。それは、どちらのベンダーもマーケティング上の主張の陰に隠せない数字だからだ。2.0%と3.31%は、両モデルに同じ独立評価基盤「Artificial Analysis」を適用して得られたものであり、この1.3ポイント差は、今回の比較全体で最も明確な事実である。つまり、同じWER水準で1,000語あたり約13件のエラーが少ないということだ。GPT Transcribeの3.31%は、それ自体が旧モデルのGPT-4o Transcribeから約0.7ポイントの改善であり、OpenAI自身の多言語テストでは、Whisper時代のエラー率をほぼ半減させる結果を示した。マイクロソフトは今回、同じリーダーボードの2位の座を単独で獲得し、多言語FLEURSでは60言語の平均WER 5.2%を報告している。ただし、この数値はマイクロソフトの発表記事からの引用であり、言語ごとに独立に再検証されたものではない。

次に速度です。GPT Transcribeの約34倍速(リアルタイム比)は、非同期文字起こしエンドポイントとしては標準的で、1時間のファイルを約2分の計算時間で処理します。MAI-Transcribe-2の約411倍速(リアルタイム比)は、同じ1時間を9秒未満の計算時間で文字起こしします。Artificial Analysisの数値では、実際の差は12倍程度に近くなります。マイクロソフトはこれを「OpenAIのGPT-Transcribeより10倍高速」と宣伝していますが、これはベンダーが自社の優位性を切り上げではなく切り捨てているという、異例の意思表示です。率直に言えば注意点もあります。MAI-Transcribe-2の数値は4日前のもので、バッチファイルのスループットでありライブの遅延ではなく、一方GPT Transcribeの数値は5週間分の本番トラフィックに裏打ちされています。しかし、両製品のアーキテクチャを見る限り、速度差が縮まる兆候はありません。両者は同じバッチジョブのために構築されていますが、その効率性は大きく異なります。

価格は最後に持ってきた。なぜなら、それは決断を変える数字だからだ。GPT Transcribeは1分あたり0.0045ドル——1,000分で4.50ドル、オーディオ1時間あたり約0.27ドル——で、これはOpenAIが7月にGPT-4o Transcribeの0.006ドルから引き下げた後の価格だ。MAI-Transcribe-2は年末までオーディオ1時間あたり0.10ドルで、プロモーション終了後の標準価格は開示されていない。月1,000時間のオーディオの場合、その差は約170ドルになる:MAI-Transcribe-2の早期割引価格では約100ドル、GPT Transcribeのリスト価格では約270ドルだ。OpenAIの7月の25%引き下げは攻撃的に見えた。しかしMicrosoftの63%という値下げは、引き下げ後価格をさらに下回るもので、これは別のカテゴリーの動きであり、この比較が存在するすべての理由だ。

A two-column scoreboard titled 'MAI-Transcribe-2 vs GPT Transcribe — the scoreboard': left column MAI-Transcribe-2 lists 2.0% AA-WER, ~411x real time, $1.67 early-bird per 1,000 minutes, 60 languages, bundled diarization and verbatim/clean styles; right column GPT Transcribe lists 3.31% AA-WER, ~34x real time, $4.50 per 1,000 minutes, languages not published, no diarization and caller-side post-processing; footer notes AA-WER and speed per Artificial Analysis and vendor list prices.

なぜOpenAIの数字が信頼できるものだったのか

GPT TranscribeのAA-WER 3.31%が、ほとんどの発表数値よりも重みを持ったのには理由がある。独立した監査を受けた数値であり、その監査は過酷な音声に直面しても耐え抜いたからだ。ヘッドラインとなった数値を生み出した同じArtificial Analysisのランは、GPT Transcribeの弱点も浮き彫りにした。このカテゴリーで最も難しい公開ベンチマークであるEarnings22の決算説明会セットで記録したWER 6.10%である。これにより、購入者はこの製品をどこに使うべきでないかを正確に把握できた。その後5週間の本番トラフィックが続き、OpenAIの値下げは、マージンを守るための防御ではなく、コストでの競争を狙ったものであることを示した。GPT Transcribeはまた、そのAPIが持つ実用的な制約をそのまま引き継いでいる。バッチ処理専用の製品で、1リクエストあたり最大25MBのファイルに対応し、4.50ドルの価格帯にストリーミングプランはなく、ダイアリゼーションも語彙バイアスもなく、OpenAIが公開していない言語には対応していない。書き起こしをするのはそこまでで、言葉より上のレイヤーはすべて呼び出し側の責任である。

その明確さがあるからこそ、GPT Transcribeは信頼しやすかった。そして、まさにその明確さを、登場から4日しか経っていないモデルはまだ勝ち取っていない。MicrosoftはMAI-Transcribe-2について、ダイアリゼーション誤り率も、60言語のFLEURS平均の背後にある言語別精度テーブルも、ストリーミング向けSKUも公開していない。そうした欠落のどれも、モデルが弱いことを意味するわけではない。ダイアリゼーションのバンドル提供と60言語対応というフットプリントは、GPT Transcribeがそもそも提供していない、れっきとしたプロダクト上の機能領域なのだから。だが、そのひとつひとつが、独立した再実行によって評価結果が書き換わり得る箇所でもある。その精度数値はAA(Artificial Analysis)測定による本物の値だが、その周囲にあるプロダクトは、本番トラフィックだけが明らかにするまさにその点において、未実証なのである。

特徴量セットの形状が同じではありません

• 話者分離 — MAI-Transcribe-2は公開されたエラー率なしで話者属性を同梱している。GPT Transcribeはそれを一切提供しておらず、文字起こしはひと続きの未分化なストリームとして生成される。

• コントロール — MAI-Transcribe-2 は、名前や専門用語向けのキーワードバイアスに加え、逐語(verbatim)スタイルとクリーン(clean)スタイルの文字起こしを提供します。一方 GPT Transcribe はどちらも提供しておらず、句読点のない生の単語列を返すだけで、呼び出し元が後処理する必要があります。

{{1}}タイムスタンプ{{/1}} — {{2}}どちらも時間同期された出力を返します。MAI-Transcribe-2 のものは追加設定なしで単語レベルです。{{/2}}

• 言語 — MAI-Transcribe-2は自動識別付きで60言語に対応;GPT Transcribeは言語リストを公開しておらず、それ自体が多言語ワークロードにおける計画上の問題となっている。

• ストリーミング — GPT Transcribeの$4.50ティアはバッチ処理のみ対応で、そのストリーミング版であるGPT Live Transcribeは1,000分あたり$17の別製品です。MAI-Transcribe-2には、発表・デモのいずれにおいてもストリーミング製品は一切存在しません。

性質 — 両者はどちらも録音済みファイル向けのマネージドAPIであり、だからこそこの比較は妥当です。違いは、マイクロソフトが有用な後処理機能の多くを基本製品に組み込み、しかも価格が3分の1であることです。

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

誰が移動すべきか、そしていつか

大量のバッチ音声を文字起こししていて、そのアーリーバード価格が自分のファイルにも通用するなら、MAI-Transcribe-2は現時点で合理的なデフォルトだ。実測WERはより優れ、スループットは約12倍、1,000分あたりの価格は63%低い。しかもダイアライゼーションとスタイル制御がバンドルされており、OpenAIがそれらに追加料金を請求しないのは、そもそも提供していないからだ。移行のコストはわずかで済む。自分の手元で最も難しい音声の一部を使ってテストすれば、不確実性のほとんどは解消される。さらに、$1.67というレートなら、年末までこの実験はほぼ無料だ。

本番環境に不可欠、規制対象、またはすでにOpenAIを中心に構築されたワークロードであれば、5週間の先行優位と公表されているEarnings22の弱点は、価格差以上の価値があります。GPT Transcribeは、障害モードを明確に把握できるモデルです。MAI-Transcribe-2の障害モードはまだ発見されつつある段階です。慎重なパターンとは、ルーティング層がまさにサポートするために存在するものです。実績のあるモデルをデフォルトとして維持し、評価対象モデルに測定したトラフィックの一部を流し、昇格させる前に自社データで文字起こし結果を比較します。この試験導入と段階的昇格のプロセスこそが、OrcaRouterの自動フェイルオーバーとルーティングDSLの核心です。新しいモデルは、命令によってではなく割合で本番トラフィックを獲得します。そして、200以上のモデルに到達する同じワンキー設定により、STT競争が続く間、スタックの他の部分は文字起こしプロバイダーに依存せずに済みます。

MAI-Transcribe-2の数値の背後にあるローンチ記事は、すべてを絶対的な数値としてではなく、名前を挙げた競合他社との比較として提示している。これは、読む人にとって有益な規律チェックとなる。すなわち、相対的な主張を取り上げ、独立した掲示板で絶対的な数値を確認し、残りをベンダーの枠組みとしてラベル付けする、というものだ。

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

1.67ドルのレートには有効期限があり、2.0%には4日間の実績しかない。そしてOpenAIは最終的にその両方に応じてくるだろう。だが、この市場の姿はちょうど今、変わった。史上初めて、最も安価な高精度マネージド文字起こしAPIが、最も正確で最速でもある。しかもそれはOpenAIのものではない。たとえMAI-Transcribe-2の標準価格がローンチ時の提供価格を大きく上回るとしても、マネージド文字起こしにおける精度対コストの基準は引き上げられた。そして、その基準はマイクロソフトの条件で動いたのだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新