
MAI-Transcribe-2 vs Muse Voice Transcribe:同じ週、音声をめぐる正反対の賭け
- openaiNEWOpenAI: GPT-6 Astra2026-09-0455知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0247知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0247知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0157知能82コーディング
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2646知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1849知能75コーディング
- obsidianQwen3.8 27B2026-08-1541知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1251知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0547知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0347知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2140知能69コーディング
2026年9月1日の週に、2つの最先端研究所から2つの音声モデルが登場しました。MAI-Transcribe-2とMuse Voice Transcribeは、「音声インテリジェンスがどこに存在すべきか」という問いに対する正反対の答えとして捉えるのが最も適切です。2026年9月1日にMeta Superintelligence LabsがリリースしたMuse Voice Transcribeは、リアルタイム音声認識モデルです。ライブ音声を80ミリ秒のチャンクに区切り、そのストリーミングパス1回で文字起こし、20人以上の話者の分離、発話終了の検出をすべて行い、計測されたストリーミング音声文字変換リーダーボードでトップに立っています。その2日後の9月3日にMicrosoftがリリースしたMAI-Transcribe-2は、正反対の賭けに出ています。バッチエンジンであり、ライブのレイテンシーを一切追わず、その代わりに録音済みファイルの文字起こしに全力を注ぎ、独立系の非ストリーミングリーダーボードで最も低い単語誤り率を記録しています。処理速度はおよそ実時間の411倍、料金は約1,000分あたり1.67ドルです。両者を「文字起こしモデル」として直接比較すると、実際の選択基準が見えにくくなります。その基準とは、音声の存続期間のどの時点で言葉が必要か、つまり音声が流れている最中なのか、それとも終了した後なのか、という点にあります。
異なる瞬間を指し示す2つの製品
Muse Voice Transcribeは、音声がまだ流れている最中の瞬間のために作られています。これはMetaのMuseファミリーに属する自己回帰型マルチモーダルモデルであり、自動音声認識、20人以上を対象とした話者ダイアライゼーション、そして発話終了検出——話者が話し終えたことを検知してシステムが応答できるようにする機能——という3つの処理を1回のパスに統合しています。Metaの報告によると、最終文字起こしは話者が話し終えてから約0.16秒後に生成され、最終文字起こしでの単語誤り率は3.1%、最初の部分結果では3.6%です。これらの数値はMetaが発表当日に公開したもので、Artificial Analysisのストリーミングリーダーボードを引用していますが、本稿執筆時点では独立した再現検証は行われていません。このモデルは1時間を超える音声を単一ストリームで処理でき、文の途中で言語を切り替えることも可能で、70以上の言語でトレーニングされ、発表時点で25言語が徹底的に検証されています。価格はMeta Model APIを通じて、音声1,000分あたり3.00ドル(1時間あたり約0.18ドル)です。Metaはウェイトを公開しないことを確認しています。
MAI-Transcribe-2 は、音声がすでにファイルとして存在する場面向けに作られています。Microsoft のモデルは、Artificial Analysis の非ストリーミングリーダーボードで AA-WER 2.0% を記録しており、これは2位で、マネージドバッチ API の中では最高の数値です。また、約411倍速で実行されますが、これはスループットの数値であり、レイテンシーの保証ではありません。自動言語識別により60言語の文字起こしに対応し、話者分離、単語レベルのタイムスタンプ、キーワードバイアス、逐語的スタイルとクリーンなスタイルの選択をまとめて提供し、ヒングリッシュやスパングリッシュなどのコードスイッチングにも対応します。このモデルは、Microsoft Foundry のパブリックプレビューと MAI Playground で利用可能です。価格は音声1時間あたり0.10ドルで、年末までの期間限定ローンチオファーです。ストリーミング製品は発表されていません。Microsoft の発表記事では、このモデルを長尺音声とバッチ音声向けと明確に位置づけています。これらのワークロードでは、ストリーミングモデルの低レイテンシーは価値を発揮しない一方で、1分あたりのコストは無視できません。

その2つの精度数値はなぜ矛盾しないのか
自然な直感としては、2.0%と3.1%を比較して勝者を宣言したくなるが、それは二重に間違っている。第一に、これらの数値は異なるタスクを測定している。MAI-Transcribe-2の2.0%は、録音済み音声に対する非ストリーミング精度であり、モデルがファイル全体を確認できる。Muse Voice Transcribeの3.1%は、音声が到着するにつれて文字起こしするという制約の下で生成された最終トランスクリプトに対するストリーミング精度である。ストリーミングはより難しい問題であり、だからこそストリーミングリーダーボードと非ストリーミングリーダーボードは、別々のスコアを持つ別々のボードになっている。第二に、それらのラベルは重みが異なる。MAI-Transcribe-2の数値は、モデルに対するArtificial Analysisの測定値だが、Muse Voice Transcribeの数値は、Artificial Analysisが測定した内容に関するMetaの発表当日の報告であり、ベンダー報告であって再現されていない。正直な言い方をすれば、両モデルはそれぞれのボードの最上位にある信頼に足る主張であり、どちらの数値ももう一方の領域については何も示していない。
本当の比較ポイントは話者分離機能だ。というのも、両製品に共通して搭載されているのはこの機能であり、両者の野心の違いが最も明確に表れるのもこの機能だからだ。Muse Voice Transcribeは、中核となるストリーミング機能として20人以上の話者を分離できる。Metaは、平均話者分離エラー率が17.5%だったと報告しており、競合他社の範囲としては21.1%〜28.6%を挙げている。ただし、これもまたMetaによる自己報告であり、未検証である。MAI-Transcribe-2にも話者分離は搭載されているが、マイクロソフトは対応話者数の上限も話者分離エラー率も一切公表していない。二者間の通話であれば、どちらの製品でも問題なく、その差は実質的に意味を持たない。12人規模のフォーカスグループやパネルディスカッションの録音となると、複数話者の上限を明示しているのは、この2つの製品の中ではMuse Voice Transcribeだけだ。そして、MAI-Transcribe-2の話者分離が未測定であることが、より難しい音声データをこの製品に任せる前に、まずテストすべき最大の理由なのである。
理にかなった価格比較
価格面では、バッチ対ストリーミングという枠組みが示唆するよりも両者は近い。1,000分あたり$1.67(MAI-Transcribe-2、早期割引)と1,000分あたり$3.00(Muse Voice Transcribe)は、どちらもマネージド音声認識サービスとしては安い部類だからだ。この比較が意味を持つのは同じレーンの中だけである。録音済み音声のバッチ文字起こしについては、MAI-Transcribe-2はストリーミング前提のモデルの半分以下の価格でありながら、より良い非ストリーミングWERを備えている。ただし、録音ファイルをMuse Voice Transcribeに回すのは、どうしてもそのストリーミングパイプラインを使いたい場合だけであり、アーカイブを処理する効率的な方法ではない。ライブ会議音声に関しては、Muse Voice Transcribeはこの記事で取り上げる製品の中で唯一実際に機能する製品であり、その1,000分あたり$3.00という料金は、市場投入時に競合した他のリアルタイム文字起こしAPI(Gemini 3.5 Transcribe Liveが1,000分あたり約$9、GPT Live Transcribeが$17)を下回る。しかも、それらの製品にはない20話者以上のダイアライゼーション(話者分離)にも対応している。率直に言って価格の要点はこうだ。Metaはストリーミングの価格を低く設定し、Microsoftはバッチの価格をさらに低く設定した。そして両方の数字はプロモーション期間中の価格であり、各ベンダーが標準料金を発表すれば変動するだろう。

どれがどのオーディオ用?
音声がライブで扱われる場合 — リアルタイムで文字起こしされる会議、ボイスエージェント、ライブキャプションなど、話されている最中にその言葉を必要とするあらゆる場面 — Muse Voice Transcribe が最有力候補であり、その差は歴然としています。これはここにある唯一のストリーミングモデルであり、同じパスで20人以上の話者を分離でき、初日からその分野で勝つべく価格設定されていました。その弱点は、トライアルで確認すべき点です。精度とダイアリゼーションの数値はMetaによる報告であり、リリースから1週間のストリーミングモデルは、ローンチベンチマークの外にある複雑な音声に対してどのように動作するかをまだ示していません。
扱う音声がすでにファイルとして存在する場合 — アーカイブ、通話録音、メディアライブラリ、一括処理されるあらゆるもの — MAI-Transcribe-2 は、重要となるあらゆる軸で優れた数値を示します。測定されたWERはより低く、スループットはおよそ1桁高く、1,000分あたりの価格はストリーミングモデルの価格を下回ります。そのリスクはMuseのそれと正反対です。リリースからわずか4日で、ストリーミング向けSKUはなく、話者分離品質は未測定、さらに標準価格が非公開のままの早期割引料金が設定されています。
MicrosoftのMAI-Transcribe-2を紹介するランチページには、Microsoftが同梱する機能が列挙されており、ストリーミング競合他社は同じパスでは提供していません。また、どの主張が製品の機能領域で、どれがまだベンチマーク上の約束事なのかを判断する際に確認すべきドキュメントでもあります。

そして、文字起こしがパイプラインの前半部分にすぎないのなら、この2つのどちらを選ぶかは、それらより上位のレイヤーで下す選択ほど重要ではない。Muse Voice Transcribeが文字起こししたライブ会議の音声は、要約、アクションアイテムの抽出、フォローアップのドラフト作成を経て初めて有用になる。MAI-Transcribe-2が文字起こししたアーカイブ通話にも、検索、機密情報の削除、適切な下流システムへの転送が依然として必要だ。マルチモデルプラットフォームが存在価値を発揮するのは、まさにこのレイヤーだ。OrcaRouterは200以上のモデルを単一のAPIで利用でき、プロバイダー定価を0%マークアップでそのまま通す。したがって、下流の処理は単一のインテグレーションのままで、ワークロードごとに異なるモデルを呼び出せる。どちらの音声モデルがパイロットで採用されても、文字起こし層より上のスタックを乗り換えのために作り直す必要はない。現時点で、Muse Voice TranscribeもMAI-Transcribe-2もそのラインナップには含まれていない。両者とも各ベンダー独自のAPI上で動作する。今週、実際に決着がついた賭けは、より狭く、より実用的だ。リアルタイム文字起こしもバッチ文字起こしも、どちらも十分に安くなった今、差別化要因はもはや言葉そのものではなく、その言葉をどう活用するかにある。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
