「Muse Voice Transcribe」(Meta Superintelligence Labs初のリアルタイム音声知覚モデル)のヒーロータイトルカード。ストリーミング波形にはASR、20+話者ダイアリゼーション、エンドポインティングがラベル付けされ、$0.18/オーディオ時間と記載された価格チップも表示されている。
Guides & Insights

Muse Voice Transcribe が公開されました: Meta初のリアルタイム音声知覚モデル

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Muse Voice Transcribeは、Meta Superintelligence Labsが開発した初のリアルタイム音声認識モデルで、2026年9月1日にリリースされました。その価格設定はまるでネタバレのようです。Meta Model APIでは、音声1,000分あたり3.00ドル(1時間あたり約0.18ドル)です。このモデルは、1回のストリーミングパスで、ほとんどの文字起こしスタックが3つのシステムに分けて行う処理を実行します。自動音声認識、20以上の話者にわたる話者ダイアライゼーション、そしてエンドポインティング(話者が思考の途中で一時停止したのではなく実際に話し終えたタイミングを判断する役割)です。Metaによると、このモデルはArtificial Analysisのストリーミング音声文字起こしリーダーボードで首位に立ち、最終文字起こしの単語誤り率は3.1%、話者が話し終えてから0.16秒後に結果を出力します。

その最後の数字が何かの役割を果たすには、まず正直なラベルが必要だ。それはMetaが発表当日に示した主張であり、独立したリーダーボードを指し示している。そのモデルは、発表が出た時点で、呼び出し可能になってから1日も経っていなかった。研究室の外では誰もまだ3.1%を再現できていない。そして、精度の主張は一つの事柄であり、残りの売り込み——70以上の訓練済み言語、ネイティブなコードスイッチング、強化学習による「適応的遅延」——は、同じ船に乗った別のベンダー主張のセットだ。この投稿のすべては初日時点のモデルの状態であり、ベンダーの数字はベンダーの数字として明記されている。

初日に重要な数字

• 価格 — Meta Model APIでは、音声1,000分あたり3.00ドル(音声1時間あたり約0.18ドル)で、当社が追跡する主要なストリーミング文字起こしAPIすべてを下回ります。

• 精度の主張 — 発話終了後0.16秒時点の最終文字起こしでWER 3.1%、0.13秒時点の最初の部分文字起こしでWER 3.6%。ベンダー報告であり、Artificial Analysisのストリーミングリーダーボードを引用。

• ダイアリゼーション — 20名以上の話者、別途後処理ステップなしでストリーミング出力(Metaの報告によると、平均ダイアリゼーション誤り率は17.5%)。

• 言語 — 70以上の言語でトレーニング済み。ローンチ時点で25言語が「徹底検証済み」。文内・文間のシームレスなコードスイッチングにも対応。

• Context — 1時間を超える音声を処理し、専門用語の多い分野向けに言語、キーワード、コンテキストのバイアス調整に対応しています。

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

ここで「オーディオ知覚モデル」とは何を意味するのか。

アーキテクチャこそが物語である。Muse Voice Transcribeは、80ミリ秒のチャンク単位で音声を取り込み、単語が安定するにつれてストリーミング出力する。これが実際の「リアルタイム」の意味するところだ。興味深いのは、単語を確定するタイミングをどう判断するかという点だ。固定のレイテンシー予算(認識器が早期に確定して推測するか、長く待って回避するかという標準的なトレードオフ)ではなく、このモデルはMetaが「適応的遅延」と呼ぶ方式を採用している。簡単な発話は素早く処理し、確信度が低い単語についてはより多くの音声コンテキストを保持する。遅延ポリシー自体は強化学習によって学習されているため、このモデルはグローバルな単一設定を適用するのではなく、単語ごとに速度と精度のバランスを効果的に取っている。

その違いこそが、MetaがMuse Voice TranscribeをASRモデルではなく「音声知覚モデル」と呼ぶ理由です。出力ストリームは単一のライブ文字起こしであり、誰が話しているかと、発話がいつ完了するかも同時に伝えます。ストリーミングシステムは通常、認識器に音声アクティビティ検出器と話者分離モデルを貼り合わせてこれら3つのラベルを組み立てますが、それぞれが独自のレイテンシと独自の失敗モードを追加します。

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

話者分離と発話終端検出を内蔵

話者ダイアライゼーションは、最も精査する価値のある部分だ。なぜなら、ストリーミング製品が最も誇張しがちな機能だからである。Metaによれば、このモデルは1つの録音から20人以上の話者を分離し、平均ダイアライゼーションエラー率17.5%を報告している。同社はこれを、競合システムに帰する21.1〜28.6%の範囲と対比している。どちらの数値も発売日にベンダーが公表したものであり、17.5%を独立した評価が確認したものはまだない。構造的に確かなのは、ダイアライゼーションが認識と同じストリーミングパス内で実行されるということだ。「オーディオをアップロードし、待ち、話者を受け取る」という2番目のステップは存在せず、これこそが、ライブ環境で20人以上の話者追跡を可能にする設計上の選択なのである。

エンドポインティングは、目立たない機能でありながら、間違いなく最も有用です。生のストリーミングASRを公開する転写APIは、呼び出し側に発話終了検出を自分で実装するよう強いるため、音声エージェントがしばしば人の言葉を遮ったり、無音のまま放置したりする原因となっています。Muse Voice Transcribeは、ターンが完了したタイミングを判断し、その境界をストリームの一部として出力します。そのため、アプリケーションはVADレイヤーを構築することなく、「この話者は終了した」という明確なシグナルを得ることができます。

多言語の主張を注意深くお読みください。

Metaは70以上の言語でモデルをトレーニングしましたが、ローンチ時点で検証しているのは25言語です。これらは別物です。「トレーニングされた」とはデータに含まれていたことを意味し、「広範に検証された」とはMetaが社内テストで実際に保証するサブセットです。本番利用においては、25言語の検証済みリストが実際のカバレッジであり、70と25のギャップは、40言語をそれに通す前に知っておく価値があります。本当に異例なのは、コードスイッチングの話です。このモデルは、指示なしに文の途中や発話の途中で言語を切り替えるように設計されており、これは多言語地域における実際の痛点であり、ほとんどの単一言語ASR製品には単純にできないことです。言語、キーワード、コンテキストのバイアスがカスタマイズの話を完成させます。ドメイン語彙に向けて認識をバイアスすることができ、これはストリーミングASRを医療、法務、サポートキューの現場で使えるようにする機能です。

3つのサーフェス、1つのモデル

Muse Voice Transcribe は、同時に3つのサーフェスで提供されます。有料版は Meta Model API で、音声1,000分あたり3.00ドルです。コンシューマー向けは Meta AI for Mac で、Fnキーを押しながら任意のアプリケーションに音声入力できます。これは Apple の内蔵音声入力に対する Meta の回答であり、このモデルのローンチ初日における最も目に見える実世界展開です。開発者向けは Muse Code で、Meta のコーディングエージェントであり、音声コマンドでマルチエージェントセッションやリファクタリングフローを駆動します。音声入力機能とコーディングエージェントを動かす1つのモデルは、「1つのストリーミングモデル、多数のサーフェス」という提案を製品化したものです。

価格が下回るもの

オーディオ1時間あたり0.18ドルという価格で、Muse Voice Transcribeはストリーミング文字起こし分野のリスト価格を大きく下回っています。当社が追跡している比較セットは以下の通りです。GoogleGemini 3.5 Transcribe Liveは1,000分あたり約9ドル、ElevenLabsのScribe v2 Realtimeは1,000分あたり6.50ドル、CartesiaのInk-2は4.00ドル、OpenAIGPT Live Transcribeは17.00ドルとしてリストされています。これらは各ベンダーが公表している数字であり、それらのモデルのうちいくつかは、Museがまだ持っていない独立した精度エビデンスを有しています。初日の価格リーダーシップは、確定したリーダーボードと同じではありません。しかし、話者分離(ダイアリゼーション)とエンドポインティングを内蔵したストリーミングモデルが、既存のストリーミングAPIの価格のおよそ5分の1から10分の1で参入するという数字は、いずれにせよ期待値を塗り替えるものです。

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

正直な注意点

Muse Voice Transcribeはプロプライエタリであり、モデルの重み(ウェイト)は公開されていない。「自前で実行する」という選択肢は存在せず、監査やファインチューニングのためのオープンウェイトの道筋もない。精度に関する主張は発表当日時点のものであり、再現されていない。検証済みの25言語は、低リソース言語のカバレッジに関して「学習に使用した」とされる70以上の数字と一致しない可能性がある。また、話者分離(ダイアライゼーション)のベンチマークは、どれほど有望に見えても、独立した実行によって確認されるまではベンダーによる測定値にすぎない。録音済み音声の正確なバッチ文字起こしだけを要件とするチームにとっては、より安価で監査が行き届いた選択肢が依然として存在する。ストリーミングの売り文句はリアルタイムの対話に関するものであり、音声1時間あたりのコストでバッチ文字起こしの世界に打ち勝つことに関するものではない。

次に見るもの

今回のローンチが一過性の出来事になるのか、それともトレンドになるのかは、4つの要素にかかっている。第一に、独立した検証を経て、Artificial AnalysisのストリーミングリーダーボードがMuse Voice Transcribeを実際に1位として掲載するかどうかだ。ローンチ当日の主張を裏付けるには、ボードでの順位が確定する必要がある。第二に、20人以上の話者に対応するダイアライゼーションが、実際の騒がしい会議という現実に耐えられるかどうか。第三に、MetaのMac向けディクテーション機能が、APIのデベロッパー採用につながるかどうか。第四に、既存プレイヤーが価格にどう反応するかだ。1時間あたり0.18ドルでダイアライゼーションとエンドポインティングを備えたストリーミングモデルは、それより高い価格を設定しているすべての競合に、目に見える圧力をかけるからだ。Metaがこのモデルを追加のサービングパートナーに開放した時点で、OrcaRouterのようなパススルーゲートウェイは、プロバイダーのリスト価格を0%のマークアップで転送するため、リセラーによる上乗せのない、同じ1,000分あたり3.00ドルという数字を、公開されたその日に表示することになる。それまでは、Muse Voice Transcribeを利用できるのはMetaの自社APIだけだ。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube