
Muse Voice Transcribe:Metaのストリーミング音声テキスト変換モデルを解説
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 1009 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
Muse Voice TranscribeはMetaのストリーミング音声テキスト化モデルです。Meta Model API上で音声1時間あたり0.18ドル、モデルIDmuse-voice-transcribe-1.0で動作し、ライブ音声をストリーミングしても、録音済みのファイルを渡しても価格は同じです。一行の価格確認ではなく、リファレンスページを設ける価値があるのは、処理がどこで行われるかという点にあります。20以上の声の話者帰属と発話終了の検出は、ストリームの最後に付け足されるバッチ処理ではなく、認識モデルの内部で実行されます。これは音声テキスト化専用です — Metaの開発者向けドキュメントにもまさにその通りに記されています。音声合成は行わず、音声対話APIも提供しません。
これは、読者がモデル自身の名前で検索した後にたどり着くページであり、告知ではなく、二つの問い——このモデルは何なのか、そして音声1時間のコストはいくらなのか——に対する安定した答えとなるように作られている。何よりも先に記録に残すべき日付が一つある。それはこのモデルに関する事実であり、このページが存在する理由ではないからだ。Meta Superintelligence Labs は Muse Voice Transcribe を 2026-09-01に、日付入りの告知記事Introducing Muse Voice Transcribeで発表した——読者が今も Meta のブログインデックスを通じてたどり着ける記事だが、もはや自身の URL では応答しない。以下はすべて、2026-09-29 に Meta 自身のページで読んだもので、主にモデルページと API の音声テキスト変換および概要のドキュメントによる。Meta が数値を公表していない箇所では、このページは代用値を求める代わりにその旨を記す。
メタの言葉で言えば、これが何なのか
Meta自身のドキュメントは、その説明の冒頭でこう明言している。「Muse Voice Transcribeは、Meta Model API上のMetaの音声テキスト変換モデルです。ライブ音声または既存の録音を、発話ターン検出、話者ラベル、語彙バイアス付きで文字起こしします。」概要ページは同じ内容を一文に凝縮している——ストリーミング話者ダイアライゼーション、ネイティブのエンドポインティングと音声アクティビティ検出、文脈バイアスとキーワードバイアス、コードスイッチングに対応する評価済み25言語。つまり出力は、単一の文字起こしストリームに三つのラベルを同時に載せたものだ。言葉、誰が話しているか、そしてその発話が終わったかどうか。これは、現在の多くの本番スタックが、認識エンジンに加えて別個の音声アクティビティ検出器、さらに別個のダイアライゼーションモデルを組み合わせ、それぞれに独自のレイテンシ予算を持たせて構築している組み合わせそのものだ。
Metaのモデルページでは、これを「20人以上の話者に対するライブ帰属を伴う、競争力のあるレイテンシとストリーミング文字起こし精度」と位置づけており、開発者ドキュメントでは出力フィールドを「ターン単位のタイミングと任意の話者ラベルを含む文字起こしテキスト」と説明しています。そこから2つのことが導かれますが、どちらもその位置づけ以上に重要です:
• これは音声入力・テキスト出力のモデルです。テキスト入力でもテキスト出力でもなく、Meta はこれが音声生成器ではないと明言しています。
• まずストリーミングモデルです。リアルタイム経路はファイル経路のラッパーではなく、以下で説明する独自のイベント、モード、制限を持つ WebSocket セッションです。
音声1時間のコスト
Muse Voice Transcribe に関する Meta のモデルページには、価格が「単一モデルで構築して1時間あたり $0.18」と記載されており、その仕様表にはmuse-voice-transcribe-1.0を1時間あたり $0.18の音声、および1,000分あたり $3.00として掲載しています。これらは同じ料金を異なる2つの単位で表したもので、どちらも2026-09-29時点で読んだMeta自身のページに記載されています。開発者ドキュメントでは同じ料金を第3の方法で示しています。「価格は1時間あたり $0.18の音声処理です。」このページのどの数値もMetaの価格ページから引き継がれたものではありません。というのも、読むことのできるMetaの価格ページが存在しないからです。ドキュメントは料金を「価格とレート制限」ページへリンクしており、そのページはこのページは利用できません2026-09-29時点で読んだとおりの応答となっているため、料金の記録上の情報源はモデルページであり、ここで使用されているのはそれだけです。
課金の詳細は開発者ドキュメントに記載されており、ワークロードのサイズを見積もる前に知っておく価値があります。
• ストリーミングと非ストリーミングは同じコストです。リアルタイムエンドポイントに割増料金はありません。
• ゼロデータ保持処理は、ドキュメントによれば Standard ティアと同水準の価格設定です — 追加料金の項目ではありません。
• 課金は秒単位に切り捨てられるため、2秒のターンは3秒ではなく2秒として請求されます。
• 文字起こしが生成される前に発生した失敗は課金されず、429 のレート制限応答も課金されません。
• 無料クレジットはモデルレベルではなく、プラットフォームレベルで存在します。Metaの音声テキスト化ドキュメントは、料金に関する段落を「プラットフォームの無料枠クレジットが適用されます」という文で締めくくっています。これがこのモデルのページにある唯一の「無料」に関する文言であり、意図的に具体性を欠いています。これは文字起こしの無料枠を約束するものではなく、プラットフォームのクレジット制度を指しており、その金額、期間、適用条件は一切記載されていません。これはモデルの無料枠ではなく、請求額を減らす可能性のあるクレジットとして読んでください。Metaの消費者向け声明で、同社のパーソナルエージェントが「人々が必要とするほとんどの用途で無料」であるという記述は、Museアプリに関する別個の文であり、Model APIには及びません。
実例を挙げます。1時間あたりでは実感しにくいからです。2時間の録音インタビューの文字起こしは$0.36です。通話音声1,000時間——中規模コンタクトセンターのおよそ1か月分の量——は$180です。その規模になると、料金こそがすべての決め手になります。そして料金は、足元で変わりうる唯一のものでもあります。Metaのページがその料金の権威であり、そこで数字が変われば、ここでも変わります。
ストリーミングインターフェースを、エンドポイントごとに
This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.
• ライブ音声 — wss://api.meta.ai/v1/asr/realtime。トランスポートはWebSocketで、認証の詳細には罠があります。認証はハンドシェイクフレームで行い、Authorizationヘッダーは無視されます。ハンドシェイクは最初のJSONテキストフレームでなければならず、10秒以内に到着する必要があります。セッションは最大60分間続き、新しいWebSocketは新しいセッションを作成し、再開トークンはありません。
• 録音 — POST https://api.meta.ai/v1/asr/transcribe。マルチパートアップロードで、こちらは確かにヘッダーで認証しますAuthorization。入力は限定的で、16 kHzまたは24 kHzのモノラル16ビットPCM WAVのみです。上限はボディあたり32 MB、1リクエストあたり音声10分です。
リアルタイムセッション内では、3つのモードによって渡される内容が変わります。 PUSH_TO_TALK はデフォルトで、単一ターンの文字起こしを行います。 ENDPOINT はモデルが検出したターン境界を提供し、検出された発話セグメントごとに1ターンとして、speechStart、繰り返される transcript、speechEnd および speechComplete イベントを発行します — ただし、speechEnd は文字起こしではないことに注意してください。 DIARIZATION は自動話者検出と帰属を追加し、speaker イベントを A や B のようなラベル付きで発行します。部分文字起こしは、各部分が前のものを置き換える累積形式か、差分として提供されます。
同じドキュメントに記載された 2 つの運用上の詳細は、見落としやすく、本番環境で発見するには高くつく:
• 話者ダイアリゼーションは、クリーンな発話エンドポイントではなく、新たな話者の可能性を示すものであり、Metaは低遅延の音声コマンド用途向けに調整されていないと述べている。ラベルはセッション限定的な識別子として扱うこと — Aは、あるセッションでは次のセッションのAとは別人です。
• ターンは重複する可能性があるため、ターンごとの状態は到着順ではなく、ターン識別子をキーにすべきです。
• 公開されているテナントごとの上限は、128 同時ストリームおよび 1 時間あたり 16,000 ストリームです。
モデルの中で何が動き、何を置き換えるのか
Metaのモデルページは、スコアではなくアーキテクチャについて具体的な主張をしている。「20人以上の話者の話者帰属と発話終了検出は認識モデル内部で行われる」——そしてこれは、音声ストリームの末尾で一括処理を行う方式とはっきり対比されている。実用上の違いは、待つべき第二段階が存在しないことだ。話者ラベルとターン境界は単語と同じストリームで届くため、下流の音声エージェントやライブ字幕の表示面は、後処理のホップを挟まずに、完了したターンとその話者の識別情報を得られる。
Metaがモデル内に存在すると記述しているその他の機能:
• ネイティブのエンドポイント検出と音声アクティビティ検出により、API の前段で独自の VAD を実行する必要はありません。ドキュメントの表現では、独自の音声アクティビティ検出を実行しなくても、発話ごとに 1 つの完了したトランスクリプトが得られ、発話終了が検出されてもセッションは終了しません。
• コンテキストおよびキーワードによるバイアス付け、ファインチューニングなし。Metaのモデルページでは、精度が「コンテキストおよびキーワードによるバイアス付けを通じて、ファインチューニングなしで」維持されると説明されています。これは、ストリーミングASRを、一般的な言語の平均ではなく、専門分野の語彙——薬剤名、ティッカーシンボル、製品SKU——で使えるようにする機能です。ドキュメントはその限界について正確に述べています。キーワードは認識をバイアスしますが、正確な綴りを保証するものではなく、キーワードと言語バイアスはどちらもセッション開始時に固定されます。
• コードスイッチングに対応した評価済みの25言語。ドキュメントには次のように記載されています:アラビア語、ベンガル語、オランダ語、英語、フランス語、ドイツ語、ヘブライ語、ヒンディー語、インドネシア語、イタリア語、日本語、カンナダ語、韓国語、マレー語、標準中国語、マラーティー語、ポーランド語、ポルトガル語、スペイン語、タガログ語、タミル語、テルグ語、タイ語、トルコ語、ベトナム語。コードスイッチング — どの言語が来るかを知らされずに、文中や発話中に切り替えること — は、単一言語認識器が構造上提供できない能力です。留意すべき注意点が1つあります。言語バイアスは言語のリストであり、自由形式のコンテキストではなく、モデルにそれらを使用するよう強制するものではありません。
日付入りの発表記事はさらに踏み込んでいる。モデルは70以上の言語でトレーニングされ、そのうち25言語が「広範に検証済み」だと述べている——これはベンダーによる報告であり、検証済みの25言語のリストこそがMetaが保証するサブセットだ。計画の基準とすべきカバレッジはそちらであり、70ではない。
文書化された制限
リファレンスページの価値は、そこに記載された制約次第であり、Metaはいくつかの制約を記載している。
• 単語レベルではなく、ターンレベルのタイムスタンプです。モデルページにもドキュメントにもはっきりと書かれています。「返されるのはターンレベルのタイムスタンプであり、単語レベルのタイムスタンプではありません」。ターンにはミリ秒単位の開始時刻と終了時刻が含まれます。単語ごとのクリックシーク — カラオケのハイライト、単語ごとの信頼度ルーティング、強制アラインメント — が必要な製品にとって、これは間違ったモデルであり、どれだけプロンプトエンジニアリングを重ねてもその事実は変わりません。
• 信頼度スコアなし、音イベント検出なし、感情検出なし、文字起こしの再フォーマットなし。Metaはこの4つすべてを利用不可としている。得られるのは単語、ターン、タイミング、話者ラベルだけで、モデルがどれだけ確信しているかについては何もわからない。
• 音声合成および音声対話APIはありません。 一方向のみです。
• ファイルパスで利用できる音声フォーマットは限られています。モノラル16ビットPCM WAV、16または24 kHz。それ以外は、アップロードする前に変換する必要があります。
オープンウェイトとMuse Glimmerの混乱
Muse Voice Transcribe はプロプライエタリであり、API を通じて提供されています — オープンウェイトのリリースではなく、Meta のドキュメントもそう主張したことはありません。これが重要なのは、読者が Muse ファミリーのオープンウェイトの道筋を誤った名前に結び付けてしまうからです。 Muse Glimmer こそがその道筋です。Meta のドキュメントでは、Muse Spark から蒸留されたオープンウェイトのマルチモーダルモデルであり、寛容な Apache 2.0 ライセンスの下で配布され、vLLM、SGLang、llama.cpp、ExecuTorch などのランタイムを通じて自身のハードウェア上でダウンロードして実行できると説明されています。Muse Voice Transcribe は同じページで、ダウンロードするのではなく呼び出すモデルとして、Muse Spark、Muse Image、SAM とともに分類されています。
つまり、Muse Voice Transcribeには重みが公開されておらず、セルフホストの選択肢もなく、監査やファインチューニングを行う手段もない。もしどこかのページがそうでないと述べているなら、それはMuse Glimmerと混同している。モデルの重みが公開されていない場合、提供プラットフォームがすべてを物語る——そしてそれが次のセクションで扱う内容である。
クライアントがそれに到達する方法
Meta の Model API は、すでにお使いのクライアントにそのまま組み込めるように作られています。API の概要ページに記載されているベンダーの主張によると、Model API は「OpenAI 互換および Anthropic 互換のクライアントライブラリ、ならびに OpenAI 互換のエージェント CLI とドロップイン互換です。クライアントのベース URL を設定し、キーを追加すれば、残りのコードはそのまま使えます」。Model API 全体では、Responses API、Chat Completions API、Messages API という 3 つのリクエスト形式が提供されているため、既存の統合は通常、書き直しなしで一致するサーフェスを持ちます。範囲に関する注意点が 1 つあります。その互換性に関する文とこれら 3 つの形式は、Model API 全体の機能であり、Muse Voice Transcribe 自身のモデルページに記載されている文言ではありません。モデルページ自体のクイックスタートはより限定的で、「既存の OpenAI 互換クライアントを Meta Model API に向ける」こと、および 5 分以内に最初の動作するリクエストを得られることだけを述べています。
参照ページで指摘しておく価値のある正直なギャップが1つあります。このモデルに関するMetaのドキュメントには、Muse Voice Transcribeの公式クライアントライブラリが記載されておらず、その「Client libraries」ページはVoiceではなくSAMセクションの下に位置しています。代わりに音声テキスト変換ガイドが示してくれるのは、具体的な依存関係リスト — Python 3.9以降とwebsocketsおよびsounddeviceパッケージ — に加えて、音声APIの基礎クックブックです。つまり、ドロップインという主張はModel APIのリクエスト面全般を説明したものであり、リアルタイムASRエンドポイント自体は独自のハンドシェイク規則を持つWebSocketで、文書化されたラッパーはありません。

Metaがまだ公開していないもの
存在しないベンチマークはドキュメントに関する事実なので、ここではその事実として述べる。Meta の Muse Voice Transcribe のモデルページには、掲載された精度表がない。精度の根拠は3つの画像アセット——ストリーミング単語誤り率のリーダーボード、ダイアリゼーション誤り率の比較、ストリーミング精度指標——として提供されており、抽出可能なテキストには数値が一切ない。モデルページ自体には、単語誤り率もダイアリゼーション誤り率も示されておらず、言語別の内訳もない。
発表記事には、ベンダーが報告した数値、たとえばストリーミング時の単語誤り率や平均話者分離誤り率が実際に掲載されており、それらはモデル発表時に私たちが記事にした数値です。これらはMeta自身の測定値であり、第三者による再現は今も得られていません。このページではその比較を再実行しません。リリース日のベンダーベンチマークをリファレンスページで再実行すれば、再現されていない数値を確定済みのものであるかのように見せてしまうからです。はっきりと言えるのは、もっと限定的なことです。Metaはこのモデルについて、同等の調整努力と同一の評価ハーネスの下で、名前を挙げた競合他社に対する直接比較評価を公開していません。したがって、どこで読む比較であっても、異なる条件下で収集されたベンダー数値の比較にすぎません。
ひとつの日付も意図的に未確定のままとなっている。モデルページにはリリース日が一切記載されておらず、唯一のバージョン表記はモデルID内の-1.0だけである。本記事における2026-09-01という日付は、その日付付きの告知投稿に由来するものであり、ここでは出来事を報告するためではなく、モデルの日付を特定するために用いられている。


誰がそれを手に取るべきで、誰がそうすべきでないか
Muse Voice Transcribeを支持する論拠は、範囲こそ狭いが強力だ。単語、話者の識別、発話ターンの終端を同じストリーム上で必要とするライブ音声を、オンデマンドではなく常時稼働させられるほど低い価格で扱える。ボイスエージェント、ライブ字幕、会議・通話インテリジェンス、ディクテーション、大量の文字起こしはMetaが挙げるワークロードであり、このインターフェースが実際に合わせて設計されているワークロードでもある — エンドポインティングモードとセッションスコープの発話者ラベルを備えた60分間のWebSocketだ。
反対の根拠も同じくらい具体的だ。単語レベルのタイムスタンプ、単語ごとの信頼度、音響イベントや感情の検出、文字起こしの再フォーマットが必要なら、このモデルにはそれらがない。これはバグではなく、文書化された非対応だ。音声がモノラル16ビットWAV、16または24 kHz以外の形式で届き、ファイルエンドポイントを使っているなら、他の場所では不要な変換ステップを負うことになる。そして、アーカイブ録音のバッチ文字起こしで精度だけが評価軸という要件なら、ストリーミングの売り文句は何の役にも立たない。どちらの経路でも価格は同じなので、使うことのないリアルタイム機能にお金を払っていることになる。
制作パスにコミットする前に確認すべき唯一のことは、このページが答えるために存在する数値であり、それこそモデルがまったく変わらなくても変わりうる唯一の数値だ。音声1時間あたり$0.18——今日Meta自身のモデルページに記載されているとおりの数字である。この点についての権威はMetaのページにある。それが動けば、それを基準に大きさを決めたものすべて——1000時間の月、インタビュー1件あたりのコスト、内製か購入かの算段——がそれに合わせて動く。
