「Muse Realtime Avatar」の生成ヒーローカード。オーバーラインは「Meta AI Research - 2026年9月23日」、タイトル、そして3枚のラベル付きカード:「Muse Realtime Voice - 会話レイヤー、音声トークンをストリーミング」、「Muse Realtime Avatar - その上に構築された具現化レイヤー、研究用途のみ」、「Muse Spark 1.2 - 本日OrcaRouterでルーティング可能なMuseモデル」。OrcaRouterのロゴは右下隅に合成されている。
Engineering & Research

Muse Realtime Avatar:Metaが作ったもの、その上で動くもの、そして今も通話できない理由

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Muse Realtime AvatarはMetaの具現化技術です。これが受け取るのは、Muse Realtime Voiceが生成する音声ストリームで、それに対応するパフォーマンスをレンダリングします。写真のポートレートに向ければ、顔がわずかな表情の変化で応答し、全身のイラストに向ければ、その人物が話しながら身振りを交え、姿勢を変えます。Meta AI Researchは2026年9月23日、「Bringing Your Muse to Life」と題した投稿でこれを発表しました。これは製品ではなく研究成果であり、Meta自身のページにはAPIも価格もウェイトリストも公開日もありません。そのため「今日使えるのか」という問いへの正直な答えは「いいえ」です。今日呼び出せるMuseモデルは別のもので、Meta Muse Spark 1.2です。

その答えは、最後の段落ではなく最初の段落で述べる価値がある。なぜなら、この名前を検索する読者はたいてい、それを前提に計画を立てるかどうかを判断しているからだ。計画はエンドポイントではなく、研究を軸に立てよう。

先に一つ、はっきり言っておくべきことがある。このページは、自ら認めるべきルールを破っているからだ。このブログは通常、モデルが発表された週にそのモデルについて書く。Muse Realtime Avatarは、このページが公開される1週間前に発表された。そのため、鮮度ウィンドウを厳密に解釈するなら、この項目は飛ばされることになる。これは、日付のついた出来事を扱うニュース記事ではない。これは、今日のカタログの話題の中で現役であるモデルの参照ページだ。読者がそのモデル名そのものを入力した後にたどり着くページであり、その根拠は、発表の鮮度ではなく、私たち自身が測定した恒常的な検索需要にある。9月の発表は、ここではそのモデルに日付を与える事実として挙げられているのであり、報告すべき出来事としてではない。また、以下のいずれも第二の発表ではない。その日の私たちの報道は別記事であり、別記事のままにしておく。

Museファミリーの中での位置づけ

Metaは、これらが2つの製品ではなく、1つのシステムの2つの層であることを明確に述べている。Metaの表現では、「Muse Realtime VoiceとMuse Realtime Avatarは、知能、音声、身体性をつなぐ単一のストリーミングシステムを構成する」。音声層は会話知能を提供し、発話トークンのストリームを出力する。MetaはこれをVQと呼ぶが、それは何が話されるかと、どのように発話されるかの両方を伝える。オーディオデコーダがそれらのトークンを音声に変換し、アバター層は同じストリームを消費して映像を生成する。1つのトークンストリームを共有することが、音声、唇の動き、表情を同期させる要因であり、後から付け足す別個のリップシンク処理は存在しない。

つまり、Muse Realtime Voice は会話レイヤーです。Muse Realtime Avatar は、その上に構築された具現化レイヤーです。どちらも、あなたが通話できる相手そのものではありません。

隣接する名称にも同じように注意してください。なぜなら、それはどちらかと取り違えられる可能性が最も高いものだからです。Muse Voice Transcribe は文字起こし用エンドポイントであり、まったく別の製品です。Meta の開発者向けドキュメントは明確です。「これは音声テキスト変換専用であり、音声を合成したり、音声間会話 API を提供したりすることはありません。」これはターンレベルのタイムスタンプを返し、単語レベルのものは返しません。また、Meta はそのページでこれを 1 時間あたり $0.18 と記載しています。これは実在する、価格設定されたエンドポイントです。これは音声ではなく、ましてやアバターでもありません。

実際に呼び出し可能なMuseモデルは{{KEEP}}Meta Muse Spark 1.2{{/KEEP}}です。これは{{KEEP}}Meta{{/KEEP}}が100万トークンのコンテキストとテキスト、画像、動画、ファイル、音声入力に対応して提供している推論モデルです。これは本日ここでルーティング可能で、プロバイダーの定価、マークアップなしで、カタログ内の他のすべてと同じキーで利用でき、そのライブカードには完全な仕様が掲載されています。当社は{{KEEP}}Muse Realtime Avatar{{/KEEP}}を取り扱っていません。これを書いている時点で改めてライブモデルリストを確認しましたが、そこに載っている{{KEEP}}Muse{{/KEEP}}の項目は2つの{{KEEP}}Spark{{/KEEP}}チェックポイント、1.2とその前身の1.1だけです。それよりも曖昧な言い方——このファミリーが「一部利用可能」——をすれば、当社がルーティングしていないものをルーティングしているかのように示唆することになります。

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

Meta自身の言葉で説明されたテクノロジー

Metaによるこのアーキテクチャの説明は、言い換えるよりも引用したほうがよいほど簡潔だ。Muse Realtime Avatarは「音声駆動型のDiffusion Transformerで、音声トークンストリーム、参照メディア、直近の動画潜在変数のローリングウィンドウを条件とし」、さらに「短い因果的チャンクで動画を生成する」。この文の後半が要となる部分だ。各チャンクが完了するたびに、その最新の生成済み潜在変数が次のチャンクのモーションコンテキストになる。Metaが挙げている理由は連続性である。つまり、アバターの外見と所作はターンをまたいで引き継がれ、計算量は一定範囲に収まる。これにより、ドリフトしたり予算を使い果たしたりすることなく、会話が続く限り生成を続けられる。

来歴の仕組みが同じ段落に属するのは、Metaがそれを後付けではなくシステムの一部として提示しているからだ。生成された動画には、Meta Video Sealを通じて付与される耐久性のある不可視のウォーターマークが埋め込まれており、Metaによればこれはリアルタイム経路に遅延を加えないという。

Metaはこの件を測定し、それについて4つの数値を公表した。それらの数値——そして、それぞれに必要な具体的な注意書き、とりわけ高速化のように読めて実際にはそうではないもの——は発表時の記事に属するもので、その記事はそれらを文脈ごとそのまま伝えている。ここで生の数字を繰り返すつもりはない。というのも、注意書き付きの版がまさに防ごうとしているのは、そうした生の数字そのものだからだ。

私たちはその発表を当日、Muse Realtime Avatarのローンチ記事で取り上げました。そこは、慎重に表現された主張を全文で読める場として今も変わりません。

名前が示さないもの

3つの偽の隣人は、1つずつ除外する価値がある。なぜなら、それらはいずれも、名前だけからすると妥当な推測だからだ。

• それはMuse Voice Transcribeではありません。そのエンドポイントは音声をテキストに変換するもので、Meta自身の説明によれば、逆方向の処理は一切行いません。必要なものが文字起こしであるなら、Metaはそれを別商品として販売しており、それは別物で価格も異なります。

• これは音声クローニングサービスではありません。Metaのページには、特定の人物の声を合成すること、音声モデルを販売すること、ユーザーから音声サンプルを受け入れることを記述したものは何もありません。音声レイヤーはトークンストリームを生成すると説明され、アバターレイヤーはそれを受け取ると説明されています。このフレーズが通常想定する製品形態——サンプルをアップロードし、クローンを入手する——はここで説明されているものではなく、Metaが公開しているデモ資料もモデル能力の例示として位置づけられています。

• それはMeta自身のアプリ内のコンシューマー向けアバターではない。Metaはその例に、見落としやすく、心に留めておく価値のある注意書きを添えている。デモは「モデルの能力を示すものであり、Muse appで利用可能なアバターをすべて反映しているわけではない」というもので、Museは18歳以上のユーザー向けだ。これを文字どおりに読んでほしい。この投稿が示しているものの一部は、能力であって、提供中の品揃えではない。

4つ目の名前は、別の理由で切り分けておく価値がある。Muse Realtime AvatarはMuse Videoではない。Muse Videoは、今年の大半を公開リーダーボード上で過ごしながら、いまだに出荷されていない動画生成モデルだ。この状況についての当社自身のページ――Muse Video:リリース日、APIアクセス、そしてMeta Connectが変えるかもしれないもの――には、ここで言い換えずそのまま繰り返す制約がある。Muse Videoについて、より新しいMetaの発表なしに特定のローンチ日や価格を引用しているページは、憶測を述べていることになる。同じ規律はこのページの主題にも当てはまるため、このページはそのどちらも引用しない。その記事はまた、混同してはならない日付も示している。Muse Videoは2026年7月7日にプレビューされたものであり、リリースはされていない。だからこそ、このファミリーを検索すると、別のモデルに属する日付が出てくるのだ。

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

このページの目的と、それを変えるもの

ここでリファレンスページが適切な形である理由は、測定可能です。2026年9月25日までの28日間で、その完全一致の用語は当社の検索プロパティで164インプレッションを獲得し、クリックは0件で、最高順位は9.3位でした。当社の50以上のページがどこかでそのフラグメントに言及しており、そのトラフィックのほぼすべてが1つの告知投稿に着地しています。実際に持続的な需要があり、1ページ目まであと一歩の圏外にランクされ、誰もコンバージョンさせていない用語は、需要の問題でも品質の問題でもありません — ページの問題です。モデルそのものを主題とするページは存在しませんでした。これがそのページです。

この位置づけは、ここで何もニュースのように飾り立てられていない理由でもある。名前検索からたどり着いた読者が順に知りたいのは三つ、これが何か、入手可能か、何を基にしているかだ。それらは上で、その順に答えられている。日付をでっち上げることも、競合他社の名を挙げることもなく。

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

このページを変えるのは、たった一つの発表だ。MetaがMuse Realtime Avatarのエンドポイント、価格、ウェイトリスト、あるいは日付を公開すれば、可用性のセクションは「いいえ」ではなくなり、仕様になり、このページは追記ではなく書き直されることになる。MetaがMuse Videoを出荷すれば、上の段落もそれに合わせて変わる。どちらかが起こるまでは、開発者にとって有益な一手は地味なものだ。すでに持っているインターフェースを、実際に到達できるモデルに向けたままにしておくことだ。カタログ内のすべてのモデルは、Meta Muse Spark 1.2を含め、1つのOpenAI互換エンドポイントと1つのキーの背後にある。つまり、このファミリーのうち実在する部分を試すのに必要なのは、新しい契約ではなくモデル文字列の変更だけだ。具現化レイヤーが呼び出せるようになったとき、切り替えコストもまた文字列一つであるべきだ。