「Muse Realtime Avatar:Meta、Museエージェントに顔を与える、1ターン870ミリ秒で」向けに生成されたヒーローカード。オーバーライン「Meta Superintelligence Labs — 2026年9月23日」、見出し、そしてMetaの研究投稿からの3つの事実を表示している。25 fpsの448×768縦向き動画、ターン終了から最初のバイトまで約870 ms、1台のNVIDIA GB200上で12の同時リアルタイムセッション。サブタイトルには「これはトーキングヘッドではない。音声モデルの上に乗るレンダーレイヤーだ。」とある。OrcaRouterのロゴが右下隅に合成されている。
Engineering & Research

Muse Realtime Avatar:MetaがそのMuse Agentに顔を与える、1ターン870ミリ秒で

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Metaが最初に提示した数字は870ミリ秒だ。それは、Muse Realtime Avatarが、Meta自身の計測によれば、あなたが話すのをやめた瞬間から、同期した音声と映像の返答の最初のバイトが届く瞬間までにかかる時間だ。動画を生成しなければならないシステムにとって、これは紛れもなく攻めた数字であり、正確に読み解く価値がある——なぜなら、Metaの新しい身体性モデルについて興味深いことのほとんどすべては、その数字が測っているものと、人々がそれが測っていると想定するであろうものとの間の隔たりにあるからだ。

Muse Realtime Avatarは、2026年9月23日にMeta Connectで発表され、同日、Meta Superintelligence Labsによって「Bringing Your Muse to Life」と題された研究記事で取り上げられました。これは以下を拡張します:Muse Realtime Voice、MetaのMuseエージェント内の会話レイヤーであり、それに身体を与えるものです。これは、既製のアバターを備えたチャットボットではありません:参照画像——写真、全身イラスト、動物、家庭用品——を渡すと、会話の長さにわたって、そのものが話し、ジェスチャーをし、姿勢を変える様子を連続ビデオでレンダリングします。ザッカーバーグはステージ上で、自身のMuseに付属するアバターの名前はJollyであると述べました。

リップシンク処理ではなく、共有トークンストリーム

このアーキテクチャこそ理解する価値のある部分だ。なぜMetaが「アバター」ではなく「embodiment」と言い続けるのかを説明してくれるからだ。Muse Realtime Voiceは音声トークンのストリームを生成する — 投稿ではこれをVQと呼んでいる — これは発話内容とその韻律、つまりテンポ、強調、抑揚の両方を運ぶ。Muse Realtime Avatarは同じストリームを消費する。これは音声駆動のDiffusion Transformerであり、それらの音声トークン、提供した参照メディア、直近のビデオ潜在表現のローリングウィンドウを条件として、短い因果的チャンクでビデオを生成し、新しい各潜在表現を次の潜在表現のモーションコンテキストとして前方に渡す。

単一のトークンストリームを共有することが、声・唇の動き・表情を一体に保つ。代替案——音声を生成し、それに対して別個のリップシンクモデルを走らせる——は、アバター業界のほとんどが採用する手法であり、だからこそ多くのアバターが吹き替えのように見える。Metaの設計は、その継ぎ目を構造上取り除いている。ローリング潜在ウィンドウはこのアイデアのもう半分だ。それがなければ、チャンクベースの生成器はドリフトし、3分目にはあなたのキャラクターは静かに別人になってしまっている。

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

4つの公表された数字、そしてそれぞれが実際に何を測っているのか

Metaは、消費者向け機能に付随する研究投稿としては通常より多くの数値を公表した。以下の4つはすべて同社が報告したもので、Metaが自ら選んだベースラインに対してMetaが測定したものだ。それらのいずれも、社外で再現されたことはない。

ターン終了から最初のバイトまで870 ms。これは応答開始までの数値である。完全な返信までの時間ではなく、通話の残りにおける継続的な配信レイテンシでもない。システムは最初のバイトまで870 msを達成しても、12秒目には依然としてもたついて感じられることがある。Metaの投稿は、これが最初のバイトの指標であると明示している。この限定条件を省いた報道は、これをエンドツーエンドの応答性として読んでしまっているが、そうではない。

448×768の縦向き動画、毎秒25フレーム。これは横長ではなく縦長のスマートフォン型のフレームで、25fpsは滑らかというより映画的な数字だ。映画の標準フレームレートであり、ネイティブのカメラフィードで得られる30または60fpsを下回っている。Metaによると、デモには透明なオーバーレイで透かしが入れられており、受け取った側が通常のカメラ映像ではないと判別できるようになっている。

モデル評価回数が60分の1。これは最も誤読されやすい数値なので、以下で適切に説明します。

1台のNVIDIA GB200上で12件の同時リアルタイムセッション。Metaは、NVIDIAと共同で開発した自社のサービング関連の取り組み——永続的なKVキャッシュ、キャッシュを意識したルーティング、レイテンシを考慮した動的バッチング、4ビット量子化対応トレーニング、融合カーネル、CUDA Graphキャプチャ——により、自社の2段階BF16ベースラインと比べて処理能力が8倍に向上したと報告している。その背後にある計算は明快だ。各生成ステップで8フレーム、すなわち再生時間320ミリ秒分を、モデル時間で20ミリ秒、つまり1フレームあたり2.5ミリ秒で生成する。この12も8倍も、Metaが指定したベースラインとの比較であり、他社のハードウェアとの比較ではない。

なぜ60×は60×速くならないのか

圧縮の主張は、最も繰り返され、最も理解されないものになるだろう。Metaの教師モデルは、3方向の分類器なしガイダンスを備えた40ステップの拡散モデルであり、1ステップあたり3回のパス、つまり1つの動画チャンクを生成するのに120回のモデル評価を必要とした。生徒モデルは、固定長のKVキャッシュを持つガイダンスなしの2ステップ因果モデルで、蒸留と自己強制によって訓練され、同じチャンクに対して2回の評価を必要とする。これは、Metaの言葉を借りれば、教師に近い品質で、チャンクあたりの評価回数が60倍削減されることを意味する。

それはチャンクごとの計算削減だ。評価回数が60分の1になっても、ユーザーの待ち時間が60分の1になるわけではない。なぜなら、レイテンシには蒸留前から他の要因があり、蒸留後も依然として存在するからだ。メタ自身の投稿にある図表は、この削減が品質面でもたらしたものを示している。人間の選好が45%から55%に上昇したのだ。それがこの話の正直な姿だ。蒸留の目的は、そもそもリアルタイムで動作できるシステムを作ることにあり、品質のコストは排除されるのではなく、選好の約10ポイントに抑えられた。

逆の結果になったものも含めた評価

Metaは2つの商用アバターシステム、Runway CharactersHeyGen LiveAvatarに対してテストを実施した。評価者には同一のアバターIDを用いたため、比較対象はキャラクターデザインではなくアニメーションとなった。評価者は各システムと2〜3分間のライブ会話を行い、その後、視覚品質、同期、キャラクターの一貫性、仕草を比較した。

Metaは、Runway Charactersに対しては78%対22%、HeyGen LiveAvatarに対しては88%対12%で好まれ、また評価されたあらゆる次元で好まれていると報告している。そしてこの投稿は、ほとんどのベンダー評価がしないことをする。すなわち、Runway Charactersに対する癖の比較が、統計的に互角と区別できなかったことを開示しているのだ。圧勝の中の引き分けは小さなことだが、それがこの圧勝をいいとこ取りではなく正直に報告していると分からせる細部なのである。

テストの限界は、引き分け以上に重要な意味を持つ。2〜3分は短い会話にすぎない。評価者はMeta側だった。そして投稿自体も、そのデモは「モデルの能力を示すものであり、Museアプリで利用できるアバターのすべてを反映しているわけではない」と注意を促している。これは研究チームが、あなたが見た動画が、必ずしもあなたが手にする製品とは限らないと率直に言っているようなものだ。

それでできないこと

Muse Realtime Avatar向けのAPIは存在しない。価格も料金表もウェイトリストも公開日もない。Metaは、ユーザーや開発者がいつそれを利用できるようになるかは明言していない。18歳以上向けのMuseアプリが唯一の投入先であり、このアバターは、音声カスタマイズ、Museメールアドレス、Macコンピューター操作、グラス連携といった、それぞれ独自のスケジュールを持つ一連のMuse機能とともに登場する。その一部は「今後数か月」とされている。

ここで重要な比較の対象は Runway や HeyGen ではありません。Muse スタックの残りの部分です。エージェントが動作する推論モデルである Muse Spark は、Meta が Meta Model API を通じて公開して以来ずっと開発者が利用でき、Muse Spark 1.2 は OrcaRouter を通じて meta/muse-spark-1.2 として、入力トークン 100 万あたり $1.25、出力トークン 100 万あたり $4.25 で提供されていますプロバイダーの定価でマークアップなし、しかもテキスト、画像、動画、音声、ファイルをすでに受け付ける 100 万トークンのコンテキストウィンドウ内で。それが今日呼び出せる Muse の部分です。顔の部分は、呼び出せない部分です。

その非対称性は、何かを計画しているなら、じっくり向き合う価値がある。ビデオ通話について推論するエージェントと、ビデオ通話に登場するエージェントは、異なる制約を持つ別々の製品であり、そのうち料金表に載っているのは片方だけだ。

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

次に見るもの

発表を決断に変えるものは3つある。1つ目はMuse内のアバターのリリース日だ。Metaが公表したものはすべてモデルに関するもので、木曜日に使える製品について公表されたものは何もないからだ。2つ目は、最初のバイトではなく長い会話を通して計測されたレイテンシだ。870msはスタートの合図にすぎず、実際の通話で問われるのは10分の時点で何が起きるかだ。3つ目は、敵対的な条件下でシステムがキャラクターを保てるかどうかだ。つまり、故意に話題を変えたり、速いペースで進めたり、実在の人物に見えるように作られた参照画像を入力したりするユーザーに対してである。

それまでは、正直な要約とは、この研究投稿が明言せずに示唆しているそれだ。Muse Realtime Avatar は、本物の圧縮結果を背後に備えた本物のエンジニアリングであり、制御された環境で実演され、それを作った企業によって評価され、会話はコーヒーを注文するのと同じくらいの長さしかなかった。それはベイパーウェアではない。また、購入したり、ルーティングしたり、ベンチマークしたりできるものでもない——そしてそれらは別の主張だ。

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.