
Muse Realtime Avatar:MetaがそのMuse Agentに顔を与える、1ターン870ミリ秒で
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 180 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
Metaが最初に提示した数字は870ミリ秒だ。それは、Muse Realtime Avatarが、Meta自身の計測によれば、あなたが話すのをやめた瞬間から、同期した音声と映像の返答の最初のバイトが届く瞬間までにかかる時間だ。動画を生成しなければならないシステムにとって、これは紛れもなく攻めた数字であり、正確に読み解く価値がある——なぜなら、Metaの新しい身体性モデルについて興味深いことのほとんどすべては、その数字が測っているものと、人々がそれが測っていると想定するであろうものとの間の隔たりにあるからだ。
Muse Realtime Avatarは、2026年9月23日にMeta Connectで発表され、同日、Meta Superintelligence Labsによって「Bringing Your Muse to Life」と題された研究記事で取り上げられました。これは以下を拡張します:Muse Realtime Voice、MetaのMuseエージェント内の会話レイヤーであり、それに身体を与えるものです。これは、既製のアバターを備えたチャットボットではありません:参照画像——写真、全身イラスト、動物、家庭用品——を渡すと、会話の長さにわたって、そのものが話し、ジェスチャーをし、姿勢を変える様子を連続ビデオでレンダリングします。ザッカーバーグはステージ上で、自身のMuseに付属するアバターの名前はJollyであると述べました。
リップシンク処理ではなく、共有トークンストリーム
このアーキテクチャこそ理解する価値のある部分だ。なぜMetaが「アバター」ではなく「embodiment」と言い続けるのかを説明してくれるからだ。Muse Realtime Voiceは音声トークンのストリームを生成する — 投稿ではこれをVQと呼んでいる — これは発話内容とその韻律、つまりテンポ、強調、抑揚の両方を運ぶ。Muse Realtime Avatarは同じストリームを消費する。これは音声駆動のDiffusion Transformerであり、それらの音声トークン、提供した参照メディア、直近のビデオ潜在表現のローリングウィンドウを条件として、短い因果的チャンクでビデオを生成し、新しい各潜在表現を次の潜在表現のモーションコンテキストとして前方に渡す。
単一のトークンストリームを共有することが、声・唇の動き・表情を一体に保つ。代替案——音声を生成し、それに対して別個のリップシンクモデルを走らせる——は、アバター業界のほとんどが採用する手法であり、だからこそ多くのアバターが吹き替えのように見える。Metaの設計は、その継ぎ目を構造上取り除いている。ローリング潜在ウィンドウはこのアイデアのもう半分だ。それがなければ、チャンクベースの生成器はドリフトし、3分目にはあなたのキャラクターは静かに別人になってしまっている。

4つの公表された数字、そしてそれぞれが実際に何を測っているのか
Metaは、消費者向け機能に付随する研究投稿としては通常より多くの数値を公表した。以下の4つはすべて同社が報告したもので、Metaが自ら選んだベースラインに対してMetaが測定したものだ。それらのいずれも、社外で再現されたことはない。
• ターン終了から最初のバイトまで870 ms。これは応答開始までの数値である。完全な返信までの時間ではなく、通話の残りにおける継続的な配信レイテンシでもない。システムは最初のバイトまで870 msを達成しても、12秒目には依然としてもたついて感じられることがある。Metaの投稿は、これが最初のバイトの指標であると明示している。この限定条件を省いた報道は、これをエンドツーエンドの応答性として読んでしまっているが、そうではない。
• 448×768の縦向き動画、毎秒25フレーム。これは横長ではなく縦長のスマートフォン型のフレームで、25fpsは滑らかというより映画的な数字だ。映画の標準フレームレートであり、ネイティブのカメラフィードで得られる30または60fpsを下回っている。Metaによると、デモには透明なオーバーレイで透かしが入れられており、受け取った側が通常のカメラ映像ではないと判別できるようになっている。
• モデル評価回数が60分の1。これは最も誤読されやすい数値なので、以下で適切に説明します。
• 1台のNVIDIA GB200上で12件の同時リアルタイムセッション。Metaは、NVIDIAと共同で開発した自社のサービング関連の取り組み——永続的なKVキャッシュ、キャッシュを意識したルーティング、レイテンシを考慮した動的バッチング、4ビット量子化対応トレーニング、融合カーネル、CUDA Graphキャプチャ——により、自社の2段階BF16ベースラインと比べて処理能力が8倍に向上したと報告している。その背後にある計算は明快だ。各生成ステップで8フレーム、すなわち再生時間320ミリ秒分を、モデル時間で20ミリ秒、つまり1フレームあたり2.5ミリ秒で生成する。この12も8倍も、Metaが指定したベースラインとの比較であり、他社のハードウェアとの比較ではない。
なぜ60×は60×速くならないのか
圧縮の主張は、最も繰り返され、最も理解されないものになるだろう。Metaの教師モデルは、3方向の分類器なしガイダンスを備えた40ステップの拡散モデルであり、1ステップあたり3回のパス、つまり1つの動画チャンクを生成するのに120回のモデル評価を必要とした。生徒モデルは、固定長のKVキャッシュを持つガイダンスなしの2ステップ因果モデルで、蒸留と自己強制によって訓練され、同じチャンクに対して2回の評価を必要とする。これは、Metaの言葉を借りれば、教師に近い品質で、チャンクあたりの評価回数が60倍削減されることを意味する。
それはチャンクごとの計算削減だ。評価回数が60分の1になっても、ユーザーの待ち時間が60分の1になるわけではない。なぜなら、レイテンシには蒸留前から他の要因があり、蒸留後も依然として存在するからだ。メタ自身の投稿にある図表は、この削減が品質面でもたらしたものを示している。人間の選好が45%から55%に上昇したのだ。それがこの話の正直な姿だ。蒸留の目的は、そもそもリアルタイムで動作できるシステムを作ることにあり、品質のコストは排除されるのではなく、選好の約10ポイントに抑えられた。
逆の結果になったものも含めた評価
Metaは2つの商用アバターシステム、Runway CharactersとHeyGen LiveAvatarに対してテストを実施した。評価者には同一のアバターIDを用いたため、比較対象はキャラクターデザインではなくアニメーションとなった。評価者は各システムと2〜3分間のライブ会話を行い、その後、視覚品質、同期、キャラクターの一貫性、仕草を比較した。
Metaは、Runway Charactersに対しては78%対22%、HeyGen LiveAvatarに対しては88%対12%で好まれ、また評価されたあらゆる次元で好まれていると報告している。そしてこの投稿は、ほとんどのベンダー評価がしないことをする。すなわち、Runway Charactersに対する癖の比較が、統計的に互角と区別できなかったことを開示しているのだ。圧勝の中の引き分けは小さなことだが、それがこの圧勝をいいとこ取りではなく正直に報告していると分からせる細部なのである。
テストの限界は、引き分け以上に重要な意味を持つ。2〜3分は短い会話にすぎない。評価者はMeta側だった。そして投稿自体も、そのデモは「モデルの能力を示すものであり、Museアプリで利用できるアバターのすべてを反映しているわけではない」と注意を促している。これは研究チームが、あなたが見た動画が、必ずしもあなたが手にする製品とは限らないと率直に言っているようなものだ。
それでできないこと
Muse Realtime Avatar向けのAPIは存在しない。価格も料金表もウェイトリストも公開日もない。Metaは、ユーザーや開発者がいつそれを利用できるようになるかは明言していない。18歳以上向けのMuseアプリが唯一の投入先であり、このアバターは、音声カスタマイズ、Museメールアドレス、Macコンピューター操作、グラス連携といった、それぞれ独自のスケジュールを持つ一連のMuse機能とともに登場する。その一部は「今後数か月」とされている。
ここで重要な比較の対象は Runway や HeyGen ではありません。Muse スタックの残りの部分です。エージェントが動作する推論モデルである Muse Spark は、Meta が Meta Model API を通じて公開して以来ずっと開発者が利用でき、Muse Spark 1.2 は OrcaRouter を通じて meta/muse-spark-1.2 として、入力トークン 100 万あたり $1.25、出力トークン 100 万あたり $4.25 で提供されていますプロバイダーの定価でマークアップなし、しかもテキスト、画像、動画、音声、ファイルをすでに受け付ける 100 万トークンのコンテキストウィンドウ内で。それが今日呼び出せる Muse の部分です。顔の部分は、呼び出せない部分です。
その非対称性は、何かを計画しているなら、じっくり向き合う価値がある。ビデオ通話について推論するエージェントと、ビデオ通話に登場するエージェントは、異なる制約を持つ別々の製品であり、そのうち料金表に載っているのは片方だけだ。

次に見るもの
発表を決断に変えるものは3つある。1つ目はMuse内のアバターのリリース日だ。Metaが公表したものはすべてモデルに関するもので、木曜日に使える製品について公表されたものは何もないからだ。2つ目は、最初のバイトではなく長い会話を通して計測されたレイテンシだ。870msはスタートの合図にすぎず、実際の通話で問われるのは10分の時点で何が起きるかだ。3つ目は、敵対的な条件下でシステムがキャラクターを保てるかどうかだ。つまり、故意に話題を変えたり、速いペースで進めたり、実在の人物に見えるように作られた参照画像を入力したりするユーザーに対してである。
それまでは、正直な要約とは、この研究投稿が明言せずに示唆しているそれだ。Muse Realtime Avatar は、本物の圧縮結果を背後に備えた本物のエンジニアリングであり、制御された環境で実演され、それを作った企業によって評価され、会話はコーヒーを注文するのと同じくらいの長さしかなかった。それはベイパーウェアではない。また、購入したり、ルーティングしたり、ベンチマークしたりできるものでもない——そしてそれらは別の主張だ。

