記事「Muse Realtime Avatar vs SeedRealtime」用に生成されたヒーローカード。見出しの両側に2つの角丸カードが表示されている。左のカードには「Muse Realtime Avatar」が上部にあり、その下に送信ビデオフレームアイコンと「ビデオを生成する」および「Meta、9月23日発表」という行が表示されている。右のカードには「SeedRealtime」が上部にあり、その下に画面と目のアイコンと「ビデオを視聴する」および「ByteDance、8月5日出荷」という行が表示されている。サブタイトルには「どちらも料金表を持っていない。」と書かれている。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Muse Realtime Avatar vs SeedRealtime:見ることしかできない2つのモデル

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

どちらにも料金表は存在しない。Muse Realtime Avatarは、2026年9月23日にMeta ConnectでMetaが発表したもので、APIもエンドポイントも価格も日付もない——「Bringing Your Muse to Life」と題された研究投稿で実演された、MetaのMuseエージェントの一機能にすぎない。SeedRealtimeは、2026年8月5日にByteDance Seedがリリースしたもので、APIも重みも技術レポートもパラメータ数もない——ByteDance自身のDoubaoアプリの中に存在しており、ByteDanceの投稿は「完全に展開済み」と述べているだけだ。世界最大級のコンシューマー向けAI企業2社が、わずか7週間違いで音声映像リアルタイムシステムを出荷しながら、どちらも購入することはできない。これがこの比較であり、誰にも作ることのできないベンチマーク表よりもはるかに興味深い。

両者を分けるのは、映像が流れる方向です。SeedRealtimeは見て、聞いて、見たものについて話します——音声、映像、テキストを1つのエンドツーエンドネットワークに取り込み、発話交替を外部の音声活動検出器からモデル自体へと移しています。Muse Realtime Avatarは生成します——参照画像、写真、イラスト、あるいは物体を渡すと、会話が続く間ずっと、その対象が話し、身振りをする様子を連続映像として描き出します。SeedRealtimeの映像は入力です。Muse Realtime Avatarの映像は出力です。どちらも全二重と説明され、どちらも音声と映像を扱い、同じラベルで正反対の仕事をしています。

それぞれが何であるか、そしてどこにあるのか

六行、そして最後の二行が全てを決める。

ビデオ — Muse Realtime Avatarがこれを生成します。448×768のポートレート解像度、毎秒25フレームで、視聴者がカメラ映像ではないと判別できるよう透明なオーバーレイによる透かしが入ります。SeedRealtimeがこれを知覚し、フレームを音声を処理するのと同じネットワークへストリーミングします。

アーキテクチャ上の賭け — Muse Realtime Avatarは音声と映像の間で単一のトークンストリームを共有しているため、音声駆動のDiffusion TransformerがMuse Realtime Voiceの音声トークンを直接消費し、後からリップシンクされるものは何もない。SeedRealtimeはターンテイキングをモデルに織り込んでおり、誰がいつ話すかはもはや外部の音声活動検出器の判断ではない。

どこで動作するか — Muse Realtime Avatar は Meta の Muse エージェント内の機能であり、SeedRealtime は ByteDance の Doubao アプリ内にあります。

開発者向けアクセス — どちらもAPIを提供していません。どちらも重みを公開していません。サーバーレスの選択肢も、ホスト型エンドポイントも、どちらかを扱うサードパーティのプラットフォームもありません。

価格 — どちらも非公開です。双方とも商業的なオファーがないためです。

独立した評価 — どちらのシステムについても存在しない。両社が自社モデルについて公表した数値はすべて自社調べであり、外部の評価者がどちらかを検証したことも一度もない。

エビデンス基盤が二つ、どちらもファーストパーティのもので、そのうちの一方はずっと薄い

ここで、比較は対称ではなくなる。MetaはMuse Realtime Avatarについて4つの数値を公表した。いずれも自社報告で、Metaが選んだベースラインに対して測定されたものであり、社外で再現されたものはない。発話が終わってから、同期した音声と映像の返答の最初のバイトまでが870 ms、448×768の縦長動画が毎秒25フレーム、自社ベースラインと比べてモデル評価回数が60分の1、そして1台のNVIDIA GB200上で12の同時リアルタイムセッション——4ビットの量子化対応トレーニングとレイテンシを考慮した動的バッチ処理による、Metaの2段階BF16ベースラインに対する8倍の容量増加である。Metaはまた、2つの商用アバターシステムに対する選好比較も公表した——一方には78対22、もう一方には88対12——そして、そのうち一方に対する所作に関する結果は、統計的に同等と区別がつかないことを開示した。その開示は勝利よりも価値がある。ほとんどのローンチ投稿が省く類の結果だからだ。

SeedRealtimeが公開しているエビデンスは、エンドツーエンドの人手評価が1件だけだ。ByteDanceによれば、カスケード型システム——視覚モデルをASRモデルにつなぎ、そのASRモデルをLLMにつなぎ、そのLLMを音声合成の音声につないだもの——に対して、SeedRealtimeは音声と視覚を伴う会話のテンポに関する問題を半減させ、遮断がより少なく、誤発火もより少なく、応答はよりゆっくりで自然だという。ByteDanceが公開していないのは、サンプルサイズ、手法、アノテーター数、ミリ秒単位のレイテンシ値、ベンチマーク名、そしてスコアだ。ある二次報告書は、同チームの以前のモデルと比べて会話の流暢さが12%向上したと引用している。これが公開エビデンスのすべてだ。

なので、検証可能性を正直に順位づけするとこうなる。どちらにも独立した追試はない。Metaのは、基準値が明示され、否定的な結果も開示された一連の測定である。ByteDanceのは、設計が説明されていない単一の選好に関する主張にすぎない。どちらも再現可能ではないが、議論の俎上に載せられるだけの具体性があるのは一方だけだ。

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

それぞれが行った動き

どちらのシステムも同じ問題に対する答えであり、その二つの答えが異なっていることは注目に値する。

見ているシステムにとって難しいのは、いつ話すべきかを知ることだ。カメラのフレームと音声を継続的に受け取っているモデルは、外部トリガーなしに、目の前の人が話し終えたか、自分に話しかけられたか、そして今フレームに入った物体が関連するものかどうかを判断しなければならない。それがSeedRealtimeがモデル内部に移した問題であり、ByteDanceは2つではなく3つのモダリティにまたがってその移行を行った——GoogleOpenAI、NVIDIAがそれぞれ音声だけで行ったことの、より難しい版である。デモの振る舞いはそこから導かれる:グループ会話で声を顔に結びつけること、何かがフレームに入ると促されずとも話し出すこと、博物館や修理の場で誰かを案内すること。

レンダリングを行うシステムにとって、難しいのは一貫性を保つことだ。動画を短い因果的なチャンクで生成するということは、各チャンクが直前のチャンクを条件として生成されるということであり、その故障モードはドリフトだ — 3分目には、キャラクターは静かに別人になってしまっている。Metaの直近の動画潜在表現のローリングウィンドウがそれに対する答えであり、共有トークンストリームは別の故障に対する答えだ。音声を先に生成し、その後にリップシンクモデルを重ねてかけることで生じる、あの吹き替えのような見た目のことである。

どちらの動きも、もう一方のシステムでは利用できない。SeedRealtimeには忠実に従うべき参照画像がない。誰もレンダリングしていないからだ。Muse Realtime Avatarには追跡すべき外部世界がない。その役割のすべては、音声に合致する顔を生成することにあるからだ。

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

なぜ呼び出せないモデルが依然としてルーティングの問題なのか

これらのシステムはどちらも委譲を行う。Muse Realtime Avatar は Muse Realtime Voice の上に位置し、Muse Realtime Voice は、推論が Muse Spark 上で動作するエージェントの会話レイヤーである――レンダリングを担うのはモデルであり、思考ではない。SeedRealtime の設計は、バックグラウンド作業が行われている間も会話を継続させる。つまり、インラインで処理できる範囲を超える作業はどこか別の場所へ送られ、戻ってくる。どちらのアーキテクチャにおいても、ユーザーがやり取りする対象はフロントエンドであり、知能はその背後にある別個のテキストモデルである。

その別個のテキストモデルはごく普通の推論であり、スタックの中で実際に購入できる部分です。OrcaRouterでは、それは15社のプロバイダーによる196のモデルをカバーする単一のエンドポイントであり、プロバイダーの定価をマークアップゼロでそのまま適用し、選択したモデルがエラーを返したりタイムアウトしたりした際には自動フェイルオーバーが働きます。当社はSeedRealtimeをホストしていません。それはByteDanceのもので、Doubaoの内部にあり、ルーティングするものは何もありません。Muse Realtime Avatarも同様に当社はホストしておらず、他の誰もホストしていません。当社が扱っているのは、両システムがその難作業を引き渡す層であり、考える役割を担うモデルを別のものにしたいときに変わる層です。

何が答えを変えるだろうか

SeedRealtimeにとって、欠けているのは機能ではなく、証拠だ。パラメータ数、ベンチマークスイート、そして記述された人間評価を備えた技術レポートがあれば、それは「アプリ内のデモ」から、チームが検討できるものへと進むだろう。ByteDanceの投稿も、重みや文書化されたAPIを主張することなく、一般的な「Try Dola」と「Try in Playground」のリンク先を挙げているだけであり、これはモデルリリースというより製品機能のパターンだ。

Muse Realtime Avatarについて欠けているのは商用面だ。料金表、エンドポイント、日付、そしてMetaが完全には明示していない地域と年齢の条件である。Metaの投稿は、同社のデモがMuseアプリで利用可能なアバターをすべて反映しているわけではないと述べており、これこそがこれを前提に組むあらゆる計画を規定すべき一文だ。

それらのどれかが変わるまでは、この比較は異例なほど短い形になる。どちらのモデルも音声視覚型で、どちらも全二重で、どちらも本当に見事なエンジニアリングであり、しかもこれを読んでいる誰も、ターミナルからどちらかを呼び出せるわけではない。違いは、もし呼び出せたとしたら、それらで何をするかにある。一方は話すキャラクターを与え、もう一方は気づくシステムを与えてくれる。

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.