「Muse Realtime Avatar vs Gemini 3.8 Live」という記事用に生成されたヒーローカード。見出しの両側に2つの角丸カードが表示されている。左のカードは「Muse Realtime Avatar」がビデオフレームのアイコンの上にあり、「ビデオ+音声出力」、「448x768 縦向き、25 fps」、「9月23日発表、APIなし」という行がある。右のカードは「Gemini 3.8 Live」がマイクと吹き出しのアイコンの上にあり、「音声+テキスト出力」、「$0.005/分 音声入力」、「9月15日GA、Live API」という行がある。サブタイトルは「一方は顔をレンダリングし、もう一方は電話回線を動かす。」と書かれている。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Muse Realtime Avatar 対 Gemini 3.8 Live:顔 対 音声回線

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これら二つは代替品ではなく、そのことを最も手早く見抜く方法は、それぞれから何が出力されるかを問うことだ。Muse Realtime Avatarは、Metaが2026年9月23日に発表したもので、キャラクターが話す様子を同期した動画として返す——参照画像を1枚渡せば、その対象が448×768の縦長フレームの中で話し、身振りをする様子をレンダリングする。Gemini 3.8 Liveは、Googleが2026年9月15日に発表し、同日に開発者向けに一般提供が開始されたもので、返すのは音声とテキストだ。動画出力は一切ない。この二つを同じ比較に並べることは誤りではない——両者は同じ会話の接点を争っており、購入者たちはすでにどちらで作るべきかを問うている——しかし下すべき判断は「どちらが優れているか」ではない。「二つの異なる製品のうち、自分に必要なのはどちらか」であり、このペアについて公開されているほぼすべての比較は、異なるものを測るベンチマークを並べることで、まさにそこを取り違えている。

以下すべてを枠づけるべき非対称性はここにある。Gemini 3.8 Live は今日、ターミナルから、キーひとつで呼び出せる。Muse Realtime Avatar はまったく呼び出せない — APIも価格も日付もない。Meta は Connect でそれを実演し、研究記事を公開した。Google は料金表とモデルIDを出した。これは製品と発表の比較であり、有用な問いはどちらが勝つかではなく、それぞれがあなたに何をコミットさせるかである。

それぞれが実際に生み出すもの

これが比較のすべてを6行に収めたもので、その6つのうちどれ一つとして互角ではない。

出力 — Muse Realtime Avatar は、1つの音声トークンのストリームから音声とポートレート動画を同時に生成し、同期した状態で返します。一方、Gemini 3.8 Live は音声とテキストを返し、モデル内のどこにも動画生成機能はありません。

開発者アクセス — Muse Realtime Avatar にはそれがありません。これは2026年9月23日に Meta の Muse エージェントの機能として発表されたものですが、API もエンドポイントもなく、提供日も明示されていません。Gemini 3.8 Live は2026年9月15日時点で Gemini API と Goog␣le AI Studio で利用可能で、以下2つのモデル ID で提供されています: gemini-3.8-livegemini-3.8-live-extended-thinking

価格 — Muse Realtime Avatar には購入できるものが何もないため、公開されている価格はありません。Gemini 3.8 Live は Live API を通じて、音声入力1分あたり $0.005、音声出力1分あたり $0.018 を公表しています。

独立した評価 — Muse Realtime Avatarには存在しない。その数値はMeta自身のもので、Metaが選んだベースラインに対して測定されている。Gemini 3.8 LiveはArtificial Analysis Speech to Speech Indexで76.0を記録し、拡張思考バリアントは82.6 — 第三者による数値であり、これは別種の証拠である。

レイテンシ — 公開されているこの2つの数値は同じ測定ではなく、多くの解説記事がここで間違えます。Metaは、あなたの発話が終わってから同期された音声と映像の返信の最初のバイトまでの時間を870 msと報告しています。Artificial Analysisが測定したGoog​leの数値は、標準モデルで最初の音声まで1.18秒、推論バリアントで1.35秒です。

フレームと言語 — Muse Realtime Avatarは448×768の縦向き動画を毎秒25フレームでレンダリングします。Gemini 3.8 Liveは97の対応言語にわたる会話途中の自動切り替えに対応し、ほぼリアルタイムの視覚入力を処理します。

その最後の行には、人々がいつも混同してしまう区別が含まれている。Gemini 3.8 Liveは見ることはできる。見せることはできない。Muse Realtime Avatarは見せることができる。それが見ることもできるかどうかはMetaの投稿が扱っていることではない——それは音声駆動型の生成器で、音声トークンと参照画像に条件づけられており、その仕事は顔を読み取ることではなく顔を生成することだ。

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

レイテンシの数値は比較できず、その差は見た目よりも小さい

870ミリ秒 対 1.18秒は、Metaが26%高速であるかのように読める。だが測定値を読めば、その比較は成り立たなくなる。Metaの数値は、ユーザーの発話が終わってから、動画を含む応答の最初のバイトまでの時間だ。そしてMetaの投稿は、それがファーストバイトの指標であり、応答全体までの時間でも、通話の残りの部分における継続的な配信レイテンシでもないと明言している。システムはファーストバイトまで870ミリ秒を達成しても、12秒目には依然としてもたついて感じられ得る。Googleの数値は最初の音声までの時間であり、生成する対象としては厳密により小さく、しかもベンダー自身ではなく外部の評価者によって測定されている。

どちらも、システムがターン制ではなく会話的であることを示す類の数値であり、どちらも通話開始から5分の時点でその通話がどんな感じかを教えてくれるものではない。応答性で両者を選ぶなら、正直に言えば、同条件での計測結果は誰も公表しておらず、それを得る唯一の方法は、実際に通話可能な方を動かしてみることだけだ。

今日その上に構築できるもの、そして待つことになるもの

Gemini 3.8 Live には、本番環境での意思決定に必要なものが揃っています。固定できる 2 つのモデル ID、公開された分単位の料金、第三者によるインデックススコア、そして一般提供開始日の明示です。同時に、音声プロダクトにたいていつきまとう制約も伴います。すなわち、入力は音声、出力は音声とテキスト、そして動画生成には対応していません。

Muse Realtime Avatarには、研究投稿に付きものの要素が備わっている。アーキテクチャ、企業が報告した4つの数値、そしてMetaが2つの商用アバターシステムに対して実施した、開示済みの一連の選好テストだ。そのうち1つについて、Meta自身が、所作における互角との統計的な区別はつかないと報告している。欠けているのは、それを購入する手段である。Metaの投稿はさらに、示されたデモのすべてがMuseアプリで利用できるアバターを反映しているわけではないと注記している。これに関する計画を立てるなら、この一文に従うべきだ。

名付ける価値のある第3の選択肢がある。ほとんどのチームが実際に取るのは、これだからだ。これらのモデルはどちらも完全なエージェントではない。Gemini 3.8 Live は話し続けながらバックグラウンド作業をツールと API に任せ、GPT-Live-1 は推論を完全に別のバックエンドモデルへ委任する。会話レイヤーはフロントエンドであり、思考は別のモデルへの別の呼び出しだ。その2回目の呼び出しは通常のテキスト推論であり、ルーティング可能である。

OrcaRouterでは、そのレイヤーは1つのエンドポイントです:単一のキーの背後に、15社のプロバイダーから196のモデル、プロバイダーの定価をそのままゼロマークアップで提供し、選んだモデルがエラーやタイムアウトを起こした場合には自動フェイルオーバーが働きます。当社はGemini 3.8 Liveをホストしていません — Live APIはGoog​le専用です — またMuse Realtime Avatarもホストしていません。そもそも誰もホストしていないからです。当社が提供するのは、発信者がどれだけ頭を使うかに応じてスケールするボイスエージェントの半分と、何も再交渉することなく変更できる半分です。

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

その二つが実際に交わるところ

両者を並べて比較する理由はベンチマークではない。それは、両者が製品内の同じスロット、つまりユーザーが話しかける対象を占めようとしているからだ。Goog​leの賭けは、そのスロットが会話であり、成果物が優れた会話であるというものだ——97言語、バックグラウンドでのツール実行、標準モデルがτ-Voiceの顧客サービスシナリオの30.1%を解決するのに対して68.6%を解決する推論バリアント。Metaの賭けは、そのスロットがプレゼンスであり、エージェントを見ることができるユーザーは会話にとどまるユーザーであるというものだ。

これらの賭けは互いに排他的ではない。製品が音声ループに Gemini 3.8 Live を、視覚レイヤーに Muse Realtime Avatar のようなものを使うことは、アバターレイヤーが呼び出し可能になれば、十分にあり得る。それができないのは、両者を互換可能なものとして扱うことだ。なぜなら、一方は決して顔を提供してくれず、もう一方は決してエンドポイントを提供してくれないかもしれないからだ。

どうやって決めるか

今四半期に音声製品を出荷するなら、判断はすでに下されている。Gemini 3.8 Live は呼び出し可能で、Muse Realtime Avatar はそうではない。リリースが実際に論じている軸でバリアントを選べ。拡張思考モデルは、1時間あたりの音声コストが4倍強と引き換えに、エージェント的タスク完了率を38ポイント獲得し、標準モデルは公開ボード上で最も安価な実用的音声モデルだ。次に、委任された推論を別途ルーティングせよ。請求とレイテンシーの両方がそこに潜んでいるからだ。

アバター層を評価しようとしているなら、正直な答えは、まだ評価すべきものは何もないということだ。存在するのは、企業が報告した4つの数値とデモを伴う研究投稿だけだ。注目すべきはインデックスではない — Muse Realtime Avatar がそこに載ることはない — むしろ、Meta が料金表、エンドポイント、日付を公表するかどうか、そしてアバターが Connect のデモではなく、携帯回線上でスマートフォン上で動作しているときに、その 870 ms が持ちこたえるかどうかだ。

それまでは、この比較はほとんどの記事が示すよりも短い形になる。一方は価格とモデルID、外部スコアを備えた製品だ。もう一方は、まだそれらのどれも持たないものの、非常に優れた実証例である。

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.