
Muse Realtime Avatar 対 Gemini 3.8 Live:顔 対 音声回線
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 180 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
これら二つは代替品ではなく、そのことを最も手早く見抜く方法は、それぞれから何が出力されるかを問うことだ。Muse Realtime Avatarは、Metaが2026年9月23日に発表したもので、キャラクターが話す様子を同期した動画として返す——参照画像を1枚渡せば、その対象が448×768の縦長フレームの中で話し、身振りをする様子をレンダリングする。Gemini 3.8 Liveは、Googleが2026年9月15日に発表し、同日に開発者向けに一般提供が開始されたもので、返すのは音声とテキストだ。動画出力は一切ない。この二つを同じ比較に並べることは誤りではない——両者は同じ会話の接点を争っており、購入者たちはすでにどちらで作るべきかを問うている——しかし下すべき判断は「どちらが優れているか」ではない。「二つの異なる製品のうち、自分に必要なのはどちらか」であり、このペアについて公開されているほぼすべての比較は、異なるものを測るベンチマークを並べることで、まさにそこを取り違えている。
以下すべてを枠づけるべき非対称性はここにある。Gemini 3.8 Live は今日、ターミナルから、キーひとつで呼び出せる。Muse Realtime Avatar はまったく呼び出せない — APIも価格も日付もない。Meta は Connect でそれを実演し、研究記事を公開した。Google は料金表とモデルIDを出した。これは製品と発表の比較であり、有用な問いはどちらが勝つかではなく、それぞれがあなたに何をコミットさせるかである。
それぞれが実際に生み出すもの
これが比較のすべてを6行に収めたもので、その6つのうちどれ一つとして互角ではない。
• 出力 — Muse Realtime Avatar は、1つの音声トークンのストリームから音声とポートレート動画を同時に生成し、同期した状態で返します。一方、Gemini 3.8 Live は音声とテキストを返し、モデル内のどこにも動画生成機能はありません。
• 開発者アクセス — Muse Realtime Avatar にはそれがありません。これは2026年9月23日に Meta の Muse エージェントの機能として発表されたものですが、API もエンドポイントもなく、提供日も明示されていません。Gemini 3.8 Live は2026年9月15日時点で Gemini API と Goog␣le AI Studio で利用可能で、以下2つのモデル ID で提供されています: gemini-3.8-live と gemini-3.8-live-extended-thinking。
• 価格 — Muse Realtime Avatar には購入できるものが何もないため、公開されている価格はありません。Gemini 3.8 Live は Live API を通じて、音声入力1分あたり $0.005、音声出力1分あたり $0.018 を公表しています。
• 独立した評価 — Muse Realtime Avatarには存在しない。その数値はMeta自身のもので、Metaが選んだベースラインに対して測定されている。Gemini 3.8 LiveはArtificial Analysis Speech to Speech Indexで76.0を記録し、拡張思考バリアントは82.6 — 第三者による数値であり、これは別種の証拠である。
• レイテンシ — 公開されているこの2つの数値は同じ測定ではなく、多くの解説記事がここで間違えます。Metaは、あなたの発話が終わってから同期された音声と映像の返信の最初のバイトまでの時間を870 msと報告しています。Artificial Analysisが測定したGoogleの数値は、標準モデルで最初の音声まで1.18秒、推論バリアントで1.35秒です。
• フレームと言語 — Muse Realtime Avatarは448×768の縦向き動画を毎秒25フレームでレンダリングします。Gemini 3.8 Liveは97の対応言語にわたる会話途中の自動切り替えに対応し、ほぼリアルタイムの視覚入力を処理します。
その最後の行には、人々がいつも混同してしまう区別が含まれている。Gemini 3.8 Liveは見ることはできる。見せることはできない。Muse Realtime Avatarは見せることができる。それが見ることもできるかどうかはMetaの投稿が扱っていることではない——それは音声駆動型の生成器で、音声トークンと参照画像に条件づけられており、その仕事は顔を読み取ることではなく顔を生成することだ。

レイテンシの数値は比較できず、その差は見た目よりも小さい
870ミリ秒 対 1.18秒は、Metaが26%高速であるかのように読める。だが測定値を読めば、その比較は成り立たなくなる。Metaの数値は、ユーザーの発話が終わってから、動画を含む応答の最初のバイトまでの時間だ。そしてMetaの投稿は、それがファーストバイトの指標であり、応答全体までの時間でも、通話の残りの部分における継続的な配信レイテンシでもないと明言している。システムはファーストバイトまで870ミリ秒を達成しても、12秒目には依然としてもたついて感じられ得る。Googleの数値は最初の音声までの時間であり、生成する対象としては厳密により小さく、しかもベンダー自身ではなく外部の評価者によって測定されている。
どちらも、システムがターン制ではなく会話的であることを示す類の数値であり、どちらも通話開始から5分の時点でその通話がどんな感じかを教えてくれるものではない。応答性で両者を選ぶなら、正直に言えば、同条件での計測結果は誰も公表しておらず、それを得る唯一の方法は、実際に通話可能な方を動かしてみることだけだ。
今日その上に構築できるもの、そして待つことになるもの
Gemini 3.8 Live には、本番環境での意思決定に必要なものが揃っています。固定できる 2 つのモデル ID、公開された分単位の料金、第三者によるインデックススコア、そして一般提供開始日の明示です。同時に、音声プロダクトにたいていつきまとう制約も伴います。すなわち、入力は音声、出力は音声とテキスト、そして動画生成には対応していません。
Muse Realtime Avatarには、研究投稿に付きものの要素が備わっている。アーキテクチャ、企業が報告した4つの数値、そしてMetaが2つの商用アバターシステムに対して実施した、開示済みの一連の選好テストだ。そのうち1つについて、Meta自身が、所作における互角との統計的な区別はつかないと報告している。欠けているのは、それを購入する手段である。Metaの投稿はさらに、示されたデモのすべてがMuseアプリで利用できるアバターを反映しているわけではないと注記している。これに関する計画を立てるなら、この一文に従うべきだ。
名付ける価値のある第3の選択肢がある。ほとんどのチームが実際に取るのは、これだからだ。これらのモデルはどちらも完全なエージェントではない。Gemini 3.8 Live は話し続けながらバックグラウンド作業をツールと API に任せ、GPT-Live-1 は推論を完全に別のバックエンドモデルへ委任する。会話レイヤーはフロントエンドであり、思考は別のモデルへの別の呼び出しだ。その2回目の呼び出しは通常のテキスト推論であり、ルーティング可能である。
OrcaRouterでは、そのレイヤーは1つのエンドポイントです:単一のキーの背後に、15社のプロバイダーから196のモデル、プロバイダーの定価をそのままゼロマークアップで提供し、選んだモデルがエラーやタイムアウトを起こした場合には自動フェイルオーバーが働きます。当社はGemini 3.8 Liveをホストしていません — Live APIはGoogle専用です — またMuse Realtime Avatarもホストしていません。そもそも誰もホストしていないからです。当社が提供するのは、発信者がどれだけ頭を使うかに応じてスケールするボイスエージェントの半分と、何も再交渉することなく変更できる半分です。

その二つが実際に交わるところ
両者を並べて比較する理由はベンチマークではない。それは、両者が製品内の同じスロット、つまりユーザーが話しかける対象を占めようとしているからだ。Googleの賭けは、そのスロットが会話であり、成果物が優れた会話であるというものだ——97言語、バックグラウンドでのツール実行、標準モデルがτ-Voiceの顧客サービスシナリオの30.1%を解決するのに対して68.6%を解決する推論バリアント。Metaの賭けは、そのスロットがプレゼンスであり、エージェントを見ることができるユーザーは会話にとどまるユーザーであるというものだ。
これらの賭けは互いに排他的ではない。製品が音声ループに Gemini 3.8 Live を、視覚レイヤーに Muse Realtime Avatar のようなものを使うことは、アバターレイヤーが呼び出し可能になれば、十分にあり得る。それができないのは、両者を互換可能なものとして扱うことだ。なぜなら、一方は決して顔を提供してくれず、もう一方は決してエンドポイントを提供してくれないかもしれないからだ。
どうやって決めるか
今四半期に音声製品を出荷するなら、判断はすでに下されている。Gemini 3.8 Live は呼び出し可能で、Muse Realtime Avatar はそうではない。リリースが実際に論じている軸でバリアントを選べ。拡張思考モデルは、1時間あたりの音声コストが4倍強と引き換えに、エージェント的タスク完了率を38ポイント獲得し、標準モデルは公開ボード上で最も安価な実用的音声モデルだ。次に、委任された推論を別途ルーティングせよ。請求とレイテンシーの両方がそこに潜んでいるからだ。
アバター層を評価しようとしているなら、正直な答えは、まだ評価すべきものは何もないということだ。存在するのは、企業が報告した4つの数値とデモを伴う研究投稿だけだ。注目すべきはインデックスではない — Muse Realtime Avatar がそこに載ることはない — むしろ、Meta が料金表、エンドポイント、日付を公表するかどうか、そしてアバターが Connect のデモではなく、携帯回線上でスマートフォン上で動作しているときに、その 870 ms が持ちこたえるかどうかだ。
それまでは、この比較はほとんどの記事が示すよりも短い形になる。一方は価格とモデルID、外部スコアを備えた製品だ。もう一方は、まだそれらのどれも持たないものの、非常に優れた実証例である。

