記事「Muse Realtime Avatar vs GPT-Live-1」用に生成されたヒーローカードで、見出しの両側に2つの角丸カードが表示されている。左のカードには、ポートレートのアバターアイコンの上に「Muse Realtime Avatar」と書かれ、行として「映像+音声、1つのストリーム」と「APIなし、価格なし、日付なし」がある。右のカードには、吹き出しアイコンの上に「GPT-Live-1」と書かれ、行として「1分あたり$0.05、秒単位で課金」と「同時セッション、WebRTC」がある。サブタイトルには「一方は分を売り、もう一方は存在感を売る」とある。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Muse Realtime Avatar 対 GPT-Live-1:存在感 対 会話

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

課金単位を見れば、各社が自分は何を売っていると思っているかがわかる。GPT-Live-1は、Open​AIの全二重音声モデルで、音声1分あたり一律0.05ドルを秒単位で課金し、レート制限は同時セッション数で表される——Tier 1では25、Tier 5では500まで増える。これは電話回線の単位だ。Muse Realtime Avatarは、Metaが2026年9月23日に発表したもので、課金単位が存在しない。なぜなら課金するものが何もないからだ。APIもエンドポイントも価格も日付もない。代わりに公表されている単位はハードウェアの数字——1台のNVIDIA GB200上で12の同時リアルタイムセッション。一方の企業は分単位で会話を売っている。もう一方は、顔をレンダリングするのにいくらかかるかを見せているだけで、まだそれを売るとは決めていない。

どちらのモデルも比較的新しく、どちらも「ローンチ」という言葉が通常帯びる意味でのローンチではない。GPT-Live-1は2026年7月8日にChatGPT内で提供開始され、開発者APIに到達したのは9月10日だった——その2か月間、これはコンシューマー製品のデフォルトの音声であり、何かを作っている人なら誰も利用できなかった。Muse Realtime Avatarは2026年9月23日にMeta Connectで発表され、Meta自身のリサーチ投稿でデモンストレーションされており、製品ではなくMuseエージェントの機能にとどまっている。両者を比較することは、同じアイデアの異なる2つの段階を比較することだ。つまり、会話モデルが十分に優れ、次の問いが「モデルが話している間、ユーザーが何を見ているか」になる時、何が起きるのか、ということだ。

OpenAIが構築したもの:決して止まらない会話

GPT-Live-1は、運用上重要な意味で全二重です。つまり、動作を開始する前にあなたが話し終えるのを待つことはありません。開発者APIに到達する経路は、ただ1つのエンドポイント、Live Sessionsエンドポイントだけであり、モデルIDもただ1つ、gpt-live-1だけで、固定すべき日付付きスナップショットも、有効になっている兄弟エンドポイントもありません。Chat Completionsも、Responsesも、Realtimeも、ファインチューニングも、音声文字起こしや音声合成のエンドポイントもありません。画像と動画の入力は明示的にサポートされていません。

下流のすべてを形作る設計上の決定は委譲です。GPT-Live-1は自ら難しい思考を行いません。OpenAIのドキュメントでは、音声レイヤーを別個の推論バックエンドと組み合わせており、公開されているWebRTCの例では、そのバックエンドはGPT-5.6 Terraです。したがって、GPT-Live-1のセッションでは2つのメーターが同時に回ります。音声に1分あたり0.05ドル、それに加えて、引き渡すすべてのツール呼び出し、検索、推論ステップに対してバックエンドモデルの通常のトークン料金がかかります。Speech to Speech Indexでは、その二重人格は、同じモデルが2回スコアを記録する形で現れます——GPT-6 Astraがmedium effortで思考を行う場合は81.5、GPT-5.6 Solがlow effortの場合は80.1です。これら2つの構成の間の1.4ポイントの差は、GPT-Live-1の最良の構成を首位に押し上げる0.2ポイントの差よりも大きいのです。

それがこのモデルの偽らざる姿だ。音声フロントエンドは固定されており、知能はあなたが設定するパラメータで、それはどの競合モデルよりも大きくスコアを動かす。

Metaが作ったもの:声に合わせて動く顔

Muse Realtime Avatarは、GPT-Live-1には存在しない問題に挑んでいる——生成された映像を生成された音声と寸分違わず同期させ続けることだ。Metaの答えは、両者を同じストリームにすることにある。Muse Realtime Voiceは内容と韻律の両方を担う音声トークンを出力し、アバターはそれと同じトークンを消費する音声駆動型のDiffusion Transformerであり、参照画像と直近の映像潜在変数のローリングウィンドウを条件として用いる。事後のリップシンクは一切ない。なぜなら「事後」など存在しないからだ——声も、口も、表情も、ひとつのプロセスから出てくる。

公開されている数値はMeta自身のもので、Metaが選んだベースラインに対して測定されたものであり、社外で再現されたものは一つもない。あなたの発話が終わってから、同期した音声と映像の返答の最初のバイトまで870 ms。448×768の縦向き動画、毎秒25フレーム、透明なオーバーレイによる透かし入りで、視聴者にカメラ映像ではないと分かるようにしている。1台のGB200で12個の同時セッション、Meta自身の2段階BF16ベースラインに対する8倍の容量向上。これは4ビットの量子化認識トレーニング、永続的なKVキャッシュ、レイテンシを考慮した動的バッチ処理によるもの。そしてMetaが報告する選好結果は、そのベースラインに対して45%から55%へ上昇し、商用アバターシステムに対する2つの勝利が開示されている。さらに、仕草に関しては、そのうちの1つに対する結果が同等であることと統計的に区別できないことも開示されている。

あのリストには、レートもエンドポイントも日付もない。

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

2メートル法案、そしてルーティングがその地位を得る場所

GPT-Live-1のコスト構造は単一の数字ではなく、それを単一の数字として扱うと、安く聞こえる音声モデルが高額な月を生み出すことになる。音声は1分$0.05で、秒単位で課金され、切り上げはない。セッションの最初の15秒は前払いで請求されるが、後続の時間分に充当されるのであって、上乗せされるわけではない。セッションが委任するもの——推論、ツール呼び出し、検索など——はすべて、バックエンドモデル自体の料金で別途課金される。委任先を最先端の推論モデルに向け、毎ターン検索させれば、背後にプレミアムモデルを抱えた1時間$3の常時接続回線を作ったことになる。

その2番目のメーターこそが、ルーティング可能な半分です。OrcaRouterでは、GPT-Live-1セッションのバックエンドは、ただの別のモデル呼び出しにすぎません:15社のプロバイダーから196のモデルを、単一のキーの背後で、プロバイダーのリスト価格のままマークアップゼロで通過させ、選択したモデルがエラーを返したりタイムアウトしたりした際には自動フェイルオーバーが働きます。音声レイヤー自体をルーティングすることはできません — Live SessionsはOpenAI専用のエンドポイントです — しかし、音声レイヤーが委任するすべてのものは1つのキーの上に載っているため、通話相手がどれだけ考えるかに応じて膨らむ請求の部分は、同時に、契約を交わさずに変えられる部分でもあるのです。

対照的に、Muse Realtime Avatar にはルーティングすべきメーターがありません。これはアプリの機能です。

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

音声エージェントは何のためにあるのかをめぐる2つの賭け

仕様を取り払ってしまえば、この製品をめぐって両社の主張は食い違う。OpenAIが賭けているのは、会話こそが製品だということだ——音声エージェントとは一本の電話回線であり、仕事はそれを電話回線のように感じさせることにある。決して待たせず、難しい思考は背後にあるモデルに委ね、分単位で課金し、同時通話数でスケールさせる。GPT-Live-1のAPIサーフェスにおけるあらゆる選択は、そこから導かれている。同時実行数ベースのレート制限、WebRTC限定のトランスポート、意図的に狭められた単一エンドポイント、映像の入力も出力もなし。

メタの賭けは、プレゼンスこそがプロダクトだというものだ。すなわち、エージェントが見えるユーザーは会話にとどまり続けるユーザーであり、興味深いエンジニアリングはターンテイキングではなく、通話の間じゅうレンダリングされたキャラクターの一貫性を保つことにある、という考えだ。こうした選択が生み出すのは、GPU上のフレームレートとセッション密度に最適化されたシステムであり、商業的な接点は一切ない。

両方が正しく、かつ両者が組み合わされるという現実的な可能性はある。製品は、会話を全二重音声モデルで動かし、視覚レイヤーをアバター・レンダラーで動かすこともあり得る。そして今日それを妨げている唯一のものは、アバター・レンダラーにエンドポイントがないことだ。もっともらしくないのは、それらを同じ購入の2つのバージョンとして扱うことだ。

誰が行動すべきで、誰が待つべきか

今、音声プロダクトを構築しているなら、GPT-Live-1 は呼び出し可能で、Muse Realtime Avatar は呼び出し可能ではありません。それで判断は決まります。GPT-Live-1 の中で興味深い選択は、委任先のバックエンドです。なぜなら、スコアと請求額の両方が実際に動くのはそこであり、音声統合に触れることなくルーティング、差し替え、フェイルオーバーできるスタックの唯一の部分だからです。

アバターを求めているなら、待つことは受け身ではない。注目すべき点は具体的だ。Metaが料金表とエンドポイントを公開するか、明言された日付が現れるか、そして870 msがConnectのデモではなく、携帯回線につながったスマートフォンとの実戦に耐えるかどうか。Meta自身の投稿は、同社のデモがすべてMuseアプリで利用可能なアバターを反映しているわけではないと述べており、これこそ心に留めておくべき一文だ。

それらのいずれかが変わるまでは、この比較は一行で答えられる。GPT-Live-1は、自分で選んだ頭脳を備えた電話回線だ。Muse Realtime Avatarは、電話番号を持たない顔である。

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.