「Tavus Griffin vs Muse Realtime Avatar」のヒーロータイトルカード。サブタイトルは「2026年の2つの顔、2つの異なる課題」。その上に4つのチップ:Griffin 48%が人間と認識;Griffin 音声から映像まで0.43秒;Muse Realtime Avatar 初回バイトまで870 ms;Muse Realtime Avatar 25 fpsで448x768。
Engineering & Research

Tavus Griffin vs Muse Realtime Avatar:2026年の2つの顔、2つの異なる問題

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Tavus Griffin と Muse Realtime Avatar はどちらも、同じ気まずい問題——話せるのに顔を持たない言語モデル——を解決するために存在し、しかも反対の端からそれに挑んでいる。Griffin は、カメラを通して参加者を観察し、会話のもう一方の側をリアルタイムで生成する、ビデオtoビデオの Human Interaction Model であり、2026年10月に Tavus によって選ばれたテスター向けのリサーチプレビューとして発表された。Muse Realtime Avatar は、Meta の Muse エージェントのための具現化レイヤーで、2026年9月23日の Meta Connect で発表され、音声を受け取って同期的に話す肖像に変える。どちらも購入することはできない。違いは、それぞれが何を正しくやろうとしているかにあり、それは各モデルが実際に何を入力として受け取っているかを問うた瞬間に現れる。

短いバージョン

• Griffin への入力は 回線の向こう側にいる相手 — ライブ参加者の映像と音声であり、Griffin はそれを読み取り、応答し、それによって中断されなければならない。

• Muse Realtime Avatar の入力はエージェント自身の発話、つまり Muse Realtime Voice からのトークンのストリームであり、それを対応する顔に変換します。

• TavusはGriffinを人がそれを信じるかどうかで測定し、1分間のビデオ通話から48%という数値を公開している。

• MetaはMuse Realtime Avatarを、会話についていけるかどうかで評価し、発話終了から最初のバイトまで870ミリ秒という数値を公表している。

・どちらも公開APIも、公表された価格も、一般提供開始日もない。

それら4行をまとめて読めば、意見の相違の形は明らかだ。Tavusは相手の信念に最適化している。Metaは時計に最適化している。

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

Griffin:信じられなければならないモデル

Tavusの主張は、Griffinが最初のヒューマン・インタラクション・モデルであるというもので、その主張の背後にあるアーキテクチャは、継続的会話モデリングと音声映像生成を組み合わせた2部構成のシステムだ。最初の部分は行動面を担い、見たり聞いたりできる情報を使って、ペルソナが次の瞬間に何をすべきかを決める。2番目の部分はレンダリングで、Tavusはそれをさらにストリーミング音声生成とストリーミング動画生成に分けている。

Tavusが前面に押し出す数字はスループットの数字ではない。ロンドン大学クイーン・メアリー校と共同で実施したある研究では、54人中26人 — 48% — が、1分間のビデオ通話の後、Griffinが実在の人物だと信じた。これに対し、以前のスタックであるPhoenix-4.5の顔生成、Sparrow-2のターン・テイキング、Raven-1の視覚では、41人中1人(2.4%)だった。騙されなかった参加者は、通常、最初の20秒以内に疑いを持った。NVIDIAのVideoFDBベンチマーク(2026年9月に採点)において、Tavusは、Griffinが対面AIで1位となったと報告している。生成スコアは3.83で、報告されている最強のベースラインの2.80、人間の参照値の3.92に対するものであり、知覚スコアは3.73で、報告されている最良のベースラインの3.44、人間の参照値の4.20に対するものである。これらの数字はベンダーが報告したもので、特定のベンチマークに基づくものだが、興味深いのは人間との比較点である。

それらの数字の裏にある技術は、Tavec と呼ばれるコーデックと、自己回帰拡散トランスフォーマーです。Tavec は 48 kHz で動作し、毎秒 100 フレームで 1 フレームあたり 40 個の値を持ち、コードブックはなく、完全に因果的なデコーダーを備え、パケットは最小 10 ミリ秒です。文が終わる前に顔が動き始められるように設計されています。映像側のパスは 720p を 320 ミリ秒のチャンクで送り出し、そこでは 1 つの潜在表現が 25 fps の 8 フレームに相当し、潜在表現あたり 3 回の拡散ステップ、VAE では 8 倍の時間圧縮が行われます。3 段階の蒸留プロセス(分布マッチング、次に teacher-forcing 自己回帰、そして self-forcing)によって、ようやくその 3 ステップをリアルタイムで実行できます。主要なレイテンシーの主張は、H100 上で音声から映像まで平均 0.43 秒というもので、Tavus によれば、同社が測定した次に速い手法の約半分にあたります。音声クローニングにはおよそ 10 秒のサンプルが必要です。

このすべての代償は、Tavusがこれを出荷できないことにある。研究プレビュー版のGriffin-Liteは、選ばれた少数の早期テスターだけが利用できる。リリースについて記した文章のなかで、同社は、Griffin-Liteが現時点で顧客向けには提供されないこと、また、いくつかの安全性上の懸念に対処した後、まもなくGriffinをリリースする見込みであることを率直に述べている。GriffinはTavusのプラットフォーム上にはなく、「安全にリリースする方法を確立でき次第」そこに登場することになる。1分間の通話で48%の確率で人を信じ込ませるモデルは、配備の観点から言えば、1分間の通話で48%の確率で人を信じ込ませるモデルである。

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Realtime Avatar:追随し続けなければならないモデル

Muse Realtime Avatarは2026年9月23日にMeta Connectで発表され、同日、Meta Superintelligence Labsによって「あなたのMuseに命を吹き込む」というタイトルで記事にまとめられた。Metaの捉え方はTavusのそれよりも狭く、より機械的だ。MuseエージェントにはすでにMuse Realtime Voiceによる声があり、アバターはその声に身体を与える層である。

公表されている数値は、発話終了から最初のバイトまで870ミリ秒です。つまり、ユーザーが話し終えた瞬間から、アバターの最初の映像バイトが準備できる瞬間までです。アバターは448×768のポートレートを毎秒25フレームでレンダリングします。Metaによると、このシステムはベースラインと比べてチャンクあたりの評価回数がおよそ60分の1で、単一のNVIDIA GB200で12件の同時リアルタイムセッションを処理でき、2ステップのBF16実装に対して8倍の容量向上を実現するとのことです。

Griffin とのアーキテクチャ上の違いは、情報がどこから来るかにある。Muse Realtime Avatar は Muse Realtime Voice を拡張し、その音声トークンストリームを共有する — 音声モデルが生成する同じ VQ 表現が顔を動かすのであって、参加者についての別個の視覚的理解ではない。これにより、音声駆動型の DiT 具現化レイヤーになる。効率的で、自らの音声モデルと密接に結合しており、通話の相手側にいる人間を読み取ろうとは一切しない。それはエージェントの口であり顔であって、あなたを観察する会話相手ではない。

メタはMuse Realtime Avatarについて、APIも価格もリリース日も公表していない。公開されている記録は、その研究投稿がすべてだ。

二つのデザインが真に分岐する場所

この分岐を最も明確に見る方法は、ユーザーが割り込んだときに何が起こるかを問うことだ。

Griffinは全二重で、発話途中で中断されることを前提に設計されています — 話しながら見て聞くことができるため、Tavusのマーケティングは、Griffinがビデオではなく会話行動を学習するという考えを前面に押し出しています。そのため、ベンチマークスイートが知覚と反応を中心に構築されていたり、即時反応において次善のシステムを37%上回るという主張を同社がわざわざ行ったりするのも、同じ理由からです。

Muse Realtime Avatarの870ミリ秒というターン終了時の数値は、逆のことを物語っている。それは、ターンが終わり、音声トークンが解決し、その後で顔が追いつくパイプラインだ。高速ではある——870 msはポートレートレンダラーにとって良い数字だ——しかし、その測定自体がターン境界の存在を前提としており、まさにそれがデュプレックスモデルが捨て去るために作られている前提なのだ。

それはどちらの設計への批判ではありません。Metaは、Meta自身のアシスタント・サーフェスの中で生きるエージェントのための顔を作っています。そこでは、明確なターン境界がやり取りの妥当なモデルです。Tavusは、画面に映る人物が本物かどうかを、見知らぬ人が20秒以内に判断するという状況を乗り切らなければならないものを作っています。

どちらも価格表には載っていない——そして、Museの一部分だけが呼び出し可能なのだ。

Tavus GriffinもMuse Realtime Avatarも、今日時点で本番環境に投入することはできません。Griffinは限られたテスターだけが利用でき、Muse Realtime AvatarにはAPIも価格も提供時期もありません。構築を計画しているなら、これらの事実はどちらも計画に含めるべきです。

注目に値するのは、Museスタックのうち到達可能な部分です。MetaのMuseファミリーにはMuse Sparkが含まれており、そのチェックポイントの1つ — meta/muse-spark-1.2 — は、入力トークン100万あたり$1.25、出力トークン100万あたり$4.25で当社のカタログに公開されており、マークアップゼロでMetaの定価がそのまま適用されます。これはアバターではありません。テキスト、画像、動画、音声、PDFを入力として受け取り、テキストを返します。コンテキストウィンドウは100万トークンで、推論エフォートは設定可能です。しかしこれは、Museラインのうち実際に呼び出せる部分であり、いつかアバターの背後に据えることになるエージェントを構築しているのなら、言語の部分こそが取りかかれる部分です。OrcaRouterはプロバイダーの定価を0%のマークアップでそのまま通すため、Metaの価格変更は次の請求サイクルではなく当日に当社のカードへ反映され、あるプロバイダーで失敗したリクエストはタイムアウトとして表面化するのではなく、正常なプロバイダーに対して再試行されます。

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

同じ論理は動画の領域にも当てはまります。当社はMuse Realtime Avatarをルーティングしておらず、Tavus Griffinもルーティングしていません。そして、そうでないとは主張しません。当社が実際にルーティングしているのは、200以上のモデルのカタログで、同じモダリティにわたります。そのため、テキストエージェント、音声モデル、動画生成器の間で切り替えるプロトタイプは1つのキーのままでいられますが、この記事で取り上げた2つのモデルは未リリースのままです。

どちらの方が出荷から遠いですか

公の記録上、Muse Realtime Avatar はさらに遠い存在だ。研究投稿があり、API も価格も日程もない。Griffin にも API も価格もないが、明確なリリース意図 —「これらの安全上の懸念が対処されたごく直後に」— があり、今日時点で選ばれたテスター向けに存在する名前付きのプレビュー階層があり、独立したテストハーネスによる公開ベンチマーク結果が大量にある。これはより進んだ立場だ。ただし、そのモデルは顧客に渡すには十分安全ではないという自認が伴うとしても。

それらを比較するときの罠は、870ミリ秒という数値を0.43秒という数値と直接比較できるものとして扱うことだ。両者は別々のものを測定している。Metaはターンの終了時点からポートレートの最初のバイトまでを測定し、Tavusはターンが明確なイベントではない連続的な双方向ストリーム内での音声から映像への遅延を測定している。数値はいずれも本物であり、同じ測定ではない。そして、それらを一つの列に並べて提示する人は、読者に不親切なことをしている。

結論

Muse Realtime Avatarは具現化レイヤーだ。音声を入力し、ポートレートを出力、ターン終了から最初のバイトまで870ミリ秒、448×768で25 fps、APIはなく、提供時期もない。Tavus Griffinは双方向のHuman Interaction Modelだ。参加者を入力し、反応する顔を出力、H100上での音声から映像までの平均レイテンシは0.43秒、さらに48%の人がそれを人間だと思ったと公表することをいとわず、顧客はそれを使えないとも述べるベンダーだ。Metaは追いつくものを作っている。Tavusは合格するものを作っている。どちらも購入できない。つまり、今日下せる唯一の決定は、問題のどちらの半分から着手するかであり、ほとんどのチームにとって、その半分はその下にある言語モデルだ。