
Muse Realtime Avatar vs Realtime-Venus:映像出力 対 映像入力
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 180 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
9日違いで発表された2つのシステムは、どちらも自らをリアルタイムと称し、どちらも音声視覚(オーディオビジュアル)のラベルを主張しているが、同じ軸に沿って反対方向を向いている。Muse Realtime Avatarは、2026年9月23日にMetaが発表したもので、写真を受け取り、生成する——その写真が話す動画を。動画は出力であり、毎秒25枚の448×768の縦向きフレームで、Muse Realtime Voiceとトークンストリームを共有する音声駆動型Diffusion Transformerによって生成される。Realtime-Venusは、2026年9月12日にAnt GroupのVenusチームが清華大学とともにarXivにアップロードしたもので、動画を消費する:Realtime-Venus-OmniチェックポイントはカメラフレームをSigLIP2エンコーダー経由でストリーミングし、見たものについて話す。一方、Realtime-Venus-Audioチェックポイントは同じバックボーンだが、ロード時に視覚がオフにされている。一方は顔をレンダリングする。もう一方はその顔を眺める。どちらも呼び出し可能ではなく、ダウンロード可能なのは片方だけである——そして、これこそがより重大な違いであることが判明する。
可用性の逆転は、何よりも先に率直に述べておく価値がある。なぜなら、それは Meta 製品と研究ラボのリリースに関するあらゆる予想に反しているからだ。Meta のシステムはクローズドだ。Connect で発表され、研究投稿で実演され、Muse エージェントに組み込まれているが、API も重みも価格も日付もない。Ant Group のシステムはオープンだ。Apache-2.0 の下、BF16 safetensors として 2 つの 9B チェックポイントがあり、公開先は inclusionAI/Realtime-Venus(Hugging Face 上)で、カスタム Transformers コード、requirements ファイル、参照音声、プロジェクトページ、および付属の GitHub リポジトリを備えている。消費者向け製品を持つ企業は、手に取れるものを何も出荷しなかった。研究チームはすべてを出荷した。
それぞれがフレームで何をするか
動画の方向性こそが構造上の違いのすべてであり、それは強調の問題ではない。
• 動画 — Muse Realtime Avatar が、音声トークン、参照画像、直近の動画潜在表現のローリングウィンドウを条件としてこれを生成する。Realtime-Venus-Omni がこれを知覚し、SigLIP2 視覚エンコーダが音声とともにフレームをモデルへストリーミングする。
• オーディオ — Muse Realtime Avatar は、Muse Realtime Voice の音声トークンから生成を駆動する。これらのトークンは内容と韻律を同時に担う。Realtime-Venus は、音声を、ストリーミング・フローマッチング・デコーダによってデコードされる離散的な S3 トークンとして生成するのであり、末尾に別個のテキスト読み上げモデルを後付けするのではない。
• Backbone — Metaのアーキテクチャは音声駆動型のDiffusion Transformerで、規模は非公開。Realtime-VenusはQwen3-8Bの言語バックボーンとWhisper-Medium音声エンコーダー上に構築されており、そのモデルカードにはOmniチェックポイントがMiniCPM-o 4.5から適応されたものだと記載されている。
• 重み — Muse Realtime Avatar のものは公開されておらず、今後公開される兆しもありません。Realtime-Venus は 2 つの 9B チェックポイントを提供しており、いずれも BF16、コンテキスト長 40,960 トークン、Apache-2.0 ライセンスの下にあります。
• アクセス — Muse Realtime Avatar には API も日付もなく、Realtime-Venus にも API はありません。しかもそのカードには、いかなる推論プロバイダーによってもデプロイされていないことが明記されています。
• どこで動くのか — Muse Realtime Avatar は、Meta がまだ数え上げていないユーザー向けに、18歳以上の規約のもとで Muse アプリ内で動作します。Realtime-Venus は、ハードウェアと意欲さえあれば、今日、あなた自身の GPU 上で動きます。
最後の2行をまとめて読むと、実用上の違いが見えてくる。どちらのシステムも呼び出すことはできない。一方は実行できる。
9Bのダウンロードは現実であり、それがあなたに課すコストもまた現実だ
Realtime-Venus はリポジトリのスタブではありません。重みもそこにあり、カスタムの読み込みコードもそこにあり、最上位のライセンスは Apache-2.0 です。これを前提に計画を立てる前に、知っておく価値のある点が二つあります。
ひとつ目は、重みの中にはないものである。このアーキテクチャを際立たせている二重ループのランタイム——1秒のインタラクションループと、論文がRealtime-Venus-Harnessと呼ぶバックグラウンドスケジューラであり、委任されたタスクを会話状態の分離されたスナップショットに対して実行するため、長時間走るジョブが会話の先の展開によって壊されることがない——は、GitHubリポジトリ内に別個のコンポーネントとして存在する。委任の設計は、このレポートにおいて真に新しいアイデアであり、あなた自身が組み立て、信頼する部分である。
第二は系譜である。カードには、Omniチェックポイントが、OpenBMBが2026年の早い時期にオープンソース化した9Bのオムニモーダルモデル、MiniCPM-o 4.5から適応されたものだと記載されている。これは脚注ではない。つまり、Ant Groupの貢献は、他者のストリーミング基盤の上に重ねられたポストトレーニング、ランタイム、委譲設計であり、これは「新しい9Bオムニモデル」よりも狭く具体的な主張である——しかもより有用な主張だ。なぜなら、視覚エンコーダ内のどこかが不具合を起こしたとき、どこを見るべきかを教えてくれるからである。
その数字、そしてそれが正確に誰のものなのか
ここが、二つのシステムが役に立たない形で一致する点だ。どちらにも、独立した評価がただの一つもない。Metaの4つの数値は、Metaが選んだベースラインに対して同社が報告したものである。Realtime-Venusの数値は技術報告書の中で著者らが報告したもので、第三者が実行結果を公表したことも、照合できるリーダーボード登録もない。どちらのシステムについても、それを開発していない人物による公開測定は存在しない。
Metaが公表している4項目:あなたの発話が終わってから、同期された音声と映像の返答の最初のバイトまでが870ミリ秒。448×768の縦向き動画を毎秒25フレーム。自社ベースライン比でモデル評価回数が60分の1。そして1台のNVIDIA GB200上で12の同時リアルタイムセッション——Metaの2ステップBF16ベースライン比で8倍の容量向上である。Metaはまた、2つの商用アバターシステムに対する選好結果も開示しており、そのうち1つについては、仕草において統計的に互角と区別できないと報告している——これは評価に値する開示だ。ほとんどのローンチ記事が省く類の結果だからである。
Ant Groupの、公表されている結果:レポートが使用する8つの動画ベンチマークのうち6つで最高スコアを獲得。これにはOmniチェックポイントのStreamingBench 70.2、OVO-Bench 64.7、Daily-Omni 81.3が含まれる。またAudioチェックポイントでは、MMAU 78.0、MMAU-Pro 63.2、Llama Questions 83.8、Speech CMMLU 67.8、そしてVoiceBench AlpacaEvalスコア4.81を記録し、レポートはこれを最高の比較値に匹敵すると述べている。
証拠における一つの非対称性は、名指しする価値がある。Ant Groupの数値は、名前の付いたテストセットによるベンチマークスコアであり、原則として、重みをダウンロードしてスイートを実行しようとする者なら誰でも再現できる。Metaの看板数値は、Meta自身のサービングスタック上でのレイテンシ測定であり、Metaの外部には誰もそのシステムを持たないため、Meta外部の誰も再現できない。言い換えれば、オープンなリリースのほうが、より検証可能なほうでもある。


なぜこれらはどちらも、正体を隠したルーティングの問題なのか
どちらのシステムも完全なエージェントではない。そしてそれは、両方に同じように当てはまる。Muse Realtime Avatar は Muse Realtime Voice に後付けされたレンダリング層であり、Muse Realtime Voice は、推論が Muse Spark 上で実行されるエージェントの会話層だ。Realtime-Venus は、インラインで実行できる範囲を超えるもの——検索、ツール呼び出し、高度な推論——を、会話のスナップショットに対してバックグラウンドで作業を実行するハーネスへ委譲する。どちらの設計でも、ユーザーが話しかける対象はフロントエンドであり、思考は別のテキストモデルで行われる。
その分離されたテキストモデルこそが、ルーティングできる部分です。OrcaRouter では、それは15 のプロバイダーにまたがる 196 のモデルに対する単一のエンドポイントであり、プロバイダーの定価をマークアップ一切なしでそのまま通し、モデルがエラーを起こしたりタイムアウトしたときには自動フェイルオーバーを行います——これは、向こう側にあるのが誰にも独立して評価されていないセルフホスト型チェックポイントである場合、通常以上に重要なことです。当社は Realtime-Venus をホストしていません。それはダウンロードであり、当社が提供するものではないからです。Muse Realtime Avatar もホストしていません。誰もホストしていないからです。当社が担っているのは、どちらのアーキテクチャもその難作業を委ねるレイヤーであり、それによって会話のどちら側にある未実証のコンポーネントも、本番環境への賭けではなく 1 行の設定で済むのです。
これらのうち、実際により進んでいるのはどれですか?
直感的にはMetaのものだと言いたくなる。Metaには製品とデモ動画があるからだ。しかし証拠はもっと興味深いことを示している。Metaのシステムは本番エンジニアリングがより優れている — GB200上での12同時セッションはサービングの成果であり、出荷中のアバター製品に対する開示された選好テストは、どちらのシステムにとっても唯一の直接比較の数値だ。Ant Groupのシステムは検証可能性がより高い:名称が明記されたベンチマーク、公開された重み、Apache-2.0ライセンス、そして誰でも再現を試みられるレポート。
どちらにも欠けているのは、それにお金を払う手段だ。そして、より実用的に近いのは、コンシューマー向けアプリがある方ではない。今夜ダウンロードして、自分のハードウェアで、自分のデータを使って、自分で確かめられる方であり、事前の発表も必要ない。
もしあなたが選んでいるのなら、問いはどちらのモデルが優れているかではない。呼べない顔が欲しいのか、動かせるカメラが欲しいのか、ということだ。

