Eine generierte Hero-Karte für den Artikel „Muse Realtime Avatar vs Realtime-Venus“, die zwei abgerundete Karten beiderseits der Überschrift zeigt. Auf der linken Karte steht „Muse Realtime Avatar“ über einem ausgehenden Video-Frame-Symbol und den Zeilen „generiert das Video“ und „448x768 bei 25 fps, geschlossen“; auf der rechten Karte steht „Realtime-Venus“ über einem eingehenden Kamera-Symbol und den Zeilen „liest das Video“ und „2 x 9B, Apache-2.0, herunterladbar“. Ein Untertitel lautet: „Das eine rendert ein Gesicht. Das andere beobachtet eines.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Muse Realtime Avatar vs. Realtime-Venus: Video Out gegen Video In

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Systeme, die im Abstand von neun Tagen angekündigt wurden, nennen sich beide Echtzeit und beanspruchen beide das audiovisuelle Label, und sie zeigen entlang derselben Achse in entgegengesetzte Richtungen. Muse Realtime Avatar, am 23. September 2026 von Meta angekündigt, nimmt ein Foto und erzeugt ein Video davon, wie es spricht — sein Video ist die Ausgabe: 448×768-Hochformatbilder mit 25 pro Sekunde, erzeugt von einem audiogesteuerten Diffusion Transformer, der sich einen Token-Stream mit Muse Realtime Voice teilt. Realtime-Venus, am 12. September 2026 von der Venus Team bei Ant Group gemeinsam mit der Tsinghua-Universität auf arXiv hochgeladen, verarbeitet Video: Der Checkpoint Realtime-Venus-Omni streamt Kamerabilder durch einen SigLIP2-Encoder und spricht darüber, was er sieht, während der Checkpoint Realtime-Venus-Audio dasselbe Backbone ist, bei dem die Vision beim Laden abgeschaltet wird. Der eine rendert ein Gesicht. Der andere beobachtet eines. Keines von beiden ist aufrufbar, und nur eines von beiden ist herunterladbar — was sich als der folgenreichere Unterschied erweist.

Die Verfügbarkeits-Umkehrung ist es wert, vor allem anderen schlicht festgestellt zu werden, denn sie läuft jeder Erwartung an ein Meta-Produkt und eine Veröffentlichung aus einem Forschungslabor zuwider. Metas System ist geschlossen: angekündigt auf dem Connect, demonstriert in einem Forschungsbeitrag, eingebettet in den Muse-Agenten, ohne API, ohne Gewichte, ohne Preis und ohne Datum. Das System von Ant Group ist offen: zwei 9B-Checkpoints als BF16-Safetensors unter Apache-2.0 bei inclusionAI/Realtime-Venus auf Hugging Face, mit benutzerdefiniertem Transformers-Code, einer Requirements-Datei, einer Referenzstimme, einer Projektseite und einem begleitenden GitHub-Repository. Das Unternehmen mit dem Verbraucherprodukt hat nichts geliefert, das man in der Hand halten kann. Das Forschungsteam hat das Ganze geliefert.

Was jedes Einzelne mit einem Frame macht

Die Richtung des Videos ist der gesamte architektonische Unterschied, und es ist keine Frage der Betonung.

Video — Muse Realtime Avatar generiert es, konditioniert auf Sprach-Tokens, ein Referenzbild und ein rollendes Fenster aktueller Video-Latents; Realtime-Venus-Omni nimmt es wahr, wobei ein SigLIP2-Bildencoder Frames zusammen mit Audio kontinuierlich in das Modell einspeist.

Audio — Muse Realtime Avatar steuert die Generierung anhand der Sprach-Tokens von Muse Realtime Voice, die Inhalt und Prosodie gemeinsam tragen; Realtime-Venus erzeugt Sprache als diskrete S3-Tokens, die von einem Streaming-Flow-Matching-Decoder dekodiert werden, anstatt ein separates Text-to-Speech-Modell am Ende anzuhängen.

Backbone — Metas Architektur ist ein audiogesteuerter Diffusion Transformer mit nicht offengelegter Größe; Realtime-Venus basiert auf einem Qwen3-8B-Sprachbackbone mit einem Whisper-Medium-Audio-Encoder, und auf seiner Modellkarte steht, dass der Omni-Checkpoint von MiniCPM-o 4.5 adaptiert wurde.

Gewichte — Muse Realtime Avatars sind nicht veröffentlicht, und es gibt keine Hinweise darauf, dass sie es sein werden; Realtime-Venus liefert zwei 9B-Checkpoints, BF16, 40.960-Token-Kontext bei beiden, unter Apache-2.0.

Zugang — Muse Realtime Avatar hat keine API und kein Datum; Realtime-Venus hat ebenfalls keine API, und auf seiner Karte steht eindeutig, dass es von keinem Inferenzanbieter bereitgestellt wird.

Wo es läuft — Muse Realtime Avatar läuft in der Muse-App für Nutzer, die Meta nicht aufgeführt hat, zu 18+-Bedingungen; Realtime-Venus läuft heute auf deinen eigenen GPUs, wenn du die Hardware und das Verlangen dafür hast.

Liest man die letzten beiden Zeilen zusammen, zeigt sich der praktische Unterschied. Keines der beiden Systeme kann aufgerufen werden. Eines von ihnen kann ausgeführt werden.

Der 9B-Download ist real, und das gilt auch für das, was er Sie kostet.

Realtime-Venus ist kein Repository-Stub. Die Gewichte sind vorhanden, der benutzerdefinierte Ladecode ist vorhanden, und die Lizenz auf oberster Ebene ist Apache-2.0. Zwei Dinge daran sind wissenswert, bevor Sie damit planen.

Das Erste ist das, was nicht in den Gewichten ist. Die Dual-Loop-Laufzeitumgebung, die die Architektur unverwechselbar macht – die Ein-Sekunden-Interaktionsschleife plus ein Hintergrund-Scheduler, den das Paper Realtime-Venus-Harness nennt, der delegierte Aufgaben gegen einen isolierten Schnappschuss des Gesprächszustands ausführt, sodass ein lang laufender Auftrag nicht dadurch korrumpiert werden kann, dass das Gespräch weiterläuft –, befindet sich als separate Komponente im GitHub-Repository. Das Delegationsdesign, die wirklich neue Idee in dem Bericht, ist der Teil, den Sie selbst zusammenbauen und dem Sie selbst vertrauen.

Das Zweite ist die Abstammung. Die Karte gibt an, dass der Omni-Checkpoint von MiniCPM-o 4.5 abgeleitet ist, dem 9B-omnimodalen Modell, das OpenBMB früher im Jahr 2026 als Open Source veröffentlicht hat. Das ist keine Fußnote. Es bedeutet, dass der Beitrag von Ant Group das Post-Training, die Runtime und das Delegationsdesign sind, die auf das Streaming-Backbone eines anderen aufgesetzt wurden – eine engere und spezifischere Aussage als „ein neues 9B-Omni-Modell“ und eine nützlichere, weil sie einem sagt, wo man nachsehen muss, wenn etwas im visuellen Encoder nicht richtig funktioniert.

Die Zahlen – und wem genau sie gehören

Hier treffen die beiden Systeme auf eine wenig hilfreiche Weise zusammen: Keines von beiden hat eine einzige unabhängige Bewertung. Metas vier Zahlen sind unternehmensgemeldet gegen von Meta ausgewählte Baselines. Die von Realtime-Venus sind von den Autoren in einem technischen Bericht gemeldet, wobei kein Dritter einen Durchlauf veröffentlicht hat und kein Leaderboard-Eintrag zum Abgleich existiert. Es gibt keine öffentliche Messung eines der beiden Systeme durch jemanden, der es nicht entwickelt hat.

Metas vier Zahlen, wie veröffentlicht: 870 ms vom Ende Ihres Turns bis zum ersten Byte einer synchronisierten Sprach- und Videoantwort; 448×768-Hochformatvideo mit 25 Bildern pro Sekunde; 60× weniger Modell-Evaluationen als die eigene Baseline; und 12 gleichzeitige Echtzeitsitzungen auf einer NVIDIA GB200, ein 8-facher Kapazitätsgewinn gegenüber Metas zweistufiger BF16-Baseline. Meta veröffentlicht außerdem Präferenzergebnisse gegenüber zwei kommerziellen Avatar-Systemen, von denen es eines laut eigenen Angaben als statistisch nicht von Parität bei den Manierismen unterscheidbar meldet — eine Offenlegung, die Anerkennung verdient, da es sich um die Art von Ergebnis handelt, die die meisten Launch-Posts auslassen.

Ant Group, wie veröffentlicht: Bestwert bei sechs der acht Videobenchmarks, die der Bericht verwendet, darunter StreamingBench 70,2, OVO-Bench 64,7 und Daily-Omni 81,3 für den Omni-Checkpoint; und für den Audio-Checkpoint MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8 und einen VoiceBench-AlpacaEval-Wert von 4,81, der laut Bericht dem besten Vergleichswert entspricht.

Eine Asymmetrie in der Beweislage verdient es, benannt zu werden. Die Zahlen von Ant Group sind Benchmark-Ergebnisse mit benannten Testsets – prinzipiell reproduzierbar, von jedem, der bereit ist, die Gewichte herunterzuladen und die Testsuite auszuführen. Metas Schlagzeilenzahl ist eine Latenzmessung auf Metas eigenem Serving-Stack, die niemand außerhalb von Meta reproduzieren kann, weil niemand außerhalb von Meta das System hat. Die offene Veröffentlichung ist mit anderen Worten auch die leichter überprüfbare.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

Warum beides in Wahrheit ein Routing-Problem ist

Keines der beiden Systeme ist ein vollständiger Agent, und das gilt auf dieselbe Weise für beide. Muse Realtime Avatar ist eine Renderschicht, die auf Muse Realtime Voice aufgesetzt ist, welche die Konversationsschicht eines Agenten ist, dessen Reasoning auf Muse Spark läuft. Realtime-Venus delegiert alles, was über das hinausgeht, was es inline tun kann — Retrieval, Tool-Aufrufe, anspruchsvolles Reasoning — an ein Harness, das die Arbeit im Hintergrund anhand eines Schnappschusses der Konversation ausführt. Bei beiden Designs ist das, womit der Benutzer spricht, ein Frontend, und das Denken findet in einem separaten Textmodell statt.

Dieses separate Textmodell ist der Teil, den Sie routen können. Bei OrcaRouter ist es ein einziger Endpunkt für 196 Modelle von 15 Anbietern, zum Listenpreis des Anbieters ohne Aufschlag durchgereicht, mit automatischem Failover, wenn ein Modell einen Fehler verursacht oder ein Timeout auftritt — was mehr als sonst zählt, wenn das Gegenüber ein selbst gehosteter Checkpoint ist, den niemand unabhängig bewertet hat. Wir hosten Realtime-Venus nicht: Es ist ein Download, und wir stellen es nicht bereit. Wir hosten auch Muse Realtime Avatar nicht, weil das niemand tut. Was wir anbieten, ist die Ebene, an die beide Architekturen ihre Schwerarbeit übergeben, sodass eine unerprobte Komponente auf beiden Seiten des Gesprächs eine Zeile Konfiguration statt einer Produktionswette ist.

Welche davon ist tatsächlich weiter fortgeschritten?

Instinktiv würde man sagen: Metas, weil Meta das Produkt und das Demo-Video hat. Die Beweise sagen etwas Interessanteres. Metas System hat besseres Produktionsengineering – 12 gleichzeitige Sitzungen auf einem GB200 sind ein Serving-Ergebnis, und die offengelegten Präferenztests gegen ausgelieferte Avatar-Produkte sind die einzigen direkten Vergleichszahlen, die eines der beiden Systeme überhaupt hat. Das System von Ant Group hat eine bessere Überprüfbarkeit: benannte Benchmarks, veröffentlichte Gewichte, eine Apache-2.0-Lizenz und einen Bericht, den jeder zu reproduzieren versuchen kann.

Was beiden fehlt, ist eine Möglichkeit, dafür zu bezahlen. Und das, was eher nutzbar ist, ist nicht das mit der Consumer-App – es ist das, das du heute Abend herunterladen und selbst herausfinden kannst, auf deiner eigenen Hardware, mit deinen eigenen Daten, und ohne dass eine Ankündigung nötig ist.

Wenn Sie vor der Wahl stehen, geht es nicht darum, welches Modell besser ist. Es geht darum, ob Sie ein Gesicht wollen, das Sie nicht rufen können, oder eine Kamera, die Sie betreiben können.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.