Eine generierte Hero-Karte für den Artikel „Muse Realtime Avatar vs Gemini 3.8 Live", die zwei abgerundete Karten links und rechts neben der Überschrift zeigt. Auf der linken Karte steht „Muse Realtime Avatar" über einem Video-Frame-Symbol sowie die Zeilen „Video + Stimme raus", „448x768 Portrait, 25 fps" und „angekündigt am 23. Sept., keine API"; auf der rechten Karte steht „Gemini 3.8 Live" über einem Mikrofon-und-Sprechblasen-Symbol sowie die Zeilen „Audio + Text raus", „0,005 $/Min. Audio rein" und „GA 15. Sept., Live API". Ein Untertitel lautet: „Der eine rendert ein Gesicht. Der andere betreibt eine Telefonleitung." Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Muse Realtime Avatar vs. Gemini 3.8 Live: Ein Gesicht gegen eine Sprachverbindung

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Diese beiden sind keine Substitute, und am schnellsten sieht man das, wenn man fragt, was bei jedem einzelnen herauskommt. Muse Realtime Avatar, am 23. September 2026 von Meta angekündigt, liefert synchronisiertes Video einer Figur, die spricht — man liefert ein Referenzbild, und es rendert dieses Ding, wie es in 448×768-Hochformatbildern spricht und gestikuliert. Gemini 3.8 Live, am 15. September 2026 von Goog​le angekündigt und am selben Tag allgemein für Entwickler verfügbar, liefert Audio und Text. Eine Videoausgabe hat es überhaupt nicht. Die beiden in denselben Vergleich zu stellen, ist kein Fehler — sie konkurrieren um dieselbe Gesprächsoberfläche, und Käufer fragen bereits, auf welcher sie aufbauen sollen —, doch die Entscheidung lautet nicht „welches ist besser". Sie lautet „welches von zwei unterschiedlichen Produkten brauche ich", und fast jeder veröffentlichte Vergleich der beiden macht das falsch, indem er Benchmarks nebeneinanderstellt, die unterschiedliche Dinge messen.

Hier ist die Asymmetrie, die den Rahmen für alles Folgende bilden sollte. Du kannst Gemini 3.8 Live heute von einem Terminal aus mit einem Schlüssel aufrufen. Muse Realtime Avatar kannst du überhaupt nicht aufrufen – keine API, keinen Preis, kein Datum. Meta hat es bei Connect demonstriert und einen Research-Post veröffentlicht; Google hat eine Preisliste und eine Modell-ID veröffentlicht. Das ist ein Vergleich zwischen einem Produkt und einer Ankündigung, und er bedeutet, dass die nützliche Frage nicht lautet, welches gewinnt, sondern wozu dich jedes von beiden verpflichtet.

Was jedes einzelne davon tatsächlich produziert

Das ist der ganze Vergleich in sechs Zeilen, und keine der sechs kommt auch nur annähernd heran.

Ausgabe — Muse Realtime Avatar liefert synchronisierte Stimme und Portraitvideo, gemeinsam erzeugt aus einem einzigen Strom von Speech-Tokens; Gemini 3.8 Live liefert Audio und Text, ohne Videogenerierung irgendwo im Modell.

Entwicklerzugriff — Muse Realtime Avatar hat keinen: Es wurde am 23. September 2026 als Funktion von Metas Muse-Agent angekündigt, ohne API, ohne Endpunkt und ohne Angabe eines Datums. Gemini 3.8 Live ist seit dem 15. September 2026 in der Gemini API und in Goog​le AI Studio unter zwei Modell-IDs verfügbar, gemini-3.8-live und gemini-3.8-live-extended-thinking.

Preis — Muse Realtime Avatar hat keinen veröffentlichten Preis, weil es nichts zu kaufen gibt. Gemini 3.8 Live veröffentlicht 0,005 $ pro Minute Audioeingabe und 0,018 $ pro Minute Audioausgabe über die Live API.

Unabhängige Bewertung — Muse Realtime Avatar hat keine; seine Zahlen stammen von Meta selbst und wurden anhand von Baselines gemessen, die Meta ausgewählt hat. Gemini 3.8 Live erreicht 76,0 im Artificial Analysis Speech to Speech Index, die Extended-Thinking-Variante liegt bei 82,6 — eine Zahl von Drittanbietern, was eine andere Klasse von Belegen darstellt.

Latenz — die beiden veröffentlichten Werte sind nicht dieselbe Messung, und genau hier gehen die meisten Berichte schief. Meta gibt 870 ms vom Ende deines Turns bis zum ersten Byte einer synchronisierten Sprach- und Videoantwort an. Googles Zahl, gemessen von Artificial Analysis, beträgt 1,18 Sekunden bis zum ersten Audio für das Standardmodell und 1,35 Sekunden für die Reasoning-Variante.

Bildrate und Sprache — Muse Realtime Avatar rendert 448×768-Portraitvideo mit 25 Bildern pro Sekunde. Gemini 3.8 Live bietet automatische Umschaltung mitten im Gespräch über 97 unterstützte Sprachen hinweg und verarbeitet visuelle Eingaben nahezu in Echtzeit.

Die letzte Zeile enthält die Unterscheidung, die die Leute immer wieder zusammenwerfen. Gemini 3.8 Live kann sehen. Es kann nicht zeigen. Muse Realtime Avatar kann zeigen. Ob er sehen kann, ist nicht das, worum es in Metas Beitrag geht – er ist ein audiogesteuerter Generator, konditioniert auf Sprach-Tokens und ein Referenzbild, und seine Aufgabe ist es, ein Gesicht zu erzeugen, statt eines zu lesen.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

Die Latenzwerte sind nicht vergleichbar, und der Unterschied ist kleiner, als es scheint.

870 ms gegenüber 1,18 Sekunden liest sich, als sei Meta 26 % schneller. Liest man die Messwerte, löst sich der Vergleich auf. Metas Zahl ist die Zeit vom Ende des Nutzerbeitrags bis zum ersten Byte einer Antwort, die Video enthält – und Metas Beitrag sagt ausdrücklich, dass es sich um ein Erstes-Byte-Maß handelt, nicht um die Zeit bis zu einer vollständigen Antwort und nicht um die laufende Übertragungslatenz für den Rest des Anrufs. Ein System kann 870 ms bis zum ersten Byte erreichen und sich bei Sekunde zwölf trotzdem träge anfühlen. Goog​les Zahl ist die Zeit bis zum ersten Audio, einer deutlich kleineren Sache, die es zu erzeugen gilt, und sie wird von einem externen Evaluator gemessen statt vom Anbieter.

Beide sind die Art von Zahl, die einem sagt, dass ein System dialogorientiert statt turn-basiert ist, und keine von beiden verrät einem, wie sich der Anruf in Minute fünf anfühlt. Wenn man zwischen ihnen hinsichtlich der Reaktionsschnelligkeit wählt, ist die ehrliche Haltung, dass niemand eine direkt vergleichbare Messung veröffentlicht hat, und die einzige Möglichkeit, eine zu bekommen, ist, dasjenige laufen zu lassen, das anrufbar ist.

Worauf Sie heute aufbauen können und worauf Sie warten würden

Gemini 3.8 Live bringt mit, was eine Produktionsentscheidung braucht: zwei Modell-IDs, die sich festlegen lassen, veröffentlichte Minutenpreise, einen Index-Score eines Drittanbieters und ein genanntes Datum für die allgemeine Verfügbarkeit. Es bringt außerdem die Einschränkungen mit, die ein Sprachprodukt üblicherweise hat – Audio rein, Audio und Text raus und keine Videogenerierung.

Muse Realtime Avatar bringt mit, was ein Research-Post hat: eine Architektur, vier vom Unternehmen berichtete Kennzahlen und eine Reihe offengelegter Präferenztests, die Meta gegen zwei kommerzielle Avatar-Systeme durchgeführt hat – wobei Meta selbst für eines davon berichtet, dass es bei den Eigenheiten statistisch nicht von Parität zu unterscheiden ist. Was fehlt, ist eine Möglichkeit, ihn zu kaufen. In Metas Beitrag steht außerdem, dass die gezeigten Demos nicht alle Avatare widerspiegeln, die in der Muse-App verfügbar sind, und genau dieser Satz sollte jeden Plan bestimmen, den du rund um dieses Thema aufstellst.

Es gibt eine dritte Option, die es wert ist, genannt zu werden, denn sie ist die, für die sich die meisten Teams tatsächlich entscheiden. Keines dieser Modelle ist ein vollständiger Agent. Gemini 3.8 Live übergibt Hintergrundarbeit an Tools und APIs, während es weiter spricht; GPT-Live-1 delegiert sein Reasoning vollständig an ein separates Backend-Modell. Die Konversationsschicht ist das Frontend, und das Denken ist ein anderer Aufruf an ein anderes Modell. Dieser zweite Aufruf ist gewöhnliche Textinferenz, und er ist routingfähig.

Auf OrcaRouter ist diese Ebene ein einziger Endpunkt: 196 Modelle von 15 Anbietern hinter einem einzigen Schlüssel, zum Listenpreis der Anbieter ohne Aufschlag, mit automatischem Failover, falls das von Ihnen gewählte Modell einen Fehler zurückgibt oder ein Timeout hat. Wir hosten Gemini 3.8 Live nicht – die Live-API gehört allein Google – und wir hosten Muse Realtime Avatar nicht, den niemand hostet. Was wir anbieten, ist die Hälfte eines Voice-Agenten, die mit der Denkleistung Ihrer Anrufer skaliert, und die Hälfte, die Sie ändern können, ohne irgendetwas neu zu verhandeln.

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

Wo die beiden sich tatsächlich treffen könnten

Der Grund dafür, sie nebeneinanderzustellen, sind nicht Benchmarks. Er liegt darin, dass beide versuchen, denselben Platz in einem Produkt zu besetzen: das, womit ein Nutzer spricht. Goog​les Wette ist, dass dieser Platz ein Gespräch ist und das Ergebnis ein gutes – 97 Sprachen, Ausführung von Tools im Hintergrund, eine Reasoning-Variante, die 68,6 % der τ-Voice-Kundenservice-Szenarien löst, gegenüber 30,1 % beim Standardmodell. Metas Wette ist, dass dieser Platz eine Präsenz ist und dass ein Nutzer, der den Agenten sehen kann, ein Nutzer ist, der im Gespräch bleibt.

Diese Wetten schließen sich nicht gegenseitig aus. Ein Produkt könnte plausibel Gemini 3.8 Live für die Sprachschleife verwenden und so etwas wie Muse Realtime Avatar für die visuelle Ebene, falls die Avatar-Ebene jemals aufrufbar wird. Was es nicht tun kann, ist, sie als austauschbar zu behandeln, denn eines davon wird dir niemals ein Gesicht geben und das andere wird dir möglicherweise niemals einen Endpunkt geben.

Wie man entscheidet

Wenn Sie in diesem Quartal ein Sprachprodukt ausliefern, ist die Entscheidung bereits für Sie gefallen: Gemini 3.8 Live ist aufrufbar und Muse Realtime Avatar nicht. Wählen Sie Ihre Variante anhand der Achse, über die das Release tatsächlich streitet — das Extended-Thinking-Modell erkauft 38 Punkte agentischer Aufgabenerfüllung für etwas mehr als das Vierfache der stündlichen Audiokosten, und das Standardmodell ist das günstigste kompetente Sprachmodell auf der öffentlichen Rangliste. Leiten Sie dann das delegierte Reasoning separat, denn dort stecken sowohl die Rechnung als auch die Latenz.

Wenn Sie eine Avatar-Ebene bewerten, lautet die ehrliche Antwort, dass es noch nichts zu bewerten gibt. Was existiert, ist ein Forschungsbeitrag mit vier vom Unternehmen gemeldeten Zahlen und einer Demonstration. Worauf man achten sollte, ist nicht der Index – Muse Realtime Avatar wird in keinem erscheinen –, sondern ob Meta eine Preisliste, einen Endpunkt und ein Datum veröffentlicht und ob die 870 ms standhalten, wenn der Avatar auf einem Smartphone über eine Mobilfunkverbindung läuft und nicht in einer Connect-Demo.

Bis dahin hat der Vergleich eine kürzere Form, als die meisten Artikel ihm geben. Eines davon ist ein Produkt mit einem Preis, einer Modell-ID und einer Fremdbewertung. Das andere ist eine sehr gute Demonstration von etwas, das noch nichts davon hat.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.