Eine generierte Hero-Karte für den Artikel „Muse Realtime Avatar vs GPT-Live-1“, die zwei abgerundete Karten zu beiden Seiten der Überschrift zeigt. Auf der linken Karte steht „Muse Realtime Avatar“ über einem Porträt-Avatar-Symbol und den Zeilen „Video + Stimme, ein Stream“ und „keine API, kein Preis, kein Datum“; auf der rechten Karte steht „GPT-Live-1“ über einem Sprechblasen-Symbol und den Zeilen „0,05 $ pro Minute, sekundengenau abgerechnet“ und „gleichzeitige Sitzungen, WebRTC“. Ein Untertitel lautet „Der eine verkauft Minuten. Der andere verkauft Präsenz.“ Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Muse Realtime Avatar vs. GPT-Live-1: Präsenz gegen Konversation

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Abrechnungseinheit verrät, was jedes Unternehmen glaubt, zu verkaufen. GPT-Live-1, OpenAIs Vollduplex-Sprachmodell, rechnet pauschal 0,05 US-Dollar pro Sprachminute ab, sekundengenau abgerechnet, und seine Ratenlimits sind in gleichzeitigen Sitzungen angegeben – 25 in Stufe 1, steigend auf 500 in Stufe 5. Das ist die Einheit einer Telefonleitung. Muse Realtime Avatar, am 23. September 2026 von Meta angekündigt, hat keine Abrechnungseinheit, denn es gibt nichts abzurechnen: keine API, keinen Endpunkt, keinen Preis, kein Datum. Seine veröffentlichte Einheit ist stattdessen eine Hardware-Zahl – 12 gleichzeitige Echtzeitsitzungen auf einer einzigen NVIDIA GB200. Das eine Unternehmen verkauft Konversation im Minutentakt. Das andere zeigt Ihnen, was ein Gesicht beim Rendern kostet, und hat sich noch nicht entschieden, es zu verkaufen.

Beide Modelle sind noch ziemlich neu, und keines ist ein Launch in der Bedeutung, die das Wort gewöhnlich trägt. GPT-Live-1 wurde am 8. Juli 2026 innerhalb von ChatGPT ausgeliefert und erreichte die Entwickler-API erst am 10. September – zwei Monate, in denen es die Standardstimme eines Consumer-Produkts war und für alle, die etwas entwickelten, nicht verfügbar blieb. Muse Realtime Avatar wurde am 23. September 2026 auf Meta Connect angekündigt, wird in Metas eigenem Research-Post demonstriert und bleibt eine Fähigkeit des Muse-Agenten statt ein Produkt. Sie zu vergleichen heißt, zwei verschiedene Stadien derselben Idee zu vergleichen: was passiert, wenn ein Konversationsmodell gut genug ist, dass die nächste Frage lautet, worauf der Nutzer schaut, während es spricht.

Was OpenAI gebaut hat: eine Unterhaltung, die nie ins Stocken gerät

GPT-Live-1 ist in dem Sinne vollduplex, der operativ zählt — es wartet nicht darauf, dass Sie fertig werden, bevor es mit der Arbeit beginnt. Es erreicht die Entwickler-API über genau einen Endpunkt, den Live-Sessions-Endpunkt, unter genau einer Modell-ID, gpt-live-1, ohne datierte Snapshots zum Festlegen und ohne aktivierte Schwester-Endpunkte. Keine Chat Completions, keine Responses, kein Realtime, kein Fine-Tuning, keine Audio-Transkriptions- oder Sprach-Endpunkte. Bild- und Videoeingabe werden ausdrücklich nicht unterstützt.

Die Designentscheidung, die alles Nachgelagerte prägt, ist Delegation. GPT-Live-1 erledigt sein eigenes anspruchsvolles Denken nicht selbst. Die Dokumentation von OpenAI kombiniert die Sprachschicht mit einem separaten Reasoning-Backend, und im veröffentlichten WebRTC-Beispiel ist dieses Backend GPT-5.6 Terra. Eine GPT-Live-1-Sitzung besteht also aus zwei Zählern, die gleichzeitig laufen: 0,05 $ pro Minute für die Stimme plus die normalen Token-Tarife des Backend-Modells für jeden Tool-Aufruf, jede Suche und jeden Reasoning-Schritt, die es delegiert. Im Speech to Speech Index zeigt sich diese gespaltene Persönlichkeit darin, dass dasselbe Modell zweimal bewertet wird – 81,5 mit GPT-6 Astra, das mit mittlerem Aufwand das Denken übernimmt, 80,1 mit GPT-5.6 Sol bei geringem Aufwand. Die Lücke von 1,4 Punkten zwischen diesen beiden Konfigurationen ist größer als der 0,2-Punkte-Vorsprung, der die beste Konfiguration von GPT-Live-1 auf den ersten Platz bringt.

Das ist die ehrliche Form des Modells. Das Sprach-Frontend ist fest; die Intelligenz ist ein Parameter, den Sie einstellen, und sie verschiebt den Score stärker als jedes konkurrierende Modell.

Was Meta gebaut hat: ein Gesicht, das sich mit der Stimme bewegt

Muse Realtime Avatar packt ein Problem an, das GPT-Live-1 nicht hat – generiertes Video im Gleichschritt mit generierter Sprache zu halten. Metas Antwort besteht darin, sie zum selben Stream zu machen: Muse Realtime Voice emittiert Sprach-Tokens, die sowohl Inhalt als auch Prosodie tragen, und der Avatar ist ein audiogesteuerter Diffusion Transformer, der dieselben Tokens konsumiert, konditioniert auf ein Referenzbild und ein rollierendes Fenster aktueller Video-Latents. Nichts wird nachträglich lippensynchronisiert, denn es gibt kein „nachträglich“ – Stimme, Mund und Ausdruck entstehen in einem einzigen Prozess.

Die veröffentlichten Zahlen stammen von Meta selbst, gemessen an Baselines, die Meta ausgewählt hat, und keine davon wurde außerhalb des Unternehmens reproduziert. 870 ms vom Ende Ihres Turns bis zum ersten Byte einer synchronisierten Sprach- und Videoantwort. 448×768 Hochkantvideo mit 25 Bildern pro Sekunde, mit einem transparenten Overlay als Wasserzeichen versehen, sodass ein Betrachter erkennen kann, dass es nicht von einer Kamera stammt. Zwölf gleichzeitige Sitzungen auf einem GB200, eine Kapazitätssteigerung um das Achtfache gegenüber Metas eigener zweistufiger BF16-Baseline, durch quantisierungsbewusstes Training mit vier Bit, persistente KV-Caches und latenzbewusstes dynamisches Batching. Und ein Präferenzergebnis, das Meta mit einem Anstieg von 45 % auf 55 % gegenüber dieser Baseline angibt, mit zwei offengelegten Siegen gegen kommerzielle Avatar-Systeme – plus der Offenlegung, dass das Ergebnis bei Mannerismen gegen eines davon statistisch nicht von Parität zu unterscheiden ist.

Nichts auf dieser Liste ist eine Rate, ein Endpunkt oder ein Datum.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

Die Zwei-Meter-Rechnung und wo Routing sich seinen Platz verdient

Die Kostenstruktur von GPT-Live-1 ist nicht eine einzige Zahl, und sie als eine zu behandeln, führt dazu, dass ein günstig klingendes Sprachmodell einen teuren Monat verursacht. Sprache kostet 0,05 $ pro Minute, sekundengenau ohne Aufrundung abgerechnet, und die ersten 15 Sekunden einer Sitzung werden im Voraus berechnet, aber mit der späteren Dauer verrechnet, statt zusätzlich obendraufzukommen. Alles, was die Sitzung delegiert – das Reasoning, die Tool-Aufrufe, jede Suche –, wird separat zu den eigenen Tarifen des Backend-Modells abgerechnet. Richte die Delegation auf einen Frontier-Reasoner aus und lass ihn bei jedem Turn suchen, und du hast eine offene Leitung für 3 $ pro Stunde gebaut, hinter der ein Premium-Modell steht.

Dieser zweite Zähler ist die routingfähige Hälfte. Bei OrcaRouter ist das Backend einer GPT-Live-1-Session einfach ein weiterer Modellaufruf: 196 Modelle von 15 Anbietern hinter einem einzigen Schlüssel, zum Listenpreis des Anbieters ohne Aufschlag durchgereicht, mit automatischem Failover, wenn das von Ihnen gewählte Modell Fehler zurückgibt oder in einen Timeout läuft. Die Voice-Ebene können Sie nicht routen – Live Sessions ist ausschließlich der Endpunkt von OpenAI –, aber alles, an das die Voice-Ebene delegiert, liegt auf einem Schlüssel, was bedeutet, dass der Teil der Rechnung, der damit skaliert, wie intensiv Ihre Anrufer nachdenken, auch der Teil ist, den Sie ohne Vertrag ändern können.

Im Gegensatz dazu gibt es bei Muse Realtime Avatar keine Meter, die geroutet werden müssen. Es ist eine Funktion einer App.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Zwei Wetten darüber, wofür ein Voice-Agent da ist

Abgesehen von den Spezifikationen sind sich die beiden Unternehmen über das Produkt uneinig. OpenAIs Wette: Das Gespräch ist das Produkt – dass ein Sprachagent eine Telefonleitung ist und die Arbeit darin besteht, ihn sich wie eine anfühlen zu lassen: nie ins Stocken geraten, schwieriges Denken an ein Modell dahinter abgeben, minutenweise abgerechnet werden, nach gleichzeitigen Anrufen skalieren. Jede Entscheidung an der API-Oberfläche von GPT-Live-1 folgt daraus. Auf Gleichzeitigkeit basierende Ratenlimits, reiner WebRTC-Transport, ein bewusst schmaler einzelner Endpunkt, kein Video rein oder raus.

Metas Wette ist, dass Präsenz das Produkt ist – dass ein Nutzer, der den Agenten sehen kann, ein Nutzer ist, der im Gespräch bleibt, und dass es bei der interessanten Ingenieursleistung nicht um den Sprecherwechsel geht, sondern darum, eine gerenderte Figur über die Dauer eines Anrufs hinweg kohärent zu halten. Diese Entscheidungen ergeben ein System, das auf Bildrate und Sitzungsdichte auf einer GPU optimiert ist, ohne jegliche kommerzielle Oberfläche.

Es besteht die reale Möglichkeit, dass beide recht haben und die beiden zusammengesetzt werden. Ein Produkt könnte seine Konversation auf einem Vollduplex-Sprachmodell laufen lassen und seine visuelle Ebene auf einem Avatar-Renderer, und das Einzige, was das heute verhindert, ist, dass der Avatar-Renderer keinen Endpunkt hat. Was nicht plausibel ist, ist, sie als zwei Versionen desselben Kaufs zu behandeln.

Wer sollte handeln, und wer sollte warten?

Wenn du jetzt ein Voice-Produkt baust, ist GPT-Live-1 aufrufbar und Muse Realtime Avatar nicht, und damit ist die Entscheidung gefallen. Die interessante Wahl innerhalb von GPT-Live-1 ist das Backend, an das du delegierst, denn dort bewegen sich sowohl der Score als auch die Rechnung tatsächlich — und es ist der eine Teil des Stacks, den du routen, austauschen und mit Failover betreiben kannst, ohne die Voice-Integration anzufassen.

Wenn du einen Avatar willst, ist Warten nicht passiv. Die Dinge, die es zu beobachten lohnt, sind konkret: ob Meta eine Preisliste und einen Endpunkt veröffentlicht, ob ein genanntes Datum auftaucht und ob 870 ms den Kontakt mit einem Telefon über eine Mobilfunkverbindung überstehen – und nicht nur in einer Connect-Demo. Metas eigener Beitrag merkt an, dass seine Demos nicht alle Avatare widerspiegeln, die in der Muse-App verfügbar sind; das ist der Satz, an dem man sich festhalten sollte.

Bis sich eines davon ändert, lässt sich der Vergleich in einem Satz beantworten. GPT-Live-1 ist eine Telefonleitung mit einem Gehirn, das du wählst. Muse Realtime Avatar ist ein Gesicht ohne Telefonnummer.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.