Een gegenereerde hero-kaart voor het artikel 'Muse Realtime Avatar vs GPT-Live-1', met twee afgeronde kaarten aan weerszijden van de kop. De linkerkaart toont 'Muse Realtime Avatar' boven een portret-avatarpictogram en de regels 'video + spraak, één stream' en 'geen API, geen prijs, geen datum'; de rechterkaart toont 'GPT-Live-1' boven een spraakballonpictogram en de regels '$0,05 per minuut, per seconde gefactureerd' en 'gelijktijdige sessies, WebRTC'. Een ondertitel luidt: 'De ene verkoopt minuten. De andere verkoopt aanwezigheid.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1: Aanwezigheid tegenover Gesprek

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De facturatie-eenheid vertelt je wat elk bedrijf denkt dat het verkoopt. GPT-Live-1, Open​AI's full-duplex spraakmodel, rekent een vast tarief van $0,05 per minuut spraak, per seconde gefactureerd, en de snelheidslimieten zijn uitgedrukt in gelijktijdige sessies — 25 op Tier 1, oplopend tot 500 op Tier 5. Dat is de eenheid van een telefoonlijn. Muse Realtime Avatar, op 23 september 2026 aangekondigd door Meta, heeft geen facturatie-eenheid, want er valt niets te factureren: geen API, geen endpoint, geen prijs, geen datum. De gepubliceerde eenheid is in plaats daarvan een hardwarecijfer — 12 gelijktijdige realtime-sessies op één NVIDIA GB200. Het ene bedrijf verkoopt gesprekken per minuut. Het andere laat je zien wat het kost om een gezicht te renderen, en heeft nog niet besloten om het te verkopen.

Beide modellen zijn tamelijk nieuw, en geen van beide is een lancering in de zin die het woord gewoonlijk heeft. GPT-Live-1 werd op 8 juli 2026 binnen ChatGPT uitgebracht en bereikte pas op 10 september de developer-API — twee maanden waarin het de standaardstem van een consumentenproduct was en niet beschikbaar was voor wie aan het bouwen was. Muse Realtime Avatar werd op 23 september 2026 aangekondigd op Meta Connect, wordt gedemonstreerd in Meta's eigen onderzoeksbericht, en blijft een capaciteit van de Muse-agent in plaats van een product. Ze met elkaar vergelijken is twee verschillende stadia van hetzelfde idee vergelijken: wat er gebeurt wanneer een conversationeel model goed genoeg is dat de volgende vraag is waarnaar de gebruiker kijkt terwijl het praat.

Wat OpenAI bouwde: een gesprek dat nooit stokt

GPT-Live-1 is full-duplex in de operationeel relevante zin — het wacht niet tot je klaar bent voordat het begint te werken. Het bereikt de ontwikkelaars-API via precies één endpoint, het Live Sessions-endpoint, onder precies één model-ID, gpt-live-1, zonder gedateerde snapshots om vast te pinnen en zonder ingeschakelde zusterendpoints. Geen Chat Completions, geen Responses, geen Realtime, geen fine-tuning, geen audio-transcriptie- of spraakeindpunten. Beeld- en video-invoer worden expliciet niet ondersteund.

De ontwerpbeslissing die alles daarna vormgeeft, is delegatie. GPT-Live-1 doet zijn eigen moeilijke denkwerk niet. OpenAI's documentatie koppelt de spraaklaag aan een aparte redeneerbackend, en in het gepubliceerde WebRTC-voorbeeld is die backend GPT-5.6 Terra. Een GPT-Live-1-sessie bestaat dus uit twee meters die tegelijk lopen: $0,05 per minuut voor de spraak, plus de normale tokenstarieven van het backendmodel voor elke tool call, zoekopdracht en redeneerstap die het uitbesteedt. Op de Speech to Speech Index komt die gespleten persoonlijkheid naar voren als hetzelfde model dat twee keer scoort — 81,5 met GPT-6 Astra dat op medium effort het denkwerk doet, 80,1 met GPT-5.6 Sol op low effort. Het verschil van 1,4 punt tussen die twee configuraties is groter dan de marge van 0,2 punt die de beste configuratie van GPT-Live-1 op de eerste plaats zet.

Dat is de eerlijke vorm van het model. De spraakfront-end ligt vast; de intelligentie is een parameter die je instelt, en die beïnvloedt de score meer dan welk concurrerend model dan ook.

Wat Meta bouwde: een gezicht dat met de stem meebeweegt

Muse Realtime Avatar pakt een probleem aan dat GPT-Live-1 niet heeft: gegenereerde video synchroon houden met gegenereerde spraak. Het antwoord van Meta is om er dezelfde stream van te maken: Muse Realtime Voice zendt spraaktokens uit die zowel inhoud als prosodie dragen, en de avatar is een audio-aangedreven Diffusion Transformer die diezelfde tokens consumeert, geconditioneerd op een referentieafbeelding en een rollend venster van recente videolatenten. Niets wordt achteraf aan lip-synchronisatie onderworpen, want er is geen "achteraf" — stem, mond en expressie komen uit één proces.

De gepubliceerde cijfers zijn van Meta zelf, gemeten ten opzichte van door Meta gekozen baselines, en geen ervan is buiten het bedrijf gereproduceerd. 870 ms vanaf het einde van uw beurt tot de eerste byte van een gesynchroniseerd antwoord met spraak en video. 448×768 portretvideo met 25 frames per seconde, voorzien van een watermerk met een transparante overlay zodat een kijker kan zien dat het geen camera is. Twaalf gelijktijdige sessies op één GB200, een capaciteitswinst van 8× ten opzichte van Meta's eigen tweestaps-BF16-baseline, dankzij vier-bits kwantisatiebewuste training, persistente KV-caches en latentiebewuste dynamische batching. En een preferentieresultaat dat Meta rapporteert: van 45% naar 55% ten opzichte van die baseline, met twee bekendgemaakte overwinningen op commerciële avatarsystemen — plus de onthulling dat het resultaat op het gebied van manierismen tegen een van hen statistisch niet te onderscheiden is van pariteit.

Niets in die lijst is een tarief, een eindpunt of een datum.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

De tweemeterfactuur, en waar routering zijn plaats verdient.

De kostenstructuur van GPT-Live-1 is niet één getal, en door die als één getal te behandelen, produceert een stemmodel dat goedkoop klinkt een dure maand. Stem kost $0,05 per minuut, per seconde gefactureerd zonder afronding naar boven, en de eerste 15 seconden van een sessie worden vooraf gefactureerd, maar verrekend met de latere duur in plaats van erbovenop gestapeld. Alles wat de sessie delegeert — het redeneren, de tool-aanroepen, eventueel zoeken — wordt apart gefactureerd tegen de eigen tarieven van het backendmodel. Richt delegatie op een frontier-redeneermodel en laat het bij elke beurt zoeken, en je hebt een open lijn van $3 per uur gebouwd met een premiummodel erachter.

Die tweede meter is de routeerbare helft. Op OrcaRouter is de backend van een GPT-Live-1-sessie gewoon weer een modelaanroep: 196 modellen van 15 providers achter één enkele sleutel, tegen de lijstprijs van de provider, doorgegeven zonder enige marge, met automatische failover wanneer het model dat je hebt gekozen een fout geeft of een time-out krijgt. De spraaklaag zelf kun je niet routeren — Live Sessions is uitsluitend het endpoint van Open​AI — maar alles waaraan de spraaklaag delegeert, zit op één sleutel, wat betekent dat het deel van de rekening dat meeschaalt met hoe hard je bellers nadenken, ook het deel is dat je zonder contract kunt wijzigen.

Muse Realtime Avatar heeft daarentegen geen meters om te routeren. Het is een functie van een app.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Twee gokken over waar een voice agent voor is

Zet de specs opzij en de twee bedrijven zijn het oneens over het product. OpenAI's gok: het gesprek is het product — dat een voice-agent een telefoonlijn is, en het werk bestaat erin dat het zo aanvoelt: nooit blijven hangen, het zware denkwerk doorgeven aan een model erachter, factureren per minuut, schalen per gelijktijdig gesprek. Elke keuze in het API-oppervlak van GPT-Live-1 volgt daaruit. Rate limits op basis van gelijktijdigheid, transport uitsluitend via WebRTC, een bewust smal, enkel endpoint, geen video in of uit.

Meta's weddenschap is dat aanwezigheid het product is — dat een gebruiker die de agent kan zien, een gebruiker is die in het gesprek blijft, en dat het interessante engineeringwerk niet beurtwisseling is, maar het coherent houden van een gerenderd personage gedurende de duur van een gesprek. Die keuzes produceren een systeem dat is geoptimaliseerd voor framerate en sessiedichtheid op een GPU, zonder enig commercieel oppervlak.

Er is een reële mogelijkheid dat beide gelijk hebben en dat de twee worden samengevoegd. Een product zou zijn gesprek op een full-duplex spraakmodel kunnen laten draaien en zijn visuele laag op een avatar-renderer, en het enige dat dat vandaag tegenhoudt, is dat de avatar-renderer geen endpoint heeft. Wat niet plausibel is, is ze behandelen als twee versies van dezelfde aankoop.

Wie moet handelen, en wie moet wachten?

Als je nu een spraakproduct bouwt, is GPT-Live-1 aanroepbaar en Muse Realtime Avatar niet, en daarmee is de beslissing genomen. De interessante keuze binnen GPT-Live-1 is de backend waaraan je delegeert, want daar bewegen zowel de score als de rekening daadwerkelijk — en het is het enige onderdeel van de stack dat je kunt routeren, omwisselen en waarop je een failover kunt uitvoeren zonder de spraakintegratie aan te raken.

Als wat je wilt een avatar is, is wachten niet passief. De dingen die de moeite waard zijn om in de gaten te houden, zijn specifiek: of Meta een tariefkaart en een endpoint publiceert, of er een genoemde datum verschijnt, en of 870 ms standhoudt bij contact met een telefoon op een mobiele verbinding in plaats van een Connect-demo. Meta's eigen bericht merkt op dat niet al zijn demo's de avatars weerspiegelen die beschikbaar zijn in de Muse-app, en dat is de zin om aan vast te houden.

Totdat een van die dingen verandert, is de vergelijking in één regel samen te vatten. GPT-Live-1 is een telefoonlijn met een brein dat jij kiest. Muse Realtime Avatar is een gezicht zonder telefoonnummer.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.