Een gegenereerde hero-kaart voor het artikel 'Muse Realtime Avatar vs Gemini 3.8 Live', met twee afgeronde kaarten aan weerszijden van de kop. Op de linkerkaart staat 'Muse Realtime Avatar' boven een video-frame-icoon en de regels 'video + spraak uit', '448x768 portret, 25 fps' en 'aangekondigd 23 sept, geen API'; op de rechterkaart staat 'Gemini 3.8 Live' boven een icoon van een microfoon met spraakbubbel en de regels 'audio + tekst uit', '$0,005/min audio in' en 'GA 15 sept, Live API'. Een ondertitel luidt: 'De ene rendert een gezicht. De andere laat een telefoonlijn draaien.' Het OrcaRouter-logo is in de rechteronderhoek samengesteld.
Guides & Insights

Muse Realtime Avatar vs Gemini 3.8 Live: Een gezicht tegenover een stemlijn

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Deze twee zijn geen vervangers, en de snelste manier om dat te zien is je af te vragen wat er uit elk van beide komt. Muse Realtime Avatar, aangekondigd door Meta op 23 september 2026, levert gesynchroniseerde video van een personage dat praat — je levert een referentieafbeelding aan en het rendert dat ding dat praat en gebaart in portretframes van 448×768. Gemini 3.8 Live, aangekondigd door Google op 15 september 2026 en dezelfde dag algemeen beschikbaar voor ontwikkelaars, levert audio en tekst. Het heeft helemaal geen video-uitvoer. Ze in dezelfde vergelijking plaatsen is geen fout — de twee concurreren om hetzelfde gespreksoppervlak, en kopers vragen zich al af op welke ze moeten bouwen — maar de beslissing is niet "welke is beter". Het is "welk van twee verschillende producten heb ik nodig", en bijna elke gepubliceerde vergelijking van het tweetal doet dat verkeerd door benchmarks naast elkaar te zetten die verschillende dingen meten.

Hier is de asymmetrie die alles hieronder zou moeten inkaderen. Je kunt Gemini 3.8 Live vandaag aanroepen, vanuit een terminal, met een sleutel. Je kunt Muse Realtime Avatar helemaal niet aanroepen — geen API, geen prijs, geen datum. Meta demonstreerde het op Connect en publiceerde een onderzoeksartikel; Google bracht een tariefkaart en een model-ID uit. Dat is een vergelijking tussen een product en een aankondiging, en het betekent dat de nuttige vraag niet is welke wint, maar waartoe elk je verplicht.

Wat elk van hen daadwerkelijk produceert

Dit is de hele vergelijking in zes regels, en geen van de zes komt in de buurt.

Uitvoer — Muse Realtime Avatar retourneert gesynchroniseerde spraak en portretvideo, samen gegenereerd uit één enkele stroom spraaktokens; Gemini 3.8 Live retourneert audio en tekst, zonder enige videogeneratie in het model.

Toegang voor ontwikkelaars — Muse Realtime Avatar heeft die niet: het werd op 23 september 2026 aangekondigd als een functionaliteit van Meta's Muse-agent, zonder API, zonder endpoint en zonder opgegeven datum. Gemini 3.8 Live staat sinds 15 september 2026 in de Gemini API en Google AI Studio, onder twee model-ID's, gemini-3.8-live en gemini-3.8-live-extended-thinking.

Prijs — Muse Realtime Avatar heeft geen gepubliceerde prijs omdat er niets te koop is. Gemini 3.8 Live publiceert $0,005 per minuut audio-invoer en $0,018 per minuut audio-uitvoer via de Live API.

Onafhankelijke scoring — Muse Realtime Avatar heeft die niet; de cijfers zijn van Meta zelf, gemeten tegen benchmarks die Meta zelf heeft gekozen. Gemini 3.8 Live scoort 76,0 op de Artificial Analysis Speech to Speech Index, met de extended-thinking-variant op 82,6 — een cijfer van een derde partij, wat een andere categorie bewijs is.

Latentie — de twee gepubliceerde cijfers zijn niet dezelfde meting, en dit is waar de meeste artikelen de fout ingaan. Meta rapporteert 870 ms vanaf het einde van jouw beurt tot de eerste byte van een gesynchroniseerd antwoord in spraak en video. Het cijfer van Google, zoals gemeten door Artificial Analysis, is 1,18 seconde tot de eerste audio voor het standaardmodel en 1,35 seconde voor de reasoning-variant.

Beeldformaat en taal — Muse Realtime Avatar rendert portretvideo van 448×768 met 25 frames per seconde. Gemini 3.8 Live biedt automatische taalwisseling midden in een gesprek in 97 ondersteunde talen en verwerkt bijna-realtime visuele invoer.

Die laatste rij bevat het onderscheid dat mensen steeds maar blijven wegpoetsen. Gemini 3.8 Live kan zien. Het kan niet tonen. Muse Realtime Avatar kan tonen. Of het kan zien, is niet waar de post van Meta over gaat — het is een audiogestuurde generator, geconditioneerd op spraaktokens en een referentieafbeelding, en zijn taak is het produceren van een gezicht in plaats van het lezen ervan.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

De latentiecijfers zijn niet vergelijkbaar, en het verschil is kleiner dan het lijkt.

870 ms tegen 1,18 seconden leest alsof Meta 26% sneller is. Lees de metingen en de vergelijking valt uiteen. Het cijfer van Meta is de tijd vanaf het einde van de beurt van de gebruiker tot de eerste byte van een antwoord waarin video zit — en in Meta's bericht staat expliciet dat het een first-byte-meting is, niet de tijd tot een volledig antwoord en niet de doorlopende leveringslatentie voor de rest van het gesprek. Een systeem kan 870 ms naar de eerste byte halen en op seconde twaalf nog steeds traag aanvoelen. Het cijfer van Goog​le is de tijd tot de eerste audio, iets strikt kleiners om te produceren, en het wordt gemeten door een externe beoordelaar in plaats van door de leverancier.

Beide zijn het soort getal dat je vertelt dat een systeem conversationeel is in plaats van beurtgebaseerd, en geen van beide vertelt je hoe het gesprek aanvoelt op minuut vijf. Als je op basis van responsiviteit tussen hen kiest, is de eerlijke positie dat niemand een gelijkwaardige meting heeft gepubliceerd, en de enige manier om er een te krijgen is degene uitvoeren die aanroepbaar is.

Waar je vandaag op kunt bouwen, en waarop je zou wachten

Gemini 3.8 Live wordt geleverd met alles wat een productiebeslissing nodig heeft: twee model-ID's die je kunt vastzetten, gepubliceerde tarieven per minuut, een indexscore van een derde partij, en een aangekondigde datum voor algemene beschikbaarheid. Het komt ook met de beperkingen die een spraakproduct meestal heeft — audio in, audio en tekst uit, en geen videogeneratie.

Muse Realtime Avatar heeft de dingen die een onderzoeksbericht heeft: een architectuur, vier door het bedrijf gerapporteerde cijfers en een reeks openbaar gemaakte voorkeurstests die Meta uitvoerde tegen twee commerciële avatarsystemen, waarvan Meta zelf rapporteert dat één ervan statistisch niet te onderscheiden is van pariteit op het gebied van maniërisme. Wat het niet heeft, is een manier om het te kopen. Meta's bericht merkt ook op dat de getoonde demo's niet allemaal de avatars weerspiegelen die beschikbaar zijn in de Muse-app, en dat is de zin die bepalend zou moeten zijn voor elk plan dat je hieromheen bouwt.

Er is een derde optie die het benoemen waard is, want die is degene die de meeste teams daadwerkelijk kiezen. Geen van deze modellen is een complete agent. Gemini 3.8 Live besteedt achtergrondwerk uit aan tools en API's terwijl het blijft praten; GPT-Live-1 delegeert zijn redenering volledig aan een apart backendmodel. De gesprekslaag is de front-end, en het denkproces is een andere aanroep naar een ander model. Die tweede aanroep is gewone tekstinferentie, en die is routeerbaar.

Op OrcaRouter is die laag één endpoint: 196 modellen van 15 providers achter één enkele sleutel, tegen de listprijs van de provider en zonder enige markup doorgegeven, met automatische failover als het model dat je hebt gekozen een fout geeft of een time-out krijgt. Wij hosten Gemini 3.8 Live niet — de Live API is alleen van Google — en wij hosten Muse Realtime Avatar niet, die niemand host. Wat wij wel leveren, is de helft van een voice-agent die meeschaalt met hoe hard je bellers nadenken, en de helft die je kunt veranderen zonder iets opnieuw te onderhandelen.

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

Waar de twee elkaar misschien daadwerkelijk zouden kunnen ontmoeten

De zaak om ze naast elkaar te zetten is niet gebaseerd op benchmarks. Het is dat beide proberen dezelfde plek in een product te bezetten: datgene waar een gebruiker tegen praat. De inzet van Google is dat die plek een gesprek is en dat het eindresultaat een goed gesprek is — 97 talen, uitvoering van tools op de achtergrond, een redeneervariant die 68,6% van de τ-Voice-klantenservicescenario's oplost tegenover 30,1% bij het standaardmodel. De inzet van Meta is dat die plek een aanwezigheid is, en dat een gebruiker die de agent kan zien, een gebruiker is die in het gesprek blijft.

Die gokken sluiten elkaar niet uit. Een product zou heel goed Gemini 3.8 Live kunnen gebruiken voor de spraaklus en zoiets als Muse Realtime Avatar voor de visuele laag, als de avatarlaag ooit aanroepbaar wordt. Wat het niet kan doen, is ze als uitwisselbaar behandelen, want een van beide zal je nooit een gezicht geven en de andere geeft je misschien nooit een endpoint.

Hoe te beslissen

Als je dit kwartaal een spraakproduct op de markt brengt, is de beslissing al voor je genomen: Gemini 3.8 Live is aanroepbaar en Muse Realtime Avatar niet. Kies je variant op de as waar de release daadwerkelijk over discussieert — het extended-thinking-model levert 38 punten agentische taakvoltooiing op voor iets meer dan vier keer de audiokosten per uur, en het standaardmodel is het goedkoopste competente spraakmodel op de openbare ranglijst. Routeer het gedelegeerde redeneren vervolgens apart, want daar zitten zowel de rekening als de latentie.

Als je een avatar-laag evalueert, is het eerlijke antwoord dat er nog niets te evalueren valt. Wat bestaat, is een onderzoeksbericht met vier door het bedrijf gerapporteerde cijfers en een demonstratie. Het punt om in de gaten te houden is niet de index — Muse Realtime Avatar zal daar niet op verschijnen — maar of Meta een tariefkaart, een endpoint en een datum publiceert, en of die 870 ms standhoudt wanneer de avatar op een telefoon via een mobiele verbinding draait in plaats van in een Connect-demo.

Tot dan toe heeft de vergelijking een kortere vorm dan de meeste artikelen eraan geven. Een van deze is een product met een prijs, een model-ID en een externe score. De andere is een zeer goede demonstratie van iets dat nog geen van die dingen heeft.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.