Ett genererat hero-kort för artikeln ”Muse Realtime Avatar vs Gemini 3.8 Live”, som visar två rundade kort på ömse sidor om rubriken. Det vänstra kortet visar ”Muse Realtime Avatar” ovanför en videoram-ikon och raderna ”video + röst ut”, ”448x768 stående, 25 fps” och ”tillkännagavs 23 sep, inget API”; det högra kortet visar ”Gemini 3.8 Live” ovanför en ikon med mikrofon och pratbubbla och raderna ”ljud + text ut”, ”$0.005/min ljud in” och ”GA 15 sep, Live API”. En underrubrik lyder ”Den ena renderar ett ansikte. Den andra driver en telefonlinje.” OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Muse Realtime Avatar vs Gemini 3.8 Live: Ett ansikte mot en röstlinje

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

De här två är inte utbytbara mot varandra, och det snabbaste sättet att inse det är att fråga sig vad var och en av dem producerar. Muse Realtime Avatar, som Meta tillkännagav den 23 september 2026, returnerar synkroniserad video av en karaktär som talar – du anger en referensbild och den renderar varelsen som talar och gestikulerar i porträttbildrutor på 448×768. Gemini 3.8 Live, som Google tillkännagav den 15 september 2026 och som blev allmänt tillgängligt för utvecklare samma dag, returnerar ljud och text. Det har ingen videoutdata alls. Att ställa dem i samma jämförelse är inte ett misstag – de två konkurrerar om samma samtalsyta, och köpare frågar redan vilken de ska bygga på – men beslutet är inte ”vilken som är bättre”. Det är ”vilken av två olika produkter behöver jag”, och nästan varje publicerad jämförelse av de två gör fel genom att rada upp benchmarks som mäter olika saker.

Här är den asymmetri som bör rama in allt nedan. Du kan anropa Gemini 3.8 Live i dag, från en terminal, med en nyckel. Du kan inte anropa Muse Realtime Avatar alls – inget API, inget pris, inget datum. Meta demonstrerade den på Connect och publicerade ett forskningsinlägg; Google levererade ett prisschema och ett modell-ID. Det är en jämförelse mellan en produkt och ett tillkännagivande, och det innebär att den användbara frågan inte är vilken som vinner, utan vad var och en förbinder dig till.

Vad var och en faktiskt producerar

Det här är hela jämförelsen i sex rader, och ingen av de sex är nära.

Utdata — Muse Realtime Avatar returnerar synkroniserad röst och porträttvideo, genererade tillsammans från en enda ström av taltokens; Gemini 3.8 Live returnerar ljud och text, utan videogenerering någonstans i modellen.

Utvecklaråtkomst — Muse Realtime Avatar har ingen: den tillkännagavs den 23 september 2026 som en funktion i Metas Muse-agent, utan API, utan slutpunkt och utan angivet datum. Gemini 3.8 Live finns i Gemini API och Goog​le AI Studio från och med den 15 september 2026, under två modell-ID:n, gemini-3.8-live och gemini-3.8-live-extended-thinking.

Pris — Muse Realtime Avatar har inget publicerat pris eftersom det inte finns något att köpa. Gemini 3.8 Live publicerar $0,005 per minut för ljudinmatning och $0,018 per minut för ljudutmatning via Live API.

Oberoende poängsättning — Muse Realtime Avatar har ingen; dess siffror är Metas egna, uppmätta mot baslinjer som Meta valde. Gemini 3.8 Live har 76,0 på Artificial Analysis Speech to Speech Index, med varianten med utökat tänkande på 82,6 — en siffra från tredje part, vilket är en annan klass av bevis.

Latens — de två publicerade siffrorna avser inte samma mätning, och det är här de flesta genomgångar går fel. Meta rapporterar 870 ms från slutet av din tur till den första byten i ett synkroniserat röst- och videosvar. Googles siffra, mätt av Artificial Analysis, är 1,18 sekunder till första ljudet för standardmodellen och 1,35 sekunder för resonemangsvarianten.

Bildfrekvens och språk — Muse Realtime Avatar renderar porträttvideo i 448×768 med 25 bilder per sekund. Gemini 3.8 Live har automatisk växling mitt i konversationen mellan 97 språk som stöds och bearbetar visuell indata i nära realtid.

Den sista raden innehåller den åtskillnad som folk ständigt blandar ihop. Gemini 3.8 Live kan se. Den kan inte visa. Muse Realtime Avatar kan visa. Huruvida den kan se är inte vad Metas inlägg handlar om — den är en ljuddriven generator, betingad på taltokens och en referensbild, och dess uppgift är att producera ett ansikte snarare än att läsa ett.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

Latenssiffrorna är inte jämförbara, och skillnaden är mindre än den verkar.

870 ms mot 1,18 sekunder låter som att Meta är 26 % snabbare. Läser man mätningarna upplöses jämförelsen. Metas siffra är tiden från slutet av användarens tur till den första byten i ett svar som innehåller video – och Metas inlägg är tydligt med att det är ett mått på första byten, inte tiden till ett komplett svar och inte den löpande leveranslatensen för resten av samtalet. Ett system kan nå 870 ms till första byten och ändå kännas trögt vid sekund tolv. Googles siffra är tiden till första ljud, en strikt mindre sak att producera, och den mäts av en extern utvärderare snarare än av leverantören.

Båda är den typ av siffra som säger att ett system är konversationellt snarare än turbaserat, och ingen av dem säger hur samtalet känns vid minut fem. Om du väljer mellan dem utifrån responsivitet är den ärliga hållningen att ingen har publicerat en jämförbar mätning, och det enda sättet att få en är att köra den som går att ringa.

Vad du kan bygga vidare på idag, och vad du skulle vänta på

Gemini 3.8 Live kommer med det som ett produktionsbeslut behöver: två modell-ID:n som du kan låsa, publicerade minutpriser, en poäng från ett tredjepartsindex och ett angivet datum för allmän tillgänglighet. Det kommer också med de begränsningar som en röstprodukt vanligtvis har – ljud in, ljud och text ut och ingen videogenerering.

Muse Realtime Avatar kommer med det som ett forskningsinlägg har: en arkitektur, fyra företagsrapporterade siffror och en uppsättning redovisade preferenstester som Meta körde mot två kommersiella avatarsystem, varav ett som Meta själv rapporterar som statistiskt oskiljbart från paritet när det gäller manér. Det som saknas är ett sätt att köpa det. Metas inlägg noterar också att demosarna som visas inte alla återspeglar avatarer som finns i Muse-appen, vilket är meningen som bör styra alla planer du bygger kring detta.

Det finns ett tredje alternativ värt att nämna, eftersom det är det som de flesta team faktiskt väljer. Ingen av dessa modeller är en komplett agent. Gemini 3.8 Live överlämnar bakgrundsarbete till verktyg och API:er medan den fortsätter prata; GPT-Live-1 delegerar sitt resonemang helt till en separat backend-modell. Det konversationella lagret är frontend, och tänkandet är ett annat anrop till en annan modell. Det andra anropet är vanlig textinferens, och det är routbart.

På OrcaRouter är det lagret en enda slutpunkt: 196 modeller från 15 leverantörer bakom en enda nyckel, till leverantörens listpris, vidarebefordrat utan påslag, med automatisk failover om modellen du valde ger fel eller får timeout. Vi hostar inte Gemini 3.8 Live — Live-API:t tillhör enbart Google — och vi hostar inte Muse Realtime Avatar, som ingen hostar. Det vi erbjuder är den halva av en röstagent som skalar med hur hårt dina uppringare tänker, och den halva du kan ändra utan att behöva omförhandla något.

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

Där de två faktiskt skulle kunna mötas

Argumentet för att ställa dem sida vid sida handlar inte om benchmarks. Det är att båda försöker ta samma plats i en produkt: det som en användare talar med. Googles satsning är att platsen är en konversation och att leveransen är bra – 97 språk, verktygskörning i bakgrunden, en resonemangsvariant som löser 68,6 % av τ-Voice kundtjänstscenarier jämfört med standardmodellens 30,1 %. Metas satsning är att platsen är en närvaro, och att en användare som kan se agenten är en användare som stannar kvar i konversationen.

De satsningarna är inte ömsesidigt uteslutande. En produkt skulle rimligen kunna använda Gemini 3.8 Live för röstloopen och något i stil med Muse Realtime Avatar för det visuella lagret, om avatarlagret någonsin blir anropbart. Vad den inte kan göra är att behandla dem som utbytbara, eftersom en av dem aldrig kommer att ge dig ett ansikte och den andra kanske aldrig kommer att ge dig en slutpunkt.

Hur man bestämmer

Om du lanserar en röstprodukt detta kvartal är beslutet redan fattat åt dig: Gemini 3.8 Live går att anropa och Muse Realtime Avatar gör det inte. Välj din variant utifrån den axel som lanseringen faktiskt argumenterar kring — modellen med utökat tänkande ger 38 poäng i agentiskt uppgiftsfullbordande för lite drygt fyra gånger den timvisa ljudkostnaden, och standardmodellen är den billigaste kompetenta röstmodellen på den offentliga resultattavlan. Routa sedan det delegerade resonemanget separat, för det är där både notan och latensen ligger.

Om du utvärderar ett avatarlager är det ärliga svaret att det inte finns något att utvärdera ännu. Det som finns är ett forskningsinlägg med fyra siffror som företaget rapporterat och en demonstration. Det man bör hålla ögonen på är inte indexet – Muse Realtime Avatar kommer inte att finnas med på ett sådant – utan om Meta publicerar en prislista, en slutpunkt och ett datum, och om dess 870 ms håller när avataren körs på en telefon med mobilanslutning i stället för i en Connect-demo.

Fram till dess har jämförelsen en kortare form än vad de flesta artiklar ger den. En av dessa är en produkt med ett pris, ett modell-ID och ett externt betyg. Den andra är en mycket bra demonstration av något som ännu inte har något av dessa.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.