Ett genererat hero-kort för artikeln ”Muse Realtime Avatar vs GPT-Live-1”, som visar två rundade kort på varsin sida om rubriken. Det vänstra kortet visar ”Muse Realtime Avatar” ovanför en porträttavatarikon och raderna ”video + röst, en ström” och ”inget API, inget pris, inget datum”; det högra kortet visar ”GPT-Live-1” ovanför en pratbubbla och raderna ”0,05 USD per minut, faktureras per sekund” och ”samtidiga sessioner, WebRTC”. En underrubrik lyder ”Den ena säljer minuter. Den andra säljer närvaro.” OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1: Närvaro mot konversation

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Faktureringsenheten talar om vad varje företag anser att det säljer. GPT-Live-1, Open​AIs full-duplex-röstmodell, faktureras med ett fast pris på 0,05 USD per minut röst, debiterat per sekund, och dess hastighetsgränser anges i samtidiga sessioner – 25 på nivå 1, vilket stiger till 500 på nivå 5. Det är en telefonlinjes enhet. Muse Realtime Avatar, som tillkännagavs av Meta den 23 september 2026, har ingen faktureringsenhet, eftersom det inte finns något att fakturera: inget API, ingen slutpunkt, inget pris, inget datum. Dess publicerade enhet är i stället en hårdvarusiffra – 12 samtidiga realtidssessioner på en NVIDIA GB200. Ett företag säljer konversation per minut. Det andra visar dig vad ett ansikte kostar att rendera, och har ännu inte bestämt sig för att sälja det.

Båda modellerna är ganska nya och ingen av dem är en lansering i den mening ordet vanligtvis har. GPT-Live-1 släpptes i ChatGPT den 8 juli 2026 och nådde utvecklar-API:et först den 10 september – två månader under vilka den var standardrösten i en konsumentprodukt och otillgänglig för alla som byggde. Muse Realtime Avatar tillkännagavs den 23 september 2026 på Meta Connect, demonstreras i Metas eget forskningsinlägg och är fortfarande en förmåga hos Muse-agenten snarare än en produkt. Att jämföra dem är att jämföra två olika stadier av samma idé: vad som händer när en samtalsmodell är så pass bra att nästa fråga är vad användaren tittar på medan den talar.

Vad OpenAI byggde: en konversation som aldrig kör fast

GPT-Live-1 är full-duplex i den bemärkelse som är operativt relevant – den väntar inte på att du ska bli klar innan den börjar arbeta. Den når utvecklar-API:et via exakt en endpoint, Live Sessions-endpointen, under exakt ett modell-ID, gpt-live-1, utan daterade snapshots att låsa och utan aktiverade syskonendpoints. Inga Chat Completions, inga Responses, ingen Realtime, ingen finjustering, inga endpoints för ljudtranskribering eller tal. Bild- och videoinmatning stöds uttryckligen inte.

Designbeslutet som formar allt nedströms är delegering. GPT-Live-1 sköter inte sitt eget tunga tänkande. OpenAI:s dokumentation kopplar samman röstlagret med en separat resonemangsbackend, och i det publicerade WebRTC-exemplet är den backenden GPT-5.6 Terra. Så en GPT-Live-1-session är två mätare som tickar samtidigt: 0,05 USD per minut för rösten, plus backendmodellens vanliga tokenpriser för varje verktygsanrop, sökning och resonemangssteg som den delegerar. På Speech to Speech Index visar sig den kluvna personligheten genom att samma modell poängsätts två gånger — 81,5 med GPT-6 Astra som tänker på medelhög ansträngning, 80,1 med GPT-5.6 Sol på låg ansträngning. Gapet på 1,4 punkter mellan de två konfigurationerna är större än marginalen på 0,2 punkter som placerar GPT-Live-1:s bästa konfiguration på första plats.

Det är modellens ärliga form. Röstgränssnittet är fast; intelligensen är en parameter du ställer in, och den påverkar resultatet mer än någon konkurrerande modell gör.

Vad Meta byggde: ett ansikte som rör sig med rösten

Muse Realtime Avatar angriper ett problem som GPT-Live-1 inte har – att hålla genererad video i takt med genererat tal. Metas svar är att göra dem till samma ström: Muse Realtime Voice sänder ut taltokens som bär både innehåll och prosodi, och avataren är en ljuddriven Diffusion Transformer som konsumerar samma tokens, betingad på en referensbild och ett rullande fönster av nyliga videolatenter. Ingenting läppsynkas i efterhand, för det finns ingen "efterhand" – röst, mun och uttryck kommer ur en och samma process.

De publicerade siffrorna är Metas egna, uppmätta mot baslinjer som Meta valde, och ingen av dem har reproducerats utanför företaget. 870 ms från slutet av din tur till det första bytet i ett synkroniserat röst- och videosvar. 448×768 porträttvideo vid 25 bilder per sekund, vattenmärkt med ett transparent överlägg så att en tittare kan se att det inte är en kamera. Tolv samtidiga sessioner på en GB200, en 8× kapacitetsvinst jämfört med Metas egen tvåstegs-BF16-baslinje, tack vare fyrabitars kvantiseringsmedveten träning, beständiga KV-cachar och latensmedveten dynamisk batchning. Och ett preferensresultat som Meta rapporterar går från 45 % till 55 % mot den baslinjen, med två redovisade vinster mot kommersiella avatarsystem – plus upplysningen att resultatet i fråga om manér mot ett av dem inte är statistiskt skiljbart från paritet.

Ingenting i den listan är en hastighet, en slutpunkt eller ett datum.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

Tvåmetersräkningen, och där routing förtjänar sin plats

GPT-Live-1:s kostnadsstruktur är inte ett enda tal, och att behandla den som ett är just hur en röstmodell som låter billig skapar en dyr månad. Röst kostar 0,05 USD per minut, debiteras per sekund utan avrundning uppåt, och de första 15 sekunderna av en session faktureras i förskott men krediteras mot senare varaktighet i stället för att läggas ovanpå. Allt som sessionen delegerar – resonemanget, verktygsanropen, eventuella sökningar – faktureras separat enligt backendmodellens egna priser. Rikta delegeringen mot en toppmodern resonemangsmotor och låt den söka vid varje tur, och du har byggt en öppen linje för 3 USD i timmen med en premiummodell bakom.

Den där andra mätaren är den routningsbara halvan. I OrcaRouter är backend för en GPT-Live-1-session bara ännu ett modellanrop: 196 modeller från 15 leverantörer bakom en enda nyckel, till leverantörens listpris, vidarebefordrat utan påslag, med automatisk failover när modellen du valt ger fel eller får timeout. Du kan inte routa röstlagret — Live Sessions är enbart OpenAIs endpoint — men allt som röstlagret delegerar till ligger på en och samma nyckel, vilket betyder att den del av räkningen som skalas med hur hårt dina uppringare tänker också är den del du kan ändra utan avtal.

Muse Realtime Avatar har däremot inga mätare att routa. Det är en funktion i en app.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Två satsningar på vad en röstagent är till för

Rensar man bort specifikationerna är de två företagen oense om produkten. Open​AIs satsning är att konversationen är produkten – att en röstagent är en telefonlinje, och arbetet består i att få den att kännas som en: att aldrig stanna av, att lämna över svårt tänkande till en modell bakom den, att ta betalt per minut, att skala efter antalet samtidiga samtal. Varje val i GPT-Live-1:s API-yta följer av det. Samtidsbaserade hastighetsgränser, transport enbart via WebRTC, en medvetet smal enda slutpunkt, ingen video in eller ut.

Metas satsning är att närvaro är produkten – att en användare som kan se agenten är en användare som stannar i samtalet, och att det intressanta ingenjörsarbetet inte är turtagning utan att hålla en renderad karaktär sammanhängande under ett helt samtal. Dessa val producerar ett system optimerat för bildfrekvens och sessionsdensitet på en GPU, utan någon kommersiell yta alls.

Det finns en reell möjlighet att båda har rätt och att de två kombineras. En produkt skulle kunna köra sin konversation på en full-duplex-röstmodell och sitt visuella lager på en avatar-renderare, och det enda som hindrar detta i dag är att avatar-renderaren saknar en endpoint. Det som inte är rimligt är att betrakta dem som två versioner av samma köp.

Vem bör agera, och vem bör vänta

Om du bygger en röstprodukt nu går GPT-Live-1 att anropa och Muse Realtime Avatar inte, och det avgör saken. Det intressanta valet inuti GPT-Live-1 är vilken backend du delegerar till, för det är där både poängen och notan faktiskt påverkas — och det är den enda delen av stacken som du kan routa, byta ut och redundansväxla utan att röra röstintegrationen.

Om det du vill ha är en avatar är det inte passivt att vänta. Det som är värt att hålla ögonen på är specifikt: om Meta publicerar en prislista och en slutpunkt, om ett angivet datum dyker upp, och om 870 ms överlever mötet med en telefon i ett mobilnät i stället för en Connect-demo. I Metas eget inlägg noteras att deras demos inte alla återspeglar de avatarer som finns i Muse-appen, vilket är meningen att hålla fast vid.

Tills en av dessa ändras har jämförelsen ett enradigt svar. GPT-Live-1 är en telefonlinje med en hjärna du väljer. Muse Realtime Avatar är ett ansikte utan telefonnummer.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.