
Muse Realtime Avatar: Vad Meta har byggt, vad den körs på och varför du fortfarande inte kan ringa den
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 1009 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Muse Realtime Avatar är Metas teknik för förkroppsligande. Den tar talströmmen som Muse Realtime Voice producerar och återger motsvarande framträdande: rikta den mot ett fotografiskt porträtt och ansiktet svarar med små förändringar i ansiktsuttrycket, rikta den mot en helkroppsillustration och figuren gestikulerar och ändrar hållning medan den talar. Meta AI Research introducerade den 23 september 2026 i ett inlägg med titeln "Bringing Your Muse to Life." Det är ett forskningsresultat snarare än en produkt — Metas egen sida erbjuder inget API, inget pris, ingen väntelista och inget publicerat datum för den — så det ärliga svaret på "kan jag använda den i dag" är nej. Muse-modellen du kan anropa i dag är en annan, Meta Muse Spark 1.2.
Det svaret förtjänar att stå i första stycket snarare än i det sista, eftersom en läsare som söker på det här namnet vanligtvis avgör om den ska planera utifrån det. Planera utifrån forskningen, inte utifrån en endpunkt.
En sak att säga rakt ut innan något annat, eftersom den här sidan bryter mot en regel som den borde erkänna. Den här bloggen skriver normalt om modeller under veckan de lanseras. Muse Realtime Avatar tillkännagavs en vecka innan den här sidan publicerades, så vid en strikt tolkning av färskhetsfönstret skulle posten hoppas över. Det här är inte en nyhetsartikel om en daterad händelse. Det är referenssidan för en modell som är levande i katalogsamtalet idag: sidan en läsare kommer till efter att ha skrivit modellens eget namn, vars berättigande är bestående sökefterfrågan som vi själva mätte snarare än färskheten hos en lansering. Septembertillkännagivandet nämns här som ett faktum som daterar modellen, inte som en händelse att rapportera, och inget nedan är ett andra tillkännagivande. Vår bevakning av den dagen är en separat artikel och den förblir separat.
Var den placerar sig i Muse-familjen
Meta är tydliga med att detta är två lager av ett system, inte två produkter. Enligt Metas formulering "Muse Realtime Voice och Muse Realtime Avatar utgör ett enda strömmande system som kopplar samman intelligens, röst och förkroppsligande." Röstlagret tillhandahåller den konversationella intelligensen och sänder ut en ström av taltoken – Meta kallar dem VQs – som bär både vad som sägs och hur det framförs. En ljudavkodare omvandlar dessa token till ljud, och avatarlagret konsumerar samma ström för att generera bilden. Att dela en och samma tokenström är det som håller röst, läpprörelser och uttryck i takt; det finns ingen separat läppsynkronisering som eftermonterats i efterhand.
Så: Muse Realtime Voice är samtalslagret. Muse Realtime Avatar är förkroppsligandelagret byggt ovanpå det. Inget av dem är det du kan anropa.
Var lika noggrann med ett närliggande namn, eftersom det är det som med störst sannolikhet förväxlas med endera. Muse Voice Transcribe är en transkriptionsslutpunkt, och det är en genuint annan produkt. Metas utvecklardokumentation är entydig: "Den är endast tal-till-text; den syntetiserar inte tal eller tillhandahåller ett API för tal-till-tal-konversation." Den returnerar tidsstämplar på tur-nivå och inte på ordnivå, och Meta listar den till $0,18 per timme på den sidan. Det är en verklig slutpunkt med ett pris. Det är inte en röst, och det är definitivt inte en avatar.
Den Muse-modell som faktiskt kan anropas är Meta Muse Spark 1.2, den resonemangsmodell som Meta levererar med en kontext på en miljon token samt text-, bild-, video-, fil- och ljudinmatning. Den går att routa här idag, till leverantörens listpris utan påslag, på samma nyckel som allt annat i katalogen, och dess livekort innehåller den fullständiga specifikationen. Vi tillhandahåller inte Muse Realtime Avatar. Vi kontrollerade den aktuella modellistan igen medan vi skrev detta, och de enda Muse-posterna på den är de två Spark-checkpointarna, 1.2 och dess föregångare 1.1. Att säga något mjukare än så – att familjen är "delvis tillgänglig" – skulle innebära att vi routar något som vi inte gör.

Tekniken, uttryckt i Metas egna termer
Metas beskrivning av arkitekturen är tillräckligt koncis för att citeras i stället för att omskrivas. Muse Realtime Avatar är "en ljuddriven Diffusion Transformer som betingas av en ström av tal-tokens, referensmedia och ett rullande fönster av senaste videolatenter", och den "genererar video i korta kausala segment". Den andra halvan av den meningen är den bärande delen: när varje segment slutförs blir dess nyaste genererade latenter rörelsekontexten för nästa. Metas angivna skäl är kontinuitet – avatarens utseende och manér förs vidare mellan turer samtidigt som beräkningen hålls begränsad, vilket är det som gör att genereringen kan fortsätta så länge samtalet varar i stället för att driva iväg eller få slut på budget.
Proveniensmekanismen hör hemma i samma stycke eftersom Meta presenterar den som en del av systemet snarare än som en eftertanke: genererad video bär en varaktig, osynlig vattenstämpel som appliceras via Meta Video Seal, vilket Meta säger inte tillför någon latens till realtidsvägen.
Meta mätte den här saken och publicerade fyra siffror för den. De siffrorna – och de specifika förbehåll som var och en kräver, inklusive den som ser ut som en uppsnabbning men inte är det – hör till lanseringsartikeln, som förmedlar dem med sitt sammanhang intakt. Vi kommer inte att upprepa de nakna siffrorna här, eftersom en naken siffra är precis vad den förbehållna versionen finns till för att förhindra.
Vi bevakade tillkännagivandet samma dag i vår lanseringsartikel om Muse Realtime Avatar, och den är fortfarande platsen att läsa de nyanserade påståendena i sin helhet.
Vad namnet inte är
Tre falska grannar är värda att utesluta en i taget, eftersom var och en av dem är en rimlig gissning enbart utifrån namnet.
• Det är inte Muse Voice Transcribe. Den slutpunkten omvandlar tal till text och gör, enligt Metas egen beskrivning, ingenting i den andra riktningen. Om det du behöver är en transkription säljer Meta en sådan, och det är en annan sak med ett annat pris.
• Det är inte en röstkloningstjänst. Ingenting på Metas sidor beskriver syntetisering av en specifik persons röst, försäljning av en röstmodell eller att ta emot ett röstprov från en användare. Röstlagret beskrivs som att det producerar en tokenström; avatarlagret beskrivs som att det konsumerar en. Den produktform som frasen vanligtvis antyder – ladda upp ett prov, få en klon – är inte vad som beskrivs här, och det demomaterial som Meta faktiskt publicerar är inramat som en illustration av modellens förmåga.
• Det är inte en konsumentavatar i Metas egen app. Meta åtföljer sina exempel med en varning som är lätt att missa och värd att behålla: demonstrationerna ”illustrerar modellens kapacitet och återspeglar inte alla de avatarer som finns i Muse-appen”, och Muse är för användare från 18 år. Läs det bokstavligt. En del av det som inlägget visar är kapacitet, inte utbud.
Ett fjärde namn är värt att särskilja av en annan anledning. Muse Realtime Avatar är inte Muse Video, videogenereringsmodellen som har legat på en offentlig resultattavla under större delen av det här året utan att släppas. Vår egen sida om den situationen – Muse Video: Releasedatum, API-åtkomst och vad Meta Connect kan komma att ändra – innehåller en begränsning som vi upprepar här ordagrant i stället för att förbättra den: varje sida som anger en specifik lanseringsdag eller ett pris för Muse Video utan ett nyare Meta-tillkännagivande spekulerar. Samma disciplin gäller för ämnet på den här sidan, så den här sidan anger inget av dem. Den artikeln anger också det datum som inte är vår sak att förväxla: Muse Video förhandsvisas den 7 juli 2026 och är inte släppt, vilket är anledningen till att en sökning på den här familjen ger datum som tillhör en annan modell.

Vad den här sidan är till för, och vad som skulle ändra den
Anledningen till att en referenssida är rätt form här är mätbar. Under de 28 dagar som slutade den 25 september 2026 drog den exakta termen 164 visningar i vår sökning och inga klick, med sin bästa placering på 9,3. Fler än femtio av våra sidor nämner fragmentet någonstans, och nästan all den trafiken landar på ett och samma meddelandeinlägg. En term med verklig, varaktig efterfrågan, som rankar precis utanför första sidan och inte konverterar någon, är inte ett efterfrågeproblem eller ett kvalitetsproblem – det är ett sidproblem. Det fanns ingen sida vars ämne var själva modellen. Det här är den sidan.
Positionen är också anledningen till att inget här är förklätt till nyheter. En läsare som kommer från en namnsökning vill ha tre saker i tur och ordning: vad detta är, om det är tillgängligt och vad det är byggt på. De besvaras ovan, i den ordningen, utan att några datum hittas på och utan att någon konkurrent nämns.

Det som skulle förändra sidan är ett enda tillkännagivande. Om Meta publicerar en endpoint, ett pris, en väntelista eller ett datum för Muse Realtime Avatar upphör avsnittet om tillgänglighet att vara ett "nej" och blir en specifikation, och den här sidan skrivs om i stället för att bara fyllas på. Om Meta lanserar Muse Video förändras stycket ovan i samma stund. Tills något av detta inträffar är det användbara draget för en utvecklare det oglamorösa: behåll gränssnittet du redan har riktat mot den modell du faktiskt kan nå. Varje modell i katalogen, Meta Muse Spark 1.2 inräknad, ligger bakom en OpenAI-kompatibel endpoint och en nyckel, vilket innebär att det kostar dig en ändring av modellsträngen i stället för ett nytt avtal att prova den del av den här familjen som finns. När förkroppsligandelagret blir anropbart bör växlingskostnaden också vara en sträng.
