Ett genererat herokort för 'Muse Realtime Avatar: Meta ger sin Muse-agent ett ansikte, vid 870 millisekunder per tur', som visar överraden 'Meta Superintelligence Labs — 23 september 2026', rubriken och tre fakta från Metas forskningsinlägg: 448×768 porträttvideo i 25 fps, cirka 870 ms från slutet av turen till första byte, och 12 samtidiga realtidssessioner på en NVIDIA GB200. En underrubrik lyder 'Det är inte ett talande huvud. Det är ett renderingslager ovanpå en röstmodell.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Engineering & Research

Muse Realtime Avatar: Meta ger sin Muse Agent ett ansikte, vid 870 millisekunder per tur

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Siffran som Meta valde att inleda med är 870 millisekunder. Det är hur lång tid Muse Realtime Avatar tar, enligt Metas egen mätning, från det ögonblick du slutar prata till det ögonblick då den första byten av ett synkroniserat röst- och videosvar anländer. Det är en genuint aggressiv siffra för ett system som måste generera video, och den är värd att läsas exakt – för nästan allt intressant med Metas nya förkroppsligandemodell ligger i gapet mellan vad den siffran mäter och vad folk kommer att anta att den mäter.

Muse Realtime Avatar tillkännagavs den 23 september 2026 på Meta Connect och beskrevs samma dag av Meta Superintelligence Labs i ett forskningsinlägg med titeln "Att väcka din Muse till liv." Den utökar Muse Realtime Voice, samtalslagret inuti Metas Muse-agent, genom att ge den en kropp. Den är inte en chattbot med en standardavatar: du ger den en referensbild — ett fotografi, en helkroppsillustration, ett djur, ett hushållsföremål — och den renderar den där saken när den pratar, gestikulerar och ändrar hållning i kontinuerlig video under hela samtalet. Zuckerberg sade på scenen att avataren som är kopplad till hans egen Muse heter Jolly.

Ett delat tokenflöde, inte ett läppsynkroniseringspass

Arkitekturen är den del som är värd att förstå, för den förklarar varför Meta fortsätter säga "förkroppsligande" i stället för "avatar". Muse Realtime Voice producerar en ström av taltokens – inlägget kallar dem VQ:er – som bär både innehållet i det som sägs och dess prosodi: tempot, betoningen, stigandet och fallandet. Muse Realtime Avatar konsumerar samma ström. Det är en ljuddriven Diffusion Transformer som betingas på dessa taltokens, på referensmediet du tillhandahöll och på ett rullande fönster av recenta videolatenter, och den genererar video i korta kausala bitar, där varje ny latent matas framåt som rörelsekontext för nästa.

Att dela en enda tokenström är det som håller röst, läpprörelser och ansiktsuttryck sammankopplade. Alternativet – generera ljudet och kör sedan en separat läppsynkmodell på det – är hur större delen av avatarbranschen arbetar, och det är därför så många av dessa avatarer ser ut som om de dubbas. Metas design eliminerar den skarven per konstruktion. Det rullande latenta fönstret är den andra halvan av idén: utan det driver en chunkbaserad generator iväg, och efter tre minuter har din karaktär obemärkt blivit någon annan.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

Fyra publicerade siffror, och vad var och en av dem faktiskt mäter

Meta publicerade fler siffror än vad som är vanligt för ett forskningsinlägg kopplat till en konsumentfunktion. Alla fyra nedan är företagsrapporterade, uppmätta av Meta mot baslinjer som Meta valde; ingen av dem har reproducerats utanför företaget.

870 ms från slutet av turen till första byte. Detta är ett svarstartsmått. Det är inte tiden till ett fullständigt svar, och det är inte den pågående leveransfördröjningen under resten av samtalet. Ett system kan nå 870 ms till första byte och ändå kännas trögt vid sekund tolv. Metas inlägg är tydligt med att detta är måttet för första byte; bevakning som utelämnar förbehållet läser det som end-to-end-responsivitet, vilket det inte är.

448×768 stående video med 25 bilder per sekund. Det är en hög telefonformad bildruta, inte en liggande, och 25 fps är filmiskt snarare än mjukt — standardbildfrekvensen för film, under de 30 eller 60 fps som en inbyggd kameraström skulle ge dig. Meta säger att demoklipp är vattenmärkta med ett genomskinligt överlägg så att en mottagare kan avgöra att de inte tittar på ett normalt kameraflöde.

60× färre modellutvärderingar. Gås igenom ordentligt nedan, eftersom detta är talet som mest sannolikt misstolkas.

12 samtidiga realtidssessioner på en NVIDIA GB200. Meta rapporterar att deras serving-arbete – persistenta KV-cachar, cachemedveten routning, latensmedveten dynamisk batchning, fyrbitars kvantiseringsmedveten träning, fusionerade kärnor och CUDA Graph capture, utvecklat tillsammans med NVIDIA – ökade kapaciteten 8× jämfört med deras egen tvåstegs-BF16-baslinje. Aritmetiken bakom är enkel: varje genereringssteg producerar åtta bildrutor, vilket är 320 ms uppspelning, på 20 ms modelltid, eller 2,5 ms per bildruta. Både 12 och 8× avser Metas angivna baslinje, inte en annan leverantörs hårdvara.

Varför 60× inte är 60× snabbare

Kompressionspåståendet är det som kommer att upprepas mest och förstås minst. Metas lärarmodell var en 40-stegs diffusionsmodell med trevägs klassificerarfri vägledning – tre pass per steg, alltså 120 modellutvärderingar för att producera en bit video. Studenten är en tvåstegs kausal modell utan vägledning med en KV-cache av fast längd, tränad genom destillation och self-forcing, och den behöver två utvärderingar för samma bit. Det är en 60× minskning av utvärderingarna per bit, med – för att använda Metas ord – nära lärarkvalitet.

Det är en minskning av beräkningsarbetet per chunk. Sextio gånger färre utvärderingar innebär inte att en användare väntar en sextiondel av tiden, eftersom latensen hade andra bidragande orsaker före destillationen och fortfarande har dem efter. Diagrammet i Metas eget inlägg visar vad minskningen gav i kvalitetshänseende: mänsklig preferens ökade från 45 % till 55 %. Det är den ärliga versionen av historien – poängen med destillationen var att skapa ett system som överhuvudtaget kunde köras i realtid, och kvalitetskostnaden hölls till omkring tio preferenspoäng i stället för att elimineras.

Bedömningen, inklusive resultatet som gick åt andra hållet

Meta testades mot två kommersiella avatarsystem, Runway Characters och HeyGen LiveAvatar, med matchade avataridentiteter så att bedömarna jämförde animeringen i stället för karaktärsdesignen. Bedömarna höll två- till treminuters livekonversationer med varje system och jämförde sedan visuell kvalitet, synkronisering, karaktärskonsistens och manér.

Meta rapporterar att man föredras framför Runway Characters med 78 % mot 22 % och framför HeyGen LiveAvatar med 88 % mot 12 %, samt att man föredras inom samtliga utvärderade dimensioner. Sedan gör inlägget något som de flesta leverantörsutvärderingar inte gör: det avslöjar att jämförelsen av manér mot Runway Characters inte var statistiskt åtskiljbar från paritet. Ett oavgjort resultat i en storseger är en liten sak, men det är detaljen som visar att storsegern rapporteras ärligt snarare än selektivt utvald.

Testets begränsningar spelar större roll än det oavgjorda resultatet. Två till tre minuter är ett kort samtal. Bedömarna var Metas. Och inlägget självt varnar för att dess demonstrationer "illustrerar modellens förmåga och återspeglar inte samtliga avatarer som finns i Muse-appen" — vilket är ett forskarteam som klart och tydligt säger att videon du tittade på inte nödvändigtvis är produkten du kommer att få.

Vad du inte kan göra med det

Det finns inget API för Muse Realtime Avatar. Det finns inget pris, ingen prislista, ingen väntelista och inget publicerat datum. Meta har inte sagt när användare eller utvecklare kommer att kunna använda den. Muse-appen för 18 år och äldre är den enda plattformen den är på väg till, och avataren lanseras tillsammans med en rad andra Muse-funktioner – röstanpassning, en Muse-e-postadress, styrning av Mac-datorer, glasögonintegrering – som har sina egna tidslinjer, varav några anges som "kommande månader".

Jämförelsen som spelar roll här är inte mot Runway eller HeyGen. Det är mot resten av Muse-stacken. Muse Spark, den resonemangsmodell som agenten körs på, har varit tillgänglig för utvecklare sedan Meta öppnade den via Meta Model API, och Muse Spark 1.2 serveras via OrcaRouter som meta/muse-spark-1.2 till $1.25 per miljon indatatokens och $4.25 per miljon utdatatokens, leverantörens listpris utan påslag, i ett kontextfönster på en miljon tokens som redan accepterar text, bilder, video, ljud och filer. Det är den delen av Muse som du kan anropa i dag. Ansiktet är den delen du inte kan.

Den asymmetrin är värd att fundera över om du planerar något. En agent som resonerar under ett videosamtal och en agent som medverkar i ett är olika produkter med olika begränsningar, och bara en av dem finns på en prislista.

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

Vad du ska titta på härnäst

Tre saker skulle förvandla detta från ett tillkännagivande till ett beslut. Den första är ett lanseringsdatum för avataren i Muse, för allt Meta publicerade handlar om en modell, och inget av det de publicerade handlar om en produkt du kan använda en torsdag. Den andra är en latensmätning som gjorts under ett långt samtal i stället för vid första byten – 870 ms är ett startskott, och frågan ett verkligt samtal ställer är vad som händer vid minut tio. Den tredje är huruvida systemet håller sig i karaktär under adversariella förhållanden: en användare som medvetet byter samtalsämne, går snabbt fram eller matar det med en referensbild utformad för att likna en riktig person.

Fram till dess är den ärliga sammanfattningen den som forskningsinlägget antyder utan att säga. Muse Realtime Avatar är ett riktigt stycke ingenjörskonst med ett riktigt kompressionsresultat bakom sig, demonstrerat i en kontrollerad miljö, utvärderat av företaget som byggde det, i samtal som varade lika länge som en kaffebeställning. Det är inte vaporware. Det är inte heller något man kan köpa, routa eller benchmarka — och det är olika påståenden.

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.