
Muse Realtime Avatar: Meta geeft zijn Muse-agent een gezicht, met 870 milliseconden per beurt
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 180 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Het getal waarmee Meta besloot te openen, is 870 milliseconden. Dat is hoe lang Muse Realtime Avatar erover doet, volgens de eigen meting van Meta, vanaf het moment dat je stopt met praten tot het moment dat de eerste byte van een gesynchroniseerd antwoord in spraak en video aankomt. Het is een ronduit agressief cijfer voor een systeem dat video moet genereren, en het is de moeite waard om het precies te lezen — want bijna alles wat interessant is aan het nieuwe embodimentmodel van Meta zit in de kloof tussen wat dat getal meet en wat mensen zullen aannemen dat het meet.
Muse Realtime Avatar werd op 23 september 2026 aangekondigd op Meta Connect en dezelfde dag beschreven door Meta Superintelligence Labs in een onderzoeksbericht met de titel "Bringing Your Muse to Life." Het breidt Muse Realtime Voice uit, de gesprekslaag binnen Meta's Muse-agent, door er een lichaam aan te geven. Het is geen chatbot met een standaardavatar: je geeft het een referentieafbeelding — een foto, een illustratie van een heel lichaam, een dier, een huishoudelijk voorwerp — en het laat dat ding praten, gebaren maken en van houding veranderen in doorlopende video gedurende het hele gesprek. Zuckerberg zei op het podium dat de avatar die aan zijn eigen Muse is gekoppeld Jolly heet.
Een gedeelde tokenstroom, geen lipsynchronisatieronde
De architectuur is het deel dat het begrijpen waard is, want ze verklaart waarom Meta blijft spreken van "embodiment" in plaats van "avatar". Muse Realtime Voice produceert een stroom spraaktokens — het bericht noemt ze VQs — die zowel de inhoud van wat er gezegd wordt als de prosodie ervan overdragen: het tempo, de nadruk, het stijgen en dalen. Muse Realtime Avatar verbruikt diezelfde stroom. Het is een door audio aangedreven Diffusion Transformer die geconditioneerd is op die spraaktokens, op de referentiemedia die je hebt aangeleverd, en op een rollend venster van recente videolatenten, en die video genereert in korte causale chunks, waarbij elke nieuwe latent wordt doorgegeven als bewegingscontext voor de volgende.
Het delen van één tokenstroom is wat stem, lipbeweging en expressie aan elkaar gekoppeld houdt. Het alternatief — de audio genereren en er vervolgens een apart lipsynchronisatiemodel overheen laten lopen — is hoe het grootste deel van de avatarindustrie werkt, en dat is waarom zoveel van die avatars eruitzien alsof ze worden nagesynchroniseerd. Het ontwerp van Meta verwijdert die naad door constructie. Het rollende latente venster is de tweede helft van het idee: zonder dat drijft een op chunks gebaseerde generator af, en tegen minuut drie is je personage stilletjes iemand anders geworden.

Vier gepubliceerde cijfers, en wat elk ervan daadwerkelijk meet
Meta publiceerde meer cijfers dan gebruikelijk is voor een onderzoeksbericht bij een consumentenfunctie. Alle vier hieronder zijn door het bedrijf gerapporteerd, gemeten door Meta aan de hand van door Meta gekozen baselines; geen ervan is buiten het bedrijf gereproduceerd.
• 870 ms vanaf het einde van de beurt tot de eerste byte. Dit is een cijfer voor de start van het antwoord. Het is niet de tijd tot een volledig antwoord, en het is niet de doorlopende leveringslatentie voor de rest van het gesprek. Een systeem kan 870 ms tot de eerste byte halen en op seconde twaalf nog steeds traag aanvoelen. De post van Meta is er expliciet over dat dit de maatstaf voor de eerste byte is; berichtgeving die de nuance weglaat, leest het als end-to-end responsiviteit, wat het niet is.
• 448×768 portretvideo met 25 frames per seconde. Dat is een hoog, telefoonvormig kader, geen liggend kader, en 25 fps is filmisch in plaats van vloeiend — de standaardframesnelheid voor film, onder de 30 of 60 fps die een native camera-feed je zou geven. Meta zegt dat demo's voorzien zijn van een watermerk met een transparante overlay, zodat een ontvanger kan zien dat hij niet naar een normale camera-feed kijkt.
• 60× minder model-evaluaties.Hieronder correct behandeld, want dit is het getal dat het vaakst verkeerd wordt gelezen.
• 12 gelijktijdige realtime-sessies op één NVIDIA GB200.Meta meldt dat zijn servingwerk — persistente KV-caches, cachebewuste routing, latentiebewuste dynamische batching, kwantisatiebewuste training met vier bits, gefuseerde kernels en CUDA Graph-capture, ontwikkeld met NVIDIA — de capaciteit 8× verhoogde ten opzichte van zijn eigen tweestaps-BF16-baseline. De rekensom erachter is helder: elke generatiestap produceert acht frames, wat 320 ms aan afspeeltijd is, in 20 ms modeltijd, ofwel 2,5 ms per frame. Zowel de 12 als de 8× zijn ten opzichte van Meta's gespecificeerde baseline, niet ten opzichte van de hardware van een andere leverancier.
Waarom 60× niet 60× sneller is
De bewering over compressie is degene die het vaakst zal worden herhaald en het minst zal worden begrepen. Meta's teachermodel was een diffusionmodel met 40 stappen en drievoudige classifier-free guidance — drie passes per stap, dus 120 model-evaluaties om één chunk video te produceren. De student is een causaal tweestapsmodel zonder guidance met een KV-cache van vaste lengte, getraind via distillatie en self-forcing, en het heeft twee evaluaties nodig voor dezelfde chunk. Dat is een 60× reductie in evaluaties per chunk bij, in Meta's woorden, kwaliteit die die van de teacher benadert.
Het is een rekenkrachtvermindering per chunk. Zestig keer minder evaluaties betekent niet dat een gebruiker een zestigste zo lang wacht, omdat latentie vóór distillatie al andere bijdragers had en die daarna nog steeds heeft. De grafiek in Meta's eigen post laat zien wat de vermindering in termen van kwaliteit opleverde: menselijke voorkeur steeg van 45% naar 55%. Dat is de eerlijke versie van het verhaal — het doel van de distillatie was om een systeem te maken dat überhaupt in realtime kon draaien, en de kwaliteitskosten werden beperkt tot ongeveer tien punten voorkeur in plaats van te worden geëlimineerd.
De evaluatie, inclusief de uitkomst die de andere kant op uitviel.
Meta testte tegen twee commerciële avatarsystemen, Runway Characters en HeyGen LiveAvatar, waarbij identieke avataridentiteiten werden gebruikt, zodat beoordelaars de animatie vergeleken in plaats van het personageontwerp. Beoordelaars voerden livegesprekken van twee tot drie minuten met elk systeem en vergeleken vervolgens de visuele kwaliteit, synchronisatie, consistentie van het personage en maniertjes.
Meta meldt dat het met 78% tegen 22% de voorkeur krijgt boven Runway Characters en met 88% tegen 12% boven HeyGen LiveAvatar, en dat het op elke geëvalueerde dimensie de voorkeur geniet. Daarna doet de post iets wat de meeste leveranciersevaluaties niet doen: hij onthult dat de vergelijking van maniërismen met Runway Characters statistisch niet te onderscheiden was van pariteit. Een gelijkspel binnen een reeks overwinningen is een kleinigheid, maar het is juist het detail dat je vertelt dat de reeks eerlijk wordt gerapporteerd in plaats van selectief samengesteld.
De beperkingen van de test wegen zwaarder dan het gelijkspel. Twee tot drie minuten is een kort gesprek. De beoordelaars waren van Meta. En de post zelf waarschuwt dat de demonstraties "de capaciteit van het model illustreren en niet allemaal de avatars weerspiegelen die beschikbaar zijn in de Muse-app" — wat een onderzoeksteam ronduit zegt, namelijk dat de video die je hebt bekeken niet noodzakelijkerwijs het product is dat je krijgt.
Wat je er niet mee kunt doen
Er is geen API voor Muse Realtime Avatar. Er is geen prijs, geen tariefkaart, geen wachtlijst en geen publicatiedatum. Meta heeft niet gezegd wanneer gebruikers of ontwikkelaars het kunnen gebruiken. De Muse-app voor 18 jaar en ouder is het enige platform waar het naartoe gaat, en de avatar arriveert samen met een reeks andere Muse-functies — stemaanpassing, een Muse-e-mailadres, Mac-computerbesturing, integratie met brillen — die hun eigen tijdlijnen hebben, waarvan sommige worden genoemd als "komende maanden".
De vergelijking die hier van belang is, is niet met Runway of HeyGen. Het is met de rest van de Muse-stack. Muse Spark, het redeneermodel waarop de agent draait, is sinds Meta het via de Meta Model API heeft opengesteld beschikbaar voor ontwikkelaars, en Muse Spark 1.2 wordt via OrcaRouter aangeboden als meta/muse-spark-1.2 voor $1,25 per miljoen inputtokens en $4,25 per miljoen outputtokens, de lijstprijs van de provider zonder opslag, binnen een contextvenster van één miljoen tokens dat al tekst, afbeeldingen, video, audio en bestanden accepteert. Dat is het deel van Muse dat je vandaag kunt aanroepen. Het gezicht is het deel dat je niet kunt aanroepen.
Die asymmetrie is het waard om bij stil te staan als je iets van plan bent. Een agent die redeneert tijdens een videogesprek en een agent die erin verschijnt, zijn verschillende producten met verschillende beperkingen, en slechts één van hen staat op een tariefkaart.

Wat nu te kijken
Drie dingen zouden dit veranderen van een aankondiging in een beslissing. Het eerste is een releasedatum voor de avatar in Muse, want alles wat Meta heeft gepubliceerd gaat over een model, en niets wat het heeft gepubliceerd gaat over een product dat je op een donderdag kunt gebruiken. Het tweede is een latentiemeting over een lang gesprek in plaats van bij de eerste byte — 870 ms is een startschot, en de vraag die een echt gesprek stelt, is wat er bij minuut tien gebeurt. Het derde is of het systeem in karakter blijft onder adversariële omstandigheden: een gebruiker die opzettelijk van onderwerp verandert, snel te werk gaat, of het een referentieafbeelding voert die is ontworpen om op een echt persoon te lijken.
Tot die tijd is de eerlijke samenvatting de samenvatting die de onderzoekspost suggereert zonder het te zeggen. Muse Realtime Avatar is een echt staaltje engineering met een echt compressieresultaat erachter, gedemonstreerd in een gecontroleerde setting, geëvalueerd door het bedrijf dat het heeft gebouwd, in gesprekken die even lang duurden als een koffiebestelling. Het is geen vaporware. Het is ook niet iets dat je kunt kopen, routeren of benchmarken — en dat zijn verschillende claims.

