
Muse Realtime Avatar: wat Meta heeft gebouwd, waarop het draait, en waarom je het nog steeds niet kunt bellen
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 1009 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 195 tok/s
- OrcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Muse Realtime Avatar is Meta's embodimenttechnologie. Het neemt de spraakstroom die Muse Realtime Voice produceert en zet die om in de bijbehorende performance: richt het op een fotografisch portret en het gezicht antwoordt met kleine veranderingen in gezichtsuitdrukking, richt het op een illustratie van een heel lichaam en de figuur maakt gebaren en verandert van houding terwijl die spreekt. Meta AI Research introduceerde het op 23 september 2026 in een bericht met de titel "Je Muse tot leven brengen". Het is een onderzoeksresultaat, geen product — Meta's eigen pagina biedt geen API, geen prijs, geen wachtlijst en geen publicatiedatum — dus het eerlijke antwoord op "kan ik het vandaag gebruiken" is nee. Het Muse-model dat je vandaag kunt aanroepen is een ander model, Meta Muse Spark 1.2.
Dat antwoord kun je beter in de eerste alinea vermelden dan in de laatste, want een lezer die deze naam opzoekt, beslist meestal of hij eromheen moet plannen. Baseer je planning op het onderzoek, niet op een eindpunt.
Eén ding moet ronduit gezegd worden voordat iets anders aan bod komt, want deze pagina overtreedt een regel, en dat zou ze moeten toegeven. Deze blog schrijft normaal gesproken over modellen in de week dat ze worden gelanceerd. Muse Realtime Avatar werd een week voordat deze pagina online ging aangekondigd, dus bij een strikte lezing van het actualiteitsvenster zou het item worden overgeslagen. Dit is geen nieuwsartikel over een gedateerde gebeurtenis. Het is de referentiepagina voor een model dat vandaag live is in het catalogusgesprek: de pagina die een lezer bereikt na het typen van de naam van het model zelf, en waarvan de rechtvaardiging een blijvende zoekvraag is die we zelf hebben gemeten, in plaats van de versheid van een lancering. De aankondiging van september wordt hier genoemd als een feit dat het model in de tijd plaatst, niet als een gebeurtenis om te verslaan, en niets hieronder is een tweede aankondiging. Onze berichtgeving over die dag is een apart stuk en dat blijft apart.
Waar het staat binnen de Muse-familie
Meta is expliciet dat dit twee lagen van één systeem zijn, niet twee producten. In Meta's bewoordingen: "Muse Realtime Voice en Muse Realtime Avatar vormen één enkel streamingsysteem dat intelligentie, stem en belichaming met elkaar verbindt." De stemlaag levert de conversationele intelligentie en zendt een stroom spraaktokens uit — Meta noemt ze VQs — die zowel bevatten wat er wordt gezegd als hoe het wordt gebracht. Een audiodecoder zet die tokens om in geluid, en de avatarlaag gebruikt dezelfde stroom om het beeld te genereren. Het delen van één tokenstroom zorgt ervoor dat stem, lipbeweging en expressie synchroon blijven; er is geen aparte lipsynchronisatiestap die er achteraf nog aan wordt toegevoegd.
Dus: Muse Realtime Voice is de conversationele laag. Muse Realtime Avatar is de belichamingslaag die daar bovenop is gebouwd. Geen van beide is het ding dat je kunt aanroepen.
Wees net zo voorzichtig met een naburige naam, want die loopt het meest kans om voor een van beide te worden aangezien. Muse Voice Transcribe is een endpoint voor transcriptie, en het is een werkelijk ander product. De documentatie voor ontwikkelaars van Meta is ondubbelzinnig: "Het is alleen spraak-naar-tekst; het synthetiseert geen spraak en biedt geen API voor spraak-naar-spraak-gesprekken." Het retourneert tijdstempels op beurtniveau en niet op woordniveau, en Meta vermeldt het op die pagina voor $0,18 per uur. Het is een echt endpoint met een prijs. Het is geen stem, en het is zeker geen avatar.
Het Muse-model dat daadwerkelijk aanroepbaar is, is Meta Muse Spark 1.2, het redeneermodel dat Meta uitbrengt met een context van een miljoen tokens en tekst-, beeld-, video-, bestands- en audio-invoer. Dat model is hier vandaag routeerbaar, tegen de listprijs van de provider zonder enige opslag, op dezelfde sleutel als al het andere in de catalogus, en de live kaart bevat de volledige specificatie. Muse Realtime Avatar hebben wij niet in ons aanbod. We hebben de live modellenlijst opnieuw gecontroleerd terwijl we dit schreven, en de enige Muse-vermeldingen erop zijn de twee Spark-checkpoints, 1.2 en zijn voorganger 1.1. Iets zachters dan dat zeggen — dat de familie "gedeeltelijk beschikbaar" is — zou impliceren dat we iets routeren wat we niet doen.

De technologie, in Meta's eigen bewoordingen
Meta's beschrijving van de architectuur is compact genoeg om te citeren in plaats van te parafraseren. Muse Realtime Avatar is "een audiodriven Diffusion Transformer die conditioneert op een spraaktokenstroom, referentiemedia en een rollend venster van recente videolatenten", en "genereert video in korte causale chunks". De tweede helft van die zin is het dragende deel: zodra elke chunk is voltooid, worden de nieuwste gegenereerde latenten de bewegingscontext voor de volgende. De reden die Meta noemt is continuïteit — het uiterlijk en de maniertjes van de avatar worden van beurt naar beurt doorgegeven terwijl de berekening begrensd blijft, waardoor de generatie net zo lang kan doorgaan als het gesprek duurt, in plaats van af te drijven of het budget te overschrijden.
Het herkomstmechanisme hoort in dezelfde alinea, omdat Meta het als onderdeel van het systeem presenteert en niet als een bijgedachte: gegenereerde video bevat een duurzaam, onzichtbaar watermerk dat via Meta Video Seal wordt aangebracht, waarvan Meta zegt dat het geen latentie toevoegt aan het realtimepad.
Meta heeft dit ding gemeten en er vier cijfers over gepubliceerd. Die cijfers — en de specifieke kanttekeningen die elk ervan nodig heeft, inclusief degene die klinkt als een versnelling en er geen is — horen bij het lanceringsartikel, dat ze met hun context intact weergeeft. We gaan de kale cijfers hier niet herhalen, want een kaal cijfer is precies wat de versie met kanttekeningen moet voorkomen.
We behandelden de aankondiging die dag in ons artikel over de lancering van Muse Realtime Avatar, en dat blijft de plek om de genuanceerde claims volledig te lezen.
Wat de naam niet is
Het is de moeite waard om drie valse buren één voor één uit te sluiten, omdat elk van hen op basis van alleen de naam een redelijke gok is.
• Het is niet Muse Voice Transcribe. Dat endpoint zet spraak om in tekst en doet, volgens Meta's eigen beschrijving, niets in de andere richting. Als je een transcript nodig hebt, verkoopt Meta er een, en het is iets anders met een andere prijs.
• Het is geen dienst voor het klonen van stemmen. Niets op de pagina's van Meta beschrijft het synthetiseren van de stem van een specifiek persoon, het verkopen van een stemmodel of het accepteren van een stemvoorbeeld van een gebruiker. De stemlaag wordt beschreven als het produceren van een tokenstroom; de avatarlaag wordt beschreven als het consumeren daarvan. De productvorm die die uitdrukking gewoonlijk impliceert — een voorbeeld uploaden, een kloon krijgen — is niet wat hier wordt beschreven, en het demomateriaal dat Meta wel publiceert, wordt gepresenteerd als illustratie van de mogelijkheden van het model.
• Het is geen consumentenavatar in Meta's eigen app. Meta voegt bij zijn voorbeelden een voorbehoud toe dat makkelijk te missen is en de moeite waard is om te onthouden: de demonstraties "illustreren de mogelijkheden van het model en weerspiegelen niet allemaal de avatars die beschikbaar zijn in de Muse-app", en Muse is bedoeld voor gebruikers van 18 jaar en ouder. Neem dat letterlijk. Een deel van wat de post toont, is capaciteit, niet het aanbod.
Een vierde naam is om een andere reden het waard om apart te houden. Muse Realtime Avatar is niet Muse Video, het videogeneratiemodel dat het grootste deel van dit jaar in een openbare leaderboard heeft gestaan zonder te worden uitgebracht. Onze eigen pagina over die situatie — Muse Video: Releasedatum, API-toegang en wat Meta Connect zou kunnen veranderen — bevat een beperking die we hier woordelijk zullen herhalen in plaats van die te verbeteren: elke pagina die een specifieke lanceringsdag of een prijs voor Muse Video noemt zonder een nieuwere aankondiging van Meta, doet aan speculatie. Dezelfde discipline geldt voor het onderwerp van deze pagina, dus deze pagina noemt geen van beide. Dat stuk levert ook de datum die wij niet horen te verwarren: Muse Video wordt op 7 juli 2026 gepreviewd en is niet uitgebracht, waardoor een zoekopdracht naar deze familie datums oplevert die bij een ander model horen.

Waar deze pagina voor dient, en wat deze pagina zou veranderen
De reden dat een referentiepagina hier de juiste vorm is, is meetbaar. In de 28 dagen tot 25 september 2026 kreeg de exacte term 164 vertoningen op onze zoekproperty en geen klikken, met als beste positie 9,3. Meer dan vijftig van onze pagina's noemen het fragment ergens, en bijna al dat verkeer komt terecht op één aankondigingsbericht. Een term met echte, aanhoudende vraag, die net buiten de eerste pagina staat en niemand converteert, is geen vraagprobleem of kwaliteitsprobleem — het is een paginaprobleem. Er was geen pagina met het model zelf als onderwerp. Dit is die pagina.
De positionering is ook de reden waarom niets hier als nieuws wordt opgetuigd. Een lezer die via een zoekopdracht op naam binnenkomt, wil drie dingen in deze volgorde: wat dit is, of het beschikbaar is, en waarop het is gebouwd. Die worden hierboven beantwoord, in die volgorde, zonder verzonnen datums en zonder een concurrent bij naam te noemen.

Wat de pagina zou veranderen, is één enkele aankondiging. Als Meta een endpoint, een prijs, een wachtlijst of een datum voor Muse Realtime Avatar publiceert, houdt de beschikbaarheidssectie op een "nee" te zijn en wordt die een specificatie, en deze pagina wordt herschreven in plaats van aangevuld. Als Meta Muse Video uitbrengt, verandert de alinea hierboven mee. Tot een van beide gebeurt, is de nuttige zet voor een ontwikkelaar de onglamoureuze: houd de interface die je al hebt gericht op het model dat je daadwerkelijk kunt bereiken. Elk model in de catalogus, inclusief Meta Muse Spark 1.2, zit achter één OpenAI-compatibel endpoint en één sleutel, wat betekent dat het uitproberen van het deel van deze familie dat bestaat je een wijziging van de model-string kost in plaats van een nieuw contract. Wanneer de embodiment-laag aanroepbaar wordt, zouden de overstapkosten ook een string moeten zijn.
