
Muse Realtime Avatar vs SeedRealtime: Twee modellen die je alleen maar kunt bekijken
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 180 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Geen van beide heeft een tariefkaart. Muse Realtime Avatar, op 23 september 2026 aangekondigd door Meta tijdens Meta Connect, heeft geen API, geen endpoint, geen prijs en geen datum — het is een capaciteit van Meta's Muse-agent, gedemonstreerd in een onderzoeksbericht met de titel "Bringing Your Muse to Life." SeedRealtime, op 5 augustus 2026 uitgebracht door ByteDance Seed, heeft geen API, geen weights, geen technisch rapport en geen parameteraantal — het bestaat in ByteDance' eigen Doubao-app, en ByteDance' bericht zegt alleen dat het "volledig is uitgerold." Twee van de grootste consumenten-AI-bedrijven ter wereld brachten binnen zeven weken van elkaar audio-visuele realtime systemen uit, en geen van beide is te koop. Dat is de vergelijking, en het is een interessante dan de benchmarktabel die niemand kan bouwen.
Wat hen onderscheidt, is de richting waarin de video stroomt. SeedRealtime kijkt en luistert en praat over wat het ziet — audio, video en tekst in één end-to-end netwerk, waarbij beurtwisseling is verplaatst van een externe spraakactiviteitsdetector naar het model zelf. Muse Realtime Avatar genereert: je geeft het een referentieafbeelding, een foto of een illustratie of een object, en het rendert dat ding sprekend en gebarend in doorlopende video voor de duur van het gesprek. De video van SeedRealtime is invoer. De video van Muse Realtime Avatar is uitvoer. Beide worden beschreven als full-duplex, beide zijn audiovisueel, en ze doen onder dat label tegenovergestelde dingen.
Wat elk van hen is, en waar het zich bevindt.
Zes regels, en de laatste twee zijn de regels die wat dan ook beslissen.
• Video — Muse Realtime Avatar genereert die, met een portretresolutie van 448×768 en 25 frames per seconde, voorzien van een watermerk met een transparante overlay zodat een kijker kan zien dat het geen camerabeeld is; SeedRealtime neemt het waar en streamt frames naar hetzelfde netwerk dat de audio verwerkt.
• De architectonische gok — Muse Realtime Avatar deelt één tokenstroom tussen spraak en video, zodat een audiosignaal-aangedreven Diffusion Transformer de spraaktokens van Muse Realtime Voice rechtstreeks verbruikt en er achteraf niets wordt gelipsynchroniseerd; SeedRealtime bouwt de beurtwisseling in het model in, zodat wie spreekt en wanneer niet langer een beslissing is van een externe spraakactiviteitsdetector.
• Waar het draait — Muse Realtime Avatar is een functionaliteit binnen Meta's Muse-agent; SeedRealtime zit in de Doubao-app van ByteDance.
• Toegang voor ontwikkelaars — geen van beide heeft een API. Geen van beide publiceert gewichten. Er is geen serverloze optie, geen gehost endpoint, en geen platform van derden dat een van beide aanbiedt.
• Prijs — voor beide niet gepubliceerd, omdat er aan geen van beide zijden een commercieel aanbod is.
• Onafhankelijke evaluatie — geen enkele voor een van beide systemen. Elk cijfer dat een van beide bedrijven over zijn eigen model heeft gepubliceerd, is first-party, en geen enkele externe evaluator heeft een van beide getest.
Twee bewijsbases, beide first-party, en een ervan is veel dunner.
Hier is de vergelijking niet langer symmetrisch. Meta publiceerde vier cijfers voor Muse Realtime Avatar, allemaal door het bedrijf gerapporteerd, gemeten tegen door Meta gekozen baselines, geen enkele buiten het bedrijf gereproduceerd: 870 ms vanaf het einde van je beurt tot de eerste byte van een gesynchroniseerd spraak- en videoantwoord; 448×768 portretvideo bij 25 frames per seconde; 60× minder modelevaluaties dan zijn eigen baseline; en 12 gelijktijdige realtime-sessies op één NVIDIA GB200, een capaciteitswinst van 8× ten opzichte van Meta's tweestaps-BF16-baseline door vierbits-kwantisatiebewuste training en latentiebewuste dynamische batching. Meta publiceerde ook een voorkeursvergelijking met twee commerciële avatarsystemen — 78/22 tegen het ene, 88/12 tegen het andere — en maakte bekend dat het resultaat tegen een van hen op het gebied van maniërismen statistisch niet te onderscheiden is van pariteit. Die onthulling is meer waard dan de overwinningen; het is het soort resultaat dat de meeste lanceringsberichten weglaten.
Het gepubliceerde bewijs van SeedRealtime is één end-to-end menselijke evaluatie. ByteDance zegt dat SeedRealtime tegenover cascadesystemen — een visiemodel gekoppeld aan een ASR-model, gekoppeld aan een LLM, gekoppeld aan een tekst-naar-spraakstem — de audio-visuele gespreksritmeproblemen halveert, met minder onderbrekingen, minder valse triggers en langzamere, natuurlijkere antwoorden. Wat ByteDance niet heeft gepubliceerd, is een steekproefgrootte, een methodologie, een aantal annotatoren, een latentiecijfer in milliseconden, een benchmarknaam of een score. Eén secundair rapport citeert een winst van 12% in gespreksvlotheid ten opzichte van de eerdere modellen van het team. Dat is de volledige openbare bewijsbasis.
Dus de eerlijke rangschikking van verifieerbaarheid is als volgt: geen van beide heeft een onafhankelijke run; die van Meta is een reeks metingen met vermelde baselines en een openbaar gemaakte negatieve uitkomst; die van ByteDance is één enkele preferentieclaim waarvan het ontwerp niet wordt beschreven. Geen van beide is reproduceerbaar, maar slechts één ervan is specifiek genoeg om mee in discussie te gaan.

De zet die elk van hen deed
Beide systemen zijn antwoorden op hetzelfde probleem, en het is de moeite waard om te zien dat de twee antwoorden verschillend zijn.
Voor een systeem dat meekijkt, is het lastige deel weten wanneer het moet spreken. Een model dat continu camerabeelden en audio ontvangt, moet zonder externe trigger beslissen of de persoon voor zich is uitgesproken, of het wordt aangesproken, en of het object dat net in beeld is gekomen relevant is. Dat is het probleem dat SeedRealtime in het model zelf heeft ondergebracht, en ByteDance zette die stap over drie modaliteiten in plaats van twee — een moeilijkere versie van wat Google, OpenAI en NVIDIA elk alleen voor audio deden. De gedragingen in de demo's vloeien daaruit voort: een stem aan een gezicht koppelen in een groepsgesprek, zich ongevraagd laten horen wanneer er iets in beeld komt, iemand begeleiden door een museum of bij een reparatie.
Voor een systeem dat rendert, is het moeilijkste om coherent te blijven. Video genereren in korte causale stukken betekent dat elk stuk conditioneel is op het vorige, en de faalmodus is drift — tegen minuut drie is het personage stilletjes iemand anders geworden. Meta's rollende venster van recente video-latenten is het antwoord daarop, en de gedeelde tokenstroom is het antwoord op een andere tekortkoming: de nagesynchroniseerde look die je krijgt wanneer audio eerst wordt gegenereerd en er daarna een lipsynchronisatiemodel overheen wordt gehaald.
Geen van beide zetten is beschikbaar in het andere systeem. SeedRealtime heeft geen referentieafbeelding om trouw aan te blijven, omdat het niemand rendert. Muse Realtime Avatar heeft geen externe wereld om te volgen, omdat het zijn hele taak is een gezicht te produceren dat bij een stem past.

Waarom een niet-aanroepbaar model nog steeds een routeringskwestie is
Beide systemen delegeren. Muse Realtime Avatar ligt bovenop Muse Realtime Voice, de conversatielaag van een agent waarvan de redenering op Muse Spark draait — het model doet het renderen, niet het denken. Het ontwerp van SeedRealtime houdt het gesprek gaande terwijl achtergrondwerk plaatsvindt, wat betekent dat het werk dat meer is dan wat het inline kan doen ergens anders naartoe gaat en terugkomt. In beide architecturen is dat waarmee de gebruiker interactie heeft een front-end, en de intelligentie is een apart tekstmodel daarachter.
Dat aparte tekstmodel is gewone inferentie, en het is het deel van de stack dat je daadwerkelijk kunt kopen. Op OrcaRouter is het één endpoint dat 196 modellen van 15 providers dekt, tegen de lijstprijs van de provider, doorgegeven zonder enige markup, met automatische failover wanneer het model dat je hebt gekozen fouten geeft of een time-out krijgt. We hosten SeedRealtime niet — het is van ByteDance, binnen Doubao, en er valt niets te routeren. We hosten Muse Realtime Avatar ook niet, en dat doet niemand anders. Wat wij aanbieden is de laag waaraan beide systemen hun zware werk overdragen, de laag die verandert wanneer je een ander model het denkwerk wilt laten doen.
Wat zou het antwoord veranderen
Voor SeedRealtime is het ontbrekende element geen functie, maar het bewijs. Een technisch rapport met een aantal parameters, een benchmarksuite en een beschreven menselijke evaluatie zou het verplaatsen van "een demonstratie in een app" naar iets waar een team over kan redeneren. De post van ByteDance linkt ook naar generieke "Try Dola"- en "Try in Playground"-bestemmingen zonder gewichten of een gedocumenteerde API te claimen, wat het patroon is van een productfunctie in plaats van een modelrelease.
Voor Muse Realtime Avatar is het ontbrekende onderdeel commercieel: een tariefkaart, een endpoint, een datum, en de regio- en leeftijdsvoorwaarden die Meta niet volledig heeft gespecificeerd. In Meta's bericht staat dat niet alle demo's de avatars weergeven die beschikbaar zijn in de Muse-app; dat is de zin die bepalend moet zijn voor elk plan dat hierop is gebaseerd.
Totdat een van die dingen verandert, heeft de vergelijking een ongewoon korte vorm. Beide modellen zijn audiovisueel, beide zijn full-duplex, beide zijn echt indrukwekkende techniek, en geen van beide kan door wie dit leest vanuit een terminal worden aangeroepen. Het verschil is wat je ermee zou doen als je kon: de ene geeft je een personage dat praat, en de andere geeft je een systeem dat opmerkt.

