
Muse Realtime Avatar vs Realtime-Venus: video-uit tegen video-in
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 180 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Twee systemen, negen dagen na elkaar aangekondigd, noemen zichzelf beide realtime en claimen beide het audiovisuele label, en ze wijzen in tegengestelde richtingen langs dezelfde as. Muse Realtime Avatar, aangekondigd door Meta op 23 september 2026, neemt een foto en genereert een video waarin het spreekt — de video is de output, 448×768 portretframes met 25 per seconde, geproduceerd door een audio-gedreven Diffusion Transformer die een tokenstroom deelt met Muse Realtime Voice. Realtime-Venus, geüpload naar arXiv op 12 september 2026 door het Venus Team bij Ant Group met Tsinghua University, consumeert video: de Realtime-Venus-Omni-checkpoint streamt cameraframes via een SigLIP2-encoder en praat over wat het ziet, terwijl de Realtime-Venus-Audio-checkpoint dezelfde backbone is met visie uitgeschakeld bij het laden. De ene rendert een gezicht. De andere bekijkt er een. Geen van beide is aanroepbaar, en slechts één ervan is downloadbaar — wat het ingrijpendere verschil blijkt te zijn.
De omkering in beschikbaarheid moet ronduit worden benoemd, vóór al het andere, want ze druist in tegen elke verwachting over een Meta-product en een release van een onderzoekslab. Het systeem van Meta is gesloten: aangekondigd op Connect, gedemonstreerd in een onderzoeksbericht, ingebed in de Muse-agent, zonder API, zonder weights, zonder prijs en zonder datum. Het systeem van Ant Group is open: twee 9B-checkpoints als BF16-safetensors onder Apache-2.0 op inclusionAI/Realtime-Venus op Hugging Face, met aangepaste Transformers-code, een requirements-bestand, een referentiestem, een projectpagina en een bijbehorende GitHub-repository. Het bedrijf met het consumentenproduct leverde niets tastbaars. Het onderzoeksteam leverde het hele pakket.
Wat elk van hen met een frame doet
De richting van de video is het hele architectonische verschil, en het is geen kwestie van nadruk.
• Video — Muse Realtime Avatar genereert die, geconditioneerd op spraaktokens, een referentieafbeelding en een rollend venster van recente video-latenten; Realtime-Venus-Omni neemt die waar, waarbij een SigLIP2-visuele encoder frames naar het model streamt, samen met audio.
• Audio — Muse Realtime Avatar stuurt generatie aan op basis van de spraaktokens van Muse Realtime Voice, die inhoud en prosodie samen dragen; Realtime-Venus genereert spraak als discrete S3-tokens die worden gedecodeerd door een streaming flow-matching-decoder, in plaats van een apart tekst-naar-spraakmodel aan het einde toe te voegen.
• Backbone — De architectuur van Meta is een audiogestuurde Diffusion Transformer waarvan de omvang niet bekend is gemaakt; Realtime-Venus is gebouwd op een Qwen3-8B-taalbackbone met een Whisper-Medium-audio-encoder, en op de modelkaart staat dat het Omni-checkpoint is afgeleid van MiniCPM-o 4.5.
• Gewichten — Muse Realtime Avatar's zijn niet gepubliceerd en er is geen aanwijzing dat dit wel zal gebeuren; Realtime-Venus levert twee 9B-checkpoints, BF16, een context van 40.960 tokens op beide, onder Apache-2.0.
• Toegang — Muse Realtime Avatar heeft geen API en geen datum; Realtime-Venus heeft ook geen API, en op de kaart staat duidelijk dat het niet door enige inferentieprovider is ingezet.
• Waar het draait — Muse Realtime Avatar draait in de Muse-app voor gebruikers die Meta niet heeft geënumereerd, onder 18+-voorwaarden; Realtime-Venus draait vandaag nog op je eigen GPU's, als je de hardware en de zin hebt.
Lees de laatste twee regels samen en het praktische verschil wordt duidelijk. Geen van beide systemen kan worden aangeroepen. Een ervan kan worden uitgevoerd.
De 9B-download is echt, en wat het je kost ook.
Realtime-Venus is geen repositorystub. De gewichten staan er, de aangepaste laadcode staat er, en de licentie op het hoogste niveau is Apache-2.0. Twee dingen erover zijn het weten waard voordat je er rekening mee houdt in je planning.
Het eerste is wat niet in de gewichten zit. De dual-loop-runtime die de architectuur onderscheidend maakt — de interactielus van één seconde plus een achtergrondscheduler die het artikel Realtime-Venus-Harness noemt, die gedelegeerde taken uitvoert op een geïsoleerde snapshot van de gespreksstatus, zodat een langdurige taak niet kan worden beschadigd doordat het gesprek verdergaat — bevindt zich als een afzonderlijk component in de GitHub-repository. Het delegatieontwerp, het echt nieuwe idee in het rapport, is het onderdeel dat je zelf samenstelt en zelf moet vertrouwen.
Het tweede is de afstamming. De kaart vermeldt dat het Omni-checkpoint is afgeleid van MiniCPM-o 4.5, het 9B omnimodale model dat OpenBMB eerder in 2026 open source heeft gemaakt. Dat is geen voetnoot. Het betekent dat de bijdrage van Ant Group bestaat uit de post-training, de runtime en het delegatieontwerp die bovenop de streaming-backbone van iemand anders zijn aangebracht, wat een nauwere en specifiekere bewering is dan "een nieuw 9B omni-model" — en een nuttigere, omdat het je vertelt waar je moet kijken als er iets in de visuele encoder misgaat.
De nummers, en precies van wie ze zijn
Dit is waar de twee systemen op een onbehulpzame manier samenkomen: geen van beide heeft ook maar één onafhankelijke evaluatie. De vier cijfers van Meta zijn door het bedrijf zelf gerapporteerd tegen baselines die Meta zelf heeft gekozen. Die van Realtime-Venus zijn door de auteurs gerapporteerd in een technisch rapport, zonder dat een derde partij een run heeft gepubliceerd en zonder een leaderboardvermelding om tegen te controleren. Er is van geen van beide systemen een publieke meting door iemand die het niet heeft gebouwd.
Meta's vier, zoals gepubliceerd: 870 ms vanaf het einde van je beurt tot de eerste byte van een gesynchroniseerd antwoord in spraak en video; 448×768 portretvideo bij 25 frames per seconde; 60× minder modelevaluaties dan zijn eigen baseline; en 12 gelijktijdige real-time sessies op één NVIDIA GB200, een 8× capaciteitswinst ten opzichte van Meta's tweestaps-BF16-baseline. Meta maakt ook voorkeursresultaten bekend tegenover twee commerciële avatarsystemen, waarvan het meldt dat er één op het gebied van maniertjes niet statistisch te onderscheiden is van pariteit — een onthulling die erkenning verdient, aangezien het het soort resultaat is dat de meeste lanceringsberichten weglaten.
Van Ant Group, zoals gepubliceerd: de beste score op zes van de acht videobenchmarks die het rapport gebruikt, waaronder StreamingBench 70,2, OVO-Bench 64,7 en Daily-Omni 81,3 voor het Omni-checkpoint; en voor het Audio-checkpoint: MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8 en een VoiceBench AlpacaEval-score van 4,81 die het rapport omschrijft als gelijk aan de beste vergelijkingswaarde.
Eén asymmetrie in het bewijs is het benoemen waard. De cijfers van Ant Group zijn benchmarkscores met benoemde testsets — in principe reproduceerbaar door iedereen die bereid is de gewichten te downloaden en de suite te draaien. Het meest in het oog springende cijfer van Meta is een latentiemeting op Meta's eigen servingstack, die niemand buiten Meta kan reproduceren omdat niemand buiten Meta het systeem heeft. De open release is, met andere woorden, ook de beter controleerbare.


Waarom deze beide een verkapt routeringsprobleem zijn
Geen van beide systemen is een volledige agent, en dat geldt op dezelfde manier voor beide. Muse Realtime Avatar is een renderinglaag die op Muse Realtime Voice is vastgeschroefd, de gesprekslaag van een agent waarvan de redenering op Muse Spark draait. Realtime-Venus delegeert alles wat meer is dan het inline kan doen — retrieval, toolaanroepen, moeilijke redeneringen — naar een harness die het werk op de achtergrond uitvoert op basis van een snapshot van het gesprek. In beide ontwerpen is datgene waarmee de gebruiker praat een front-end, en het denkwerk gebeurt in een apart tekstmodel.
Dat aparte tekstmodel is het deel dat je kunt routeren. Op OrcaRouter is het één endpoint voor 196 modellen bij 15 providers, tegen de lijstprijs van de provider doorgegeven zonder enige markup, met automatische failover wanneer een model een fout geeft of een timeout krijgt — wat meer dan gewoonlijk van belang is wanneer het ding aan de andere kant een zelfgehost checkpoint is dat niemand onafhankelijk heeft geëvalueerd. Wij hosten Realtime-Venus niet: het is een download, en wij serveren het niet. Wij hosten Muse Realtime Avatar ook niet, want dat doet niemand. Wat wij aanbieden is de laag waaraan beide architecturen hun zware werk overdragen, zodat een onbewezen component aan weerszijden van het gesprek één regel configuratie is in plaats van een productiegok.
Welke van deze is eigenlijk verder gevorderd?
Het instinct zegt dat het die van Meta is, want Meta heeft het product en de demovideo. Het bewijs wijst op iets interessanters. Het systeem van Meta heeft betere productie-engineering — 12 gelijktijdige sessies op een GB200 is een servingresultaat, en de openbaar gemaakte preferentietests tegen commerciële avatarproducten zijn de enige head-to-headcijfers die een van beide systemen heeft. Het systeem van Ant Group heeft een betere verifieerbaarheid: benoemde benchmarks, gepubliceerde gewichten, een Apache-2.0-licentie en een rapport dat iedereen kan proberen te reproduceren.
Wat geen van beide heeft, is een manier om ervoor te betalen. En degene die het dichtst bij bruikbaar is, is niet degene met de consumenten-app — het is degene die je vanavond kunt downloaden en er zelf achter kunt komen, op je eigen hardware, met je eigen data, en zonder dat er een aankondiging nodig is.
Als je moet kiezen, is de vraag niet welk model beter is. De vraag is of je een gezicht wilt dat je niet kunt bellen of een camera die je kunt bedienen.

