Ett genererat hjältekort för artikeln 'Muse Realtime Avatar vs Realtime-Venus', som visar två rundade kort på var sin sida om rubriken. Det vänstra kortet visar 'Muse Realtime Avatar' ovanför en ikon för utgående videoram och raderna 'genererar videon' och '448x768 vid 25 fps, stängd'; det högra kortet visar 'Realtime-Venus' ovanför en inkommande kameraikon och raderna 'läser videon' och '2 x 9B, Apache-2.0, nedladdningsbar'. En underrubrik lyder 'Den ena renderar ett ansikte. Den andra tittar på ett.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Muse Realtime Avatar vs Realtime-Venus: Video Out mot Video In

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två system som tillkännagavs med nio dagars mellanrum kallar båda sig för realtid och båda gör anspråk på den audiovisuella etiketten, och de pekar i motsatta riktningar längs samma axel. Muse Realtime Avatar, som tillkännagavs av Meta den 23 september 2026, tar ett fotografi och genererar en video där det talar – dess video är utdata, porträttbildrutor på 448×768 vid 25 per sekund, producerade av en ljuddriven Diffusion Transformer som delar en tokenström med Muse Realtime Voice. Realtime-Venus, uppladdat till arXiv den 12 september 2026 av Venus Team vid Ant Group tillsammans med Tsinghua University, tar in video: checkpointen Realtime-Venus-Omni strömmar kamerabildrutor genom en SigLIP2-kodare och talar om vad den ser, medan checkpointen Realtime-Venus-Audio är samma stomnät med synen avstängd vid laddningstillfället. Den ena renderar ett ansikte. Den andra tittar på ett. Ingen av dem kan anropas, och bara en av dem är nedladdningsbar – vilket visar sig vara den mer betydelsefulla skillnaden.

Tillgänglighetsinversionen är värd att sägas rakt ut innan något annat, eftersom den går emot alla förväntningar på en Meta-produkt och en lansering från ett forskningslabb. Metas system är slutet: annonserat på Connect, demonstrerat i ett forskningsinlägg, inbäddat i Muse-agenten, utan API, utan vikter, utan pris och utan datum. Ant Groups system är öppet: två 9B-checkpoints som BF16-safetensors under Apache-2.0 på inclusionAI/Realtime-Venus på Hugging Face, med anpassad Transformers-kod, en requirements-fil, en referensröst, en projektsida och ett medföljande GitHub-repositorium. Företaget med konsumentprodukten släppte inget du kan hålla i. Forskningsteamet släppte allt.

Vad var och en gör med en ram

Videons riktning utgör hela den arkitektoniska skillnaden, och det handlar inte om betoning.

Video — Muse Realtime Avatar genererar den, betingad på taltokens, en referensbild och ett rullande fönster av senaste videolatenter; Realtime-Venus-Omni uppfattar den, med en visuell encoder av typen SigLIP2 som strömmar bildrutor in i modellen tillsammans med ljudet.

Ljud — Muse Realtime Avatar driver generering från Muse Realtime Voice:s taltokens, som bär innehåll och prosodi tillsammans; Realtime-Venus genererar tal som diskreta S3-tokens vilka avkodas av en strömmande flow-matching-avkodare, i stället för att hänga på en separat text-till-tal-modell i slutet.

Stomme – Metas arkitektur är en ljuddriven Diffusion Transformer med icke angiven storlek; Realtime-Venus är byggd på en Qwen3-8B-språkstomme med en Whisper-Medium-ljudkodare, och dess modellkort anger att Omni-checkpointen är anpassad från MiniCPM-o 4.5.

Vikter — Muse Realtime Avatars vikter är inte publicerade och det finns inget som tyder på att de kommer att bli det; Realtime-Venus levereras med två 9B-checkpoints, BF16, 40 960 tokens kontext på båda, under Apache-2.0.

Åtkomst — Muse Realtime Avatar har inget API och inget datum; Realtime-Venus har inte heller något API, och dess kort anger klart att det inte är driftsatt av någon inferensleverantör.

Var den körs — Muse Realtime Avatar körs i Muse-appen för användare som Meta inte har listat, på 18+-villkor; Realtime-Venus körs på dina egna GPU:er, redan idag, om du har hårdvaran och aptiten.

Läs de två sista raderna tillsammans, och den praktiska skillnaden framträder. Inget av systemen kan anropas. Ett av dem kan köras.

9B-nedladdningen är verklig, och det är också vad den kostar dig

Realtime-Venus är inte en förvarsstubbe. Vikterna finns där, den anpassade laddningskoden finns där, och licensen på toppnivå är Apache-2.0. Två saker med det är värda att känna till innan du planerar utifrån det.

Det första är vad som inte finns i vikterna. Runtimen med dubbla loopar som gör arkitekturen särpräglad – den ensekundiga interaktionsloopen plus en bakgrundsschemaläggare som artikeln kallar Realtime-Venus-Harness, vilken utför delegerade uppgifter mot en isolerad ögonblicksbild av konversationstillståndet så att ett långvarigt jobb inte kan korrumperas av att konversationen fortsätter – finns i GitHub-repositoriet som en separat komponent. Delegeringsdesignen, som är den verkligt nya idén i rapporten, är den del du själv sätter samman och litar på.

Den andra är härstamningen. Modellkortet anger att Omni-checkpointen har anpassats från MiniCPM-o 4.5, den 9B stora omnimodala modellen som OpenBMB släppte som öppen källkod tidigare under 2026. Det är inte en fotnot. Det innebär att Ant Groups bidrag är efterträningen, runtime-miljön och delegationsdesignen som lagts ovanpå någon annans strömmande stomme, vilket är ett snävare och mer specifikt påstående än "en ny 9B omnimodell" – och ett mer användbart sådant, eftersom det säger var man ska titta om något i den visuella encodern beter sig illa.

Siffrorna, och exakt vems de är

Det är här de två systemen möts på ett föga hjälpsamt sätt: ingendera har en enda oberoende utvärdering. Metas fyra siffror är rapporterade av företaget mot baslinjer som Meta valt. Realtime-Venus siffror är rapporterade av författarna i en teknisk rapport, utan att någon tredje part har publicerat en körning och utan någon post på en resultattavla att kontrollera mot. Det finns ingen offentlig mätning av något av systemen, gjord av någon som inte har byggt det.

Metas fyra, så som de publicerats: 870 ms från slutet av din tur till det första bytet i ett synkroniserat röst- och videosvar; 448×768 porträttvideo vid 25 bilder per sekund; 60× färre modellutvärderingar än dess egen baslinje; och 12 samtidiga realtidssessioner på en NVIDIA GB200, en 8× kapacitetsvinst jämfört med Metas tvåstegs-BF16-baslinje. Meta redovisar också preferensresultat gentemot två kommersiella avatarsystem, varav ett rapporteras inte vara statistiskt skiljbart från paritet i fråga om manér — ett avslöjande som förtjänar erkännande, eftersom det är den typ av resultat som de flesta lanseringsinlägg utelämnar.

Ant Groups, enligt publicerade uppgifter: bästa poäng på sex av de åtta videobenchmarks som rapporten använder, inklusive StreamingBench 70.2, OVO-Bench 64.7 och Daily-Omni 81.3 för Omni-checkpointen; och för Audio-checkpointen, MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8 och en VoiceBench AlpacaEval-poäng på 4.81 som rapporten beskriver som likvärdig med den bästa jämförelsesiffran.

En asymmetri i bevisningen är värd att nämna. Ant Groups siffror är benchmarkpoäng med namngivna testset – i princip reproducerbara av vem som helst som är beredd att ladda ner vikterna och köra sviten. Metas huvudnummer är en latensmätning i Metas egen serveringsstack, som ingen utanför Meta kan reproducera eftersom ingen utanför Meta har systemet. Den öppna releasen är med andra ord också den mer kontrollerbara.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

Varför båda dessa är ett förklätt routingproblem

Inget av systemen är en komplett agent, och det gäller på samma sätt för båda. Muse Realtime Avatar är ett renderingslager som är påskruvat på Muse Realtime Voice, som är samtalslagret i en agent vars resonemang körs på Muse Spark. Realtime-Venus delegerar allt som överstiger vad den kan göra inline – hämtning, verktygsanrop, svåra resonemang – ut till en harness som utför arbetet i bakgrunden mot en ögonblicksbild av konversationen. I båda designerna är det som användaren talar med ett front-end, och tänkandet sker i en separat textmodell.

Den separata textmodellen är den del du kan routa. På OrcaRouter är det en slutpunkt för 196 modeller från 15 leverantörer, till leverantörens listpris som förs vidare utan påslag, med automatisk redundansväxling när en modell returnerar fel eller får timeout — vilket spelar större roll än vanligt när det som finns på andra sidan är en självhostad checkpoint som ingen oberoende part har utvärderat. Vi hostar inte Realtime-Venus: det är en nedladdning, och vi serverar den inte. Vi hostar inte Muse Realtime Avatar heller, för det gör ingen. Det vi erbjuder är lagret som båda arkitekturerna lämnar över sitt tunga arbete till, så en obeprövad komponent på endera sidan av samtalet är en rad konfiguration i stället för en produktionssatsning.

Vilken av dessa är egentligen längre fram?

Instinkten är att säga Metas, eftersom Meta har produkten och demovideon. Bevisen säger något mer intressant. Metas system har bättre produktionsengineering – 12 samtidiga sessioner på en GB200 är ett serving-resultat, och de offentliggjorda preferenstesterna mot redan lanserade avatarprodukter är de enda head-to-head-siffrorna som något av systemen har. Ant Group-systemet har bättre verifierbarhet: namngivna benchmarks, publicerade vikter, en Apache-2.0-licens och en rapport som vem som helst kan försöka reproducera.

Det som ingen av dem har är ett sätt att betala för det. Och den som är närmare att vara användbar är inte den med konsumentappen – det är den du kan ladda ner i kväll och ta reda på själv, på din egen hårdvara, med dina egna data, och utan att något tillkännagivande krävs.

Om du väljer är frågan inte vilken modell som är bättre. Det är huruvida du vill ha ett ansikte du inte kan kalla på eller en kamera du kan köra.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.