Ett genererat hero-kort för artikeln 'Muse Realtime Avatar vs SeedRealtime', som visar två rundade kort på vardera sidan om rubriken. Det vänstra kortet visar 'Muse Realtime Avatar' ovanför en ikon för en utgående videobildruta och raderna 'genererar videon' och 'Meta, tillkännagavs 23 sep'; det högra kortet visar 'SeedRealtime' ovanför en ikon med skärm och öga och raderna 'tittar på videon' och 'ByteDance, släpptes 5 aug'. En underrubrik lyder 'Ingen av dem har någon prislista.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Muse Realtime Avatar vs SeedRealtime: Två modeller som du bara kan titta på

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ingen av dem har någon prislista. Muse Realtime Avatar, som Meta annonserade den 23 september 2026 på Meta Connect, har inget API, ingen slutpunkt, inget pris och inget datum – den är en funktion i Metas Muse-agent som demonstrerades i ett forskningsinlägg med titeln "Att väcka din Muse till liv." SeedRealtime, släppt av ByteDance Seed den 5 augusti 2026, har inget API, inga vikter, ingen teknisk rapport och inget parameterantal – den finns inuti ByteDances egen Doubao-app, och ByteDances inlägg säger bara att den har blivit "fullt utrullad." Två av världens största konsument-AI-företag lanserade audiovisuella realtidssystem inom sju veckor från varandra, och ingen av dem går att köpa. Det är jämförelsen, och den är mer intressant än den benchmarktabell som ingen kan bygga.

Det som skiljer dem åt är riktningen videon flödar i. SeedRealtime tittar och lyssnar och pratar om det den ser — ljud, video och text in i ett end-to-end-nätverk, med turntagning flyttad från en extern röstaktivitetsdetektor in i modellen själv. Muse Realtime Avatar genererar: du ger den en referensbild, ett fotografi eller en illustration eller ett objekt, och den renderar den saken talande och gestikulerande i kontinuerlig video under samtalets längd. SeedRealtimes video är input. Muse Realtime Avatars video är output. Båda beskrivs som full-duplex, båda är audiovisuella, och de utför motsatta uppgifter med etiketten.

Vad var och en är, och var den bor

Sex rader, och de två sista är de som avgör något.

Video — Muse Realtime Avatar genererar den, i porträttupplösningen 448×768 och 25 bildrutor per sekund, vattenmärkt med ett transparent överlägg så att en tittare kan avgöra att det inte är ett kameraflöde; SeedRealtime uppfattar den, strömmar bildrutor in i samma nätverk som hanterar ljudet.

Den arkitektoniska satsningen — Muse Realtime Avatar delar en enda tokenström mellan röst och video, så en ljuddriven Diffusion Transformer konsumerar taltoken från Muse Realtime Voice direkt och inget läppsynkas i efterhand; SeedRealtime införlivar turtagning i modellen, så vem som talar och när slutar vara en extern röstaktivitetsdetektors beslut.

Var det körs — Muse Realtime Avatar är en funktion i Metas Muse-agent; SeedRealtime finns i ByteDances Doubao-app.

Utvecklaråtkomst — ingen av dem har ett API. Ingen av dem publicerar vikter. Det finns inget serverlöst alternativ, ingen hostad slutpunkt och ingen tredjepartsplattform som erbjuder någon av dem.

Pris — ej offentliggjort för någon av parterna, eftersom det inte finns något kommersiellt erbjudande från någon sida.

Oberoende utvärdering — ingen för något av systemen. Varje siffra som något av företagen har publicerat om sin egen modell är förstapartsdata, och ingen extern utvärderare har testat något av dem.

Två bevisbaser, båda förstaparts, och en av dem är mycket tunnare

Här upphör jämförelsen att vara symmetrisk. Meta publicerade fyra siffror för Muse Realtime Avatar, alla rapporterade av företaget, uppmätta mot baslinjer som Meta valde, inga återgivna utanför företaget: 870 ms från slutet av din tur till första byten i ett synkroniserat röst- och videosvar; 448×768 porträttvideo vid 25 bilder per sekund; 60× färre modellutvärderingar än dess egen baslinje; och 12 samtidiga realtidssessioner på en NVIDIA GB200, en 8× kapacitetsökning jämfört med Metas tvåstegs-BF16-baslinje genom fyrbitars kvantiseringsmedveten träning och latensmedveten dynamisk batchning. Meta publicerade också en preferensjämförelse mot två kommersiella avatarsystem – 78/22 mot ett, 88/12 mot det andra – och avslöjade att resultatet vad gäller manér mot ett av dem inte är statistiskt skiljbart från likvärdighet. Det avslöjandet är värt mer än segrarna; det är den typ av resultat som de flesta lanseringsinlägg utelämnar.

SeedRealtimes publicerade bevis är en end-to-end-utvärdering med människor. ByteDance säger att SeedRealtime, jämfört med kaskadkopplade system – en visionsmodell kopplad till en ASR-modell kopplad till en LLM kopplad till en text-till-tal-röst – halverar problemen med audiovisuell samtalsrytm, med färre avbrott, färre falska utlösningar och långsammare, mer naturliga svar. Det ByteDance inte har publicerat är en urvalsstorlek, en metodik, ett antal annotatörer, en latenssiffra i millisekunder, ett benchmarknamn eller en poäng. En sekundär rapport citerar en förbättring på 12 % i samtalsflyt jämfört med teamets tidigare modeller. Det är hela den offentliga bevisbasen.

Så den ärliga rangordningen av verifierbarhet ser ut så här: ingen av dem har en oberoende körning; Metas är en uppsättning mätningar med angivna baslinjer och ett redovisat negativt resultat; ByteDances är ett enda preferenspåstående vars design inte beskrivs. Ingen av dem är reproducerbar, men bara en av dem är tillräckligt specifik för att argumentera mot.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

Draget var och en gjorde

Båda systemen är svar på samma problem, och det är värt att se att de två svaren är olika.

För ett system som iakttar är det svåra att veta när det ska tala. En modell som kontinuerligt tar emot kamerabilder och ljud måste avgöra, utan en extern utlösare, huruvida personen framför den har talat färdigt, huruvida den har blivit tilltalad och huruvida objektet som just kom in i bilden är relevant. Det är problemet som SeedRealtime flyttade in i modellen, och ByteDance gjorde flytten över tre modaliteter i stället för två – en svårare version av vad Google, OpenAI och NVIDIA var och en gjorde för enbart ljud. Demobeteendena följer av det: att binda en röst till ett ansikte i ett gruppsamtal, att tala spontant när något kommer in i bilden, att vägleda någon genom ett museum eller en reparation.

För ett system som renderar är det svåra att förbli koherent. Att generera video i korta kausala segment innebär att varje segment betingas av det föregående, och felmoden är drift – vid minut tre har karaktären tyst blivit någon annan. Metas rullande fönster av de senaste videolatenterna är svaret på det, och den delade tokenströmmen är svaret på ett annat fel: det dubbade utseende man får när ljudet genereras först och en läppsynkmodell körs över det efteråt.

Inget av dragen är tillgängligt i det andra systemet. SeedRealtime har ingen referensbild att vara trogen, eftersom den inte renderar någon. Muse Realtime Avatar har ingen extern värld att spåra, eftersom dess enda uppgift är att producera ett ansikte som matchar en röst.

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

Varför en modell som inte går att anropa fortfarande är en routingfråga

Båda dessa system delegerar. Muse Realtime Avatar bygger på Muse Realtime Voice, som är det konversationella lagret i en agent vars resonemang körs på Muse Spark — modellen gör renderingen, inte tänkandet. SeedRealtimes design håller konversationen igång medan bakgrundsarbete pågår, vilket innebär att det arbete som överskrider vad den kan göra inline hamnar någon annanstans och kommer tillbaka. I båda arkitekturerna är det som användaren interagerar med en front end, och intelligensen är en separat textmodell bakom den.

Den separata textmodellen är vanlig inferens, och det är den delen av stacken som du faktiskt kan köpa. På OrcaRouter är den en enda slutpunkt som täcker 196 modeller från 15 leverantörer, till leverantörens listpris vidarefakturerat utan något påslag, med automatisk failover när modellen du valde ger fel eller får timeout. Vi driftar inte SeedRealtime – den är ByteDances, inuti Doubao, och det finns inget att routa. Vi driftar inte heller Muse Realtime Avatar, och det gör ingen annan. Det vi tillhandahåller är det lager som båda systemen lämnar över sitt tunga arbete till, och det är lagret som ändras när du vill att en annan modell ska sköta tänkandet.

Vad skulle ändra svaret

För SeedRealtime är den saknade pusselbiten inte en funktion – det är beviset. En teknisk rapport med ett parameterantal, en benchmark-svit och en beskriven mänsklig utvärdering skulle flytta den från "en demonstration inuti en app" till något ett team skulle kunna resonera kring. ByteDances inlägg länkar också till generiska "Try Dola"- och "Try in Playground"-destinationer utan att göra anspråk på vikter eller ett dokumenterat API, vilket är mönstret för en produktfunktion snarare än en modellrelease.

För Muse Realtime Avatar är den saknade pusselbiten kommersiell: en prislista, en slutpunkt, ett datum och de villkor för region och ålder som Meta inte har specificerat fullt ut. I Metas inlägg konstateras att inte alla dess demos återspeglar de avatarer som finns tillgängliga i Muse-appen, och det är den mening som bör styra varje plan som byggs kring detta.

Tills ett av dessa ändras har jämförelsen en ovanligt kort form. Båda modellerna är audiovisuella, båda är full-duplex, båda är genuint imponerande ingenjörskonst, och ingen av dem kan anropas från en terminal av någon som läser detta. Skillnaden är vad du skulle göra med dem om du kunde: den ena ger dig en karaktär som pratar, och den andra ger dig ett system som noterar.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.