
Tavus Griffin vs Muse Realtime Avatar: Två ansikten från 2026, två olika problem
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 223 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Både Tavus Griffin och Muse Realtime Avatar finns för att lösa samma pinsamma problem – en språkmodell som kan prata men saknar ansikte – och de angriper det från motsatta håll. Griffin är en video-till-video Human Interaction Model som tittar på en deltagare genom en kamera och genererar den andra sidan av samtalet i realtid, och den tillkännagavs av Tavus i oktober 2026 som en forskningsförhandsversion för utvalda testare. Muse Realtime Avatar är Metas förkroppsligandelager för sin Muse-agent, tillkännagiven på Meta Connect den 23 september 2026, och den tar ljud och förvandlar det till ett synkroniserat talande porträtt. Ingen av dem går att köpa. Skillnaden ligger i vad var och en försöker få rätt, och den visar sig i samma stund som man frågar vad varje modell faktiskt tar emot som indata.
Den korta versionen
• Griffins indata är personen i andra änden — video och ljud från en deltagare i realtid, som den måste läsa av, svara på och bli avbruten av.
• Muse Realtime Avatars indata är agentens eget tal — en ström av tokens från Muse Realtime Voice som den omvandlar till ett matchande ansikte.
• Tavus mäter Griffin utifrån om folk tror på det, och publicerar en siffra på 48 % från ett videosamtal på en minut.
• Meta mäter Muse Realtime Avatar i hur väl den hänger med, och publicerar 870 millisekunder från turens slut till första byte.
• Ingen av dem har ett publikt API, ett publicerat pris eller ett datum för allmän tillgänglighet.
Läs de fyra raderna tillsammans och oenighetens form är uppenbar. Tavus optimerar för den andra personens tro. Meta optimerar för klockan.

Griffin: modellen som måste bli trodd
Tavus framställning är att Griffin är den första Human Interaction Model, och arkitekturen bakom påståendet är ett tvådelat system som kombinerar kontinuerlig konversationsmodellering med audiovisuell generering. Den första delen är beteendemässig: den avgör vad personan bör göra från ett ögonblick till nästa, utifrån vad den kan se och höra. Den andra delen är rendering, och Tavus delar upp den igen i strömmande talgenerering och strömmande videogenerering.
De siffror Tavus först presenterar är inte genomströmningssiffror. I en studie som företaget genomförde tillsammans med Queen Mary University of London trodde 26 av 54 deltagare – 48 % – att Griffin var en riktig person efter ett videosamtal på en minut, mot 1 av 41 (2,4 %) för dess tidigare stack av Phoenix-4.5 för ansiktsgenerering, Sparrow-2 för turtagning och Raven-1 vision. Deltagare som inte blev lurade tvivlade vanligtvis inom de första 20 sekunderna. I NVIDIA:s VideoFDB-benchmark, med poängsättning i september 2026, rapporterar Tavus att Griffin är etta inom AI för ansikte mot ansikte med en genereringspoäng på 3,83 mot den starkaste rapporterade baslinjen på 2,80 och en mänsklig referens på 3,92, samt en perceptionspoäng på 3,73 mot 3,44 för den bästa rapporterade baslinjen och en mänsklig referens på 4,20. Dessa siffror är rapporterade av leverantören och specifika för benchmarken, men det intressanta är jämförelsepunkterna mot människor.
Tekniken bakom dessa siffror är en codec som kallas Tavec och en autoregressiv diffusions-transformator. Tavec körs vid 48 kHz med 40 värden per bildruta vid 100 bildrutor per sekund, utan kodtabeller, en fullt kausal avkodare och paket så små som 10 millisekunder – utformad så att ett ansikte kan börja röra sig innan en mening har avslutats. Videovägen skickar 720p i segment om 320 millisekunder, där en latent motsvarar åtta bildrutor vid 25 fps, tre diffusionssteg per latent och en 8× tidsmässig komprimering i VAE. En trestegsdestillationsprocess (fördelningsmatchning, sedan teacher-forcing-autoregressiv, sedan self-forcing) är det som gör att den överhuvudtaget kan köra dessa tre steg i realtid. Det främsta latenspåståendet är i genomsnitt 0,43 sekunder från ljud till video på H100s, vilket Tavus säger är ungefär hälften av den näst snabbaste metoden man mätte. Röstkloning kräver ett sampel på ungefär 10 sekunder.
Priset för allt detta är att Tavus inte kan släppa det. Griffin-Lite, forskningsförhandsvisningen, är endast tillgänglig för en utvald grupp tidiga testare; i ett inlägg om lanseringen säger företaget rent ut att Griffin-Lite inte kommer att vara tillgängligt för kundanvändning för närvarande och att man förväntar sig att släppa Griffin mycket snart efter att vissa säkerhetsproblem har åtgärdats. Griffin finns inte på Tavus plattform och kommer att finnas där "när vi har kommit på hur vi kan släppa det på ett säkert sätt". En modell som är övertygande 48 % av tiden i ett enminuterssamtal är, ur ett driftsättningsperspektiv, en modell som är övertygande 48 % av tiden i ett enminuterssamtal.

Muse Realtime Avatar: modellen som måste hänga med
Muse Realtime Avatar tillkännagavs den 23 september 2026 på Meta Connect och beskrevs samma dag av Meta Superintelligence Labs under titeln ”Bringing Your Muse to Life”. Metas inramning är snävare och mer mekanisk än Tavus inramning: Muse-agenten hade redan en röst, tack vare Muse Realtime Voice, och avataren är lagret som ger den rösten en kropp.
Den publicerade siffran är 870 millisekunder från turslut till första byte – det vill säga från det att användaren slutar tala till det att avatarens första videobyte är redo. Avataren renderar en porträttbild i 448×768 vid 25 bilder per sekund. Meta säger att systemet utför ungefär 60× färre utvärderingar per chunk än sin baslinje, och att en enda NVIDIA GB200 kan hantera 12 samtidiga realtidssessioner med en kapacitetsvinst på 8× jämfört med en tvåstegs BF16-implementation.
Den arkitektoniska skillnaden gentemot Griffin är var informationen kommer ifrån. Muse Realtime Avatar utökar Muse Realtime Voice och delar dess tal-token-ström – samma VQ-representation som röstmodellen producerar är det som driver ansiktet, snarare än en separat visuell förståelse av en deltagare. Det gör den till ett ljuddrivet DiT-embodimentlager: effektivt, tätt kopplat till sin egen röstmodell och utan att ens försöka läsa av människan i andra änden av samtalet. Den är en mun och ett ansikte för en agent, inte en samtalspartner som betraktar dig.
Meta har inte publicerat något API, inget pris och inget releasedatum för Muse Realtime Avatar. Forskningsinlägget utgör hela den offentliga dokumentationen.
Där de två designerna verkligen går isär
Det tydligaste sättet att se uppdelningen är att fråga vad som händer när användaren avbryter.
Griffin är fullduplex och utformad för att avbrytas mitt i ett yttrande – den kan titta och lyssna medan den talar, vilket är anledningen till att Tavus marknadsföring bygger på idén att Griffin lär sig samtalsbeteende snarare än video. Det är också därför som dess benchmark-svit är uppbyggd kring perception och reaktion, och varför det 37-procentiga försprånget framför näst bästa system när det gäller att reagera i stunden är ett påstående som företaget gör sig besväret att framföra.
Muse Realtime Avatars siffra på 870 millisekunder för slutet av turen berättar den motsatta historien: det är en pipeline där turen tar slut, ljudtokenarna löses, och sedan hinner ansiktet ikapp. Det är snabbt – 870 ms är en bra siffra för en porträttrenderare – men mätningen i sig förutsätter att det finns en turgräns, vilket är precis den förutsättning som en duplexmodell är byggd för att kasta bort.
Det är inte en kritik av någon av designerna. Meta bygger ett ansikte för en agent som lever inuti Metas egna assistentytor, där en tydlig gräns mellan turerna är en rimlig modell för interaktionen. Tavus bygger något som måste klara av att en främling inom tjugo sekunder avgör om personen på skärmen är verklig.
Ingen av dem finns med på en prislista – och bara en del av Muse är anropbar.
Varken Tavus Griffin eller Muse Realtime Avatar kan sättas i produktion idag. Griffin är begränsad till utvalda testare; Muse Realtime Avatar har inget API, inget pris och inget datum. Om du planerar en build hör båda dessa fakta hemma i planen.
Det som är värt att lyfta fram är den del av Muse-stacken som är nåbar. Metas Muse-familj inkluderar Muse Spark, och en checkpoint av den – meta/muse-spark-1.2 – finns tillgänglig i vår katalog för 1,25 USD per miljon indatatoken och 4,25 USD per miljon utdatatoken med noll påslag på Metas listpris. Det är inte avataren: den tar text-, bild-, video-, ljud- och PDF-indata och returnerar text, med ett kontextfönster på 1M token och konfigurerbar resonemangsansträngning. Men det är den del av Muse-serien som du faktiskt kan anropa, och om du bygger agenten som en dag kommer att sitta bakom en avatar, är språkhalvan den halva du kan börja med. OrcaRouter för vidare leverantörers listpriser med 0 % påslag, så en prisändring från Meta återspeglas på vårt kort samma dag i stället för nästa faktureringscykel, och en begäran som misslyckas hos en leverantör görs om mot en frisk leverantör i stället för att visa sig som en timeout.

Samma logik gäller för videosidan av världen. Vi routar inte Muse Realtime Avatar och vi routar inte Tavus Griffin, och vi kommer inte att påstå något annat. Det vi routar är en katalog med över tvåhundra modeller inom samma modaliteter, så att en prototyp som växlar mellan en textagent, en röstmodell och en videogenerator stannar på en och samma nyckel medan de två modellerna i den här artikeln fortfarande inte har släppts.
Vilken av dem är längst ifrån att skickas?
Enligt offentliga uppgifter ligger Muse Realtime Avatar längre bort. Den har ett forskningsinlägg och inget API, inget pris och inget datum. Griffin har inte heller något API och inget pris, men den har en uttalad släppavsikt – "mycket snart efter att dessa säkerhetsfarhågor har hanterats" – en namngiven förhandsvisningsnivå som finns i dag för utvalda testare, och en hög med publicerade benchmarkresultat från en oberoende testrigg. Det är en mer avancerad position, även om den kommer med ett medgivande att modellen inte är säker nog att lämnas ut till kunder.
Fällan när man jämför dem är att behandla siffran 870 millisekunder som direkt jämförbar med siffran 0,43 sekunder. De mäter olika saker: Meta mäter från slutet av en tur till första byten i en porträttvideo, och Tavus mäter ljud-till-video-latens i en kontinuerlig duplexström där turer inte är tydligt avgränsade händelser. Båda siffrorna är verkliga, men de utgör inte samma mätning, och den som presenterar dem i en och samma kolumn gör läsaren en björntjänst.
Slutsats
Muse Realtime Avatar är ett förkroppsligandelager: ljud in, porträtt ut, 870 millisekunder från slutet av turen till första byte, 448×768 vid 25 fps, inget API och inget datum. Tavus Griffin är en dubbelriktad modell för mänsklig interaktion: deltagaren in, ett reagerande ansikte ut, 0,43 sekunders genomsnittlig ljud-till-video-latens på H100:or, och en leverantör som är villig att publicera att 48 % av människorna trodde att den var en människa samtidigt som den uppger att kunder inte kan använda den. Meta bygger något som hänger med. Tavus bygger något som passerar. Inget av dem går att köpa, vilket innebär att det enda beslut som finns tillgängligt idag är vilken halva av problemet man ska börja med – och för de flesta team är den halvan den underliggande språkmodellen.
