
Tavus Griffin vs Muse Realtime Avatar: Twee gezichten uit 2026, twee verschillende problemen
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 223 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Zowel Tavus Griffin als Muse Realtime Avatar bestaat om hetzelfde gênante probleem op te lossen — een taalmodel dat kan praten maar geen gezicht heeft — en ze pakken het van tegenovergestelde kanten aan. Griffin is een video-naar-video Human Interaction Model dat een deelnemer via een camera bekijkt en in real time de andere kant van het gesprek genereert, en het werd in oktober 2026 door Tavus aangekondigd als een onderzoekspreview voor geselecteerde testers. Muse Realtime Avatar is de belichamingslaag van Meta voor zijn Muse-agent, aangekondigd op Meta Connect op 23 september 2026, en het neemt audio en verandert die in een gesynchroniseerd pratend portret. Geen van beide is te koop. Het verschil zit in wat elk van beide probeert goed te krijgen, en dat wordt zichtbaar op het moment dat je je afvraagt wat elk model daadwerkelijk als input ontvangt.
De korte versie
• De input van Griffin is de persoon aan de andere kant — video en audio van een live deelnemer, die het moet lezen, erop moet reageren en waardoor het onderbroken moet kunnen worden.
• De invoer van Muse Realtime Avatar is de eigen spraak van de agent — een stroom tokens van Muse Realtime Voice die het omzet in een bijpassend gezicht.
• Tavus meet Griffin af aan of mensen het geloven, en publiceert een cijfer van 48% uit een videogesprek van één minuut.
• Meta meet Muse Realtime Avatar af aan of het kan bijblijven, en publiceert 870 milliseconden van het einde van een beurt tot de eerste byte.
• Geen van beide heeft een openbare API, een gepubliceerde prijs of een datum voor algemene beschikbaarheid.
Lees die vier rijen samen en de vorm van het meningsverschil is duidelijk. Tavus optimaliseert voor wat de ander gelooft. Meta optimaliseert voor de klok.

Griffin: het model dat geloofd moet worden
Tavus' framing is dat Griffin het eerste Human Interaction Model is, en de architectuur achter die bewering is een tweedelig systeem dat Continuous Conversational Modeling combineert met Audio-Visual Generation. Het eerste deel is gedragsmatig: het bepaalt wat de persona van moment tot moment zou moeten doen, op basis van wat die kan zien en horen. Het tweede deel is rendering, en dat splitst Tavus opnieuw op in streaming spraakgeneratie en streaming videogeneratie.
De cijfers waarmee Tavus uitpakt, zijn geen doorvoercijfers. In een onderzoek dat het bedrijf uitvoerde met Queen Mary University of London, geloofde 26 van de 54 deelnemers — 48% — dat Griffin een echt persoon was na een videogesprek van één minuut, tegenover 1 van 41 (2,4%) voor de vorige stack van Phoenix-4.5 gezichtsgeneratie, Sparrow-2 beurtwisseling en Raven-1 visie. Deelnemers die niet werden misleid, twijfelden meestal binnen de eerste 20 seconden. Op de VideoFDB-benchmark van NVIDIA, gescoord in september 2026, meldt Tavus dat Griffin eerste staat op face-to-face-AI, met een generatiescore van 3,83 tegen de sterkste gerapporteerde baseline van 2,80 en een menselijke referentie van 3,92, en een perceptiescore van 3,73 tegen 3,44 voor de best gerapporteerde baseline en een menselijke referentie van 4,20. Die cijfers zijn door de leverancier gerapporteerd en benchmarkspecifiek, maar de menselijke vergelijkingspunten zijn de interessante.
De engineering achter die cijfers is een codec genaamd Tavec en een autoregressieve diffusietransformer. Tavec werkt op 48 kHz met 40 waarden per frame bij 100 frames per seconde, zonder codebooks, een volledig causale decoder en pakketten van slechts 10 milliseconden — ontworpen zodat een gezicht al kan beginnen bewegen voordat een zin is uitgesproken. Het videopad stuurt 720p in blokken van 320 milliseconden, waarbij één latent gelijk is aan acht frames bij 25 fps, drie diffusiestappen per latent en een 8× temporele compressie in de VAE. Een distillatieproces in drie fasen (distributiematching, dan teacher-forcing autoregressief, dan self-forcing) is wat het die drie stappen überhaupt in realtime laat uitvoeren. De belangrijkste latentieclaim is een gemiddelde van 0,43 seconden van audio naar video op H100s, wat volgens Tavus ongeveer de helft is van de op één na snelste methode die het heeft gemeten. Stemklonen heeft ongeveer een sample van 10 seconden nodig.
De prijs van dit alles is dat Tavus het niet kan uitbrengen. Griffin-Lite, de research preview, is alleen beschikbaar voor een selecte groep vroege testers; in een bericht over de release stelt het bedrijf ronduit dat Griffin-Lite op dit moment niet beschikbaar zal zijn voor gebruik door klanten en dat het verwacht Griffin zeer binnenkort uit te brengen nadat bepaalde veiligheidskwesties zijn opgelost. Griffin staat niet op het Tavus-platform en zal daar pas komen "zodra we hebben uitgevogeld hoe we het veilig kunnen uitbrengen". Een model dat in een gesprek van één minuut 48% van de tijd overtuigend is, is vanuit het oogpunt van deployment een model dat in een gesprek van één minuut 48% van de tijd overtuigend is.

Muse Realtime Avatar: het model dat moet bijblijven
Muse Realtime Avatar werd op 23 september 2026 tijdens Meta Connect aangekondigd en dezelfde dag beschreven door Meta Superintelligence Labs onder de titel "Je Muse tot leven brengen". De framing van Meta is beperkter en mechanischer dan die van Tavus: de Muse-agent had al een stem, dankzij Muse Realtime Voice, en de avatar is de laag die aan die stem een lichaam geeft.
Het gepubliceerde cijfer is 870 milliseconden van einde van beurt tot eerste byte — dat wil zeggen, van het moment dat de gebruiker stopt met spreken tot het moment dat de eerste videobyte van de avatar klaar is. De avatar rendert een portret van 448×768 met 25 frames per seconde. Meta zegt dat het systeem ongeveer 60× minder evaluaties per chunk uitvoert dan zijn baseline, en dat één NVIDIA GB200 12 gelijktijdige realtime-sessies aankan met een capaciteitswinst van 8× ten opzichte van een tweestaps-BF16-implementatie.
Het architectonische verschil met Griffin zit in waar de informatie vandaan komt. Muse Realtime Avatar breidt Muse Realtime Voice uit en deelt de spraaktokenstroom ervan — dezelfde VQ-representatie die het stemmodel produceert, is wat het gezicht aanstuurt, in plaats van een afzonderlijk visueel begrip van een deelnemer. Dat maakt het een audiogedreven DiT-embodimentlaag: efficiënt, nauw gekoppeld aan zijn eigen stemmodel, en zonder ook maar te proberen de mens aan de andere kant van de lijn te lezen. Het is een mond en een gezicht voor een agent, geen gesprekspartner die naar je kijkt.
Meta heeft geen API, geen prijs en geen releasedatum gepubliceerd voor Muse Realtime Avatar. Het onderzoeksbericht vormt de volledige publieke informatie.
Waar de twee ontwerpen werkelijk uiteenlopen
De duidelijkste manier om de splitsing te zien, is je af te vragen wat er gebeurt wanneer de gebruiker onderbreekt.
Griffin is volledig duplex en ontworpen om midden in een uiting onderbroken te worden — het kan kijken en luisteren terwijl het spreekt, en daarom leunt de marketing van Tavus op het idee dat Griffin gespreksgedrag leert in plaats van video. Dat is ook waarom de benchmarksuite rond perceptie en reactie is opgebouwd, en waarom de voorsprong van 37% op het op één na beste systeem bij het reageren op het moment een claim is die het bedrijf de moeite neemt om te maken.
Het einde-van-beurtgetal van 870 milliseconden van Muse Realtime Avatar vertelt je het tegenovergestelde verhaal: het is een pipeline waarin de beurt eindigt, de audiotokens worden afgerond en dan haalt het gezicht de achterstand in. Het is snel — 870 ms is een goede waarde voor een portretrenderer — maar de meting zelf veronderstelt dat er een beurtgrens bestaat, precies de aanname die een duplexmodel is ontworpen om weg te gooien.
Dat is geen kritiek op een van beide ontwerpen. Meta bouwt een gezicht voor een agent die binnen Meta's eigen assistent-oppervlakken leeft, waar een heldere beurtgrens een redelijk model van de interactie is. Tavus bouwt iets dat bestand moet zijn tegen een vreemde die binnen twintig seconden beslist of de persoon op het scherm echt is.
Geen van beide staat op een prijslijst — en slechts één deel van Muse is aanroepbaar
Noch Tavus Griffin noch Muse Realtime Avatar kan vandaag in productie worden genomen. Griffin is beperkt tot geselecteerde testers; Muse Realtime Avatar heeft geen API, geen prijs en geen datum. Als je een build plant, horen beide feiten in het plan.
Wat het vermelden waard is, is het deel van de Muse-stack dat is bereikbaar. De Muse-familie van Meta omvat Muse Spark, en één checkpoint daarvan — meta/muse-spark-1.2 — is live in onze catalogus voor $1,25 per miljoen invoertokens en $4,25 per miljoen uitvoertokens met nul markup op de listprijs van Meta. Het is niet de avatar: het accepteert tekst-, afbeeldings-, video-, audio- en pdf-invoer en retourneert tekst, met een contextvenster van 1M tokens en configureerbare redeneerinspanning. Maar het is het deel van de Muse-lijn dat je daadwerkelijk kunt aanroepen, en als je de agent bouwt die op een dag achter een avatar komt te zitten, is de taalhelft de helft waarmee je kunt beginnen. OrcaRouter geeft provider-listprijzen door met 0% markup, dus een prijswijziging van Meta wordt dezelfde dag op onze kaart weerspiegeld in plaats van in de volgende factureringscyclus, en een verzoek dat bij één provider mislukt, wordt opnieuw geprobeerd bij een gezonde provider in plaats van als een time-out naar voren te komen.

Dezelfde logica geldt voor de videokant van de wereld. We routeren Muse Realtime Avatar niet en we routeren Tavus Griffin niet, en we zullen het tegendeel niet beweren. Wat we wel routeren is een catalogus van meer dan tweehonderd modellen over dezelfde modaliteiten, zodat een prototype dat wisselt tussen een tekstagent, een stemmodel en een videogenerator op één sleutel blijft terwijl de twee modellen in dit artikel nog niet uitgebracht zijn.
Welke is het verst van verzending verwijderd?
Voor zover openbaar bekend is Muse Realtime Avatar verder weg. Het heeft een onderzoekspost en geen API, geen prijs en geen datum. Griffin heeft ook geen API en geen prijs, maar wel een expliciete release-intentie — "zeer binnenkort nadat deze veiligheidszorgen zijn aangepakt" — een benoemde preview-tier die vandaag al bestaat voor geselecteerde testers, en een reeks gepubliceerde benchmarkresultaten van een onafhankelijke testomgeving. Dat is een meer gevorderde positie, hoewel het gepaard gaat met de toegeving dat het model niet veilig genoeg is om aan klanten te worden overhandigd.
De valkuil bij het vergelijken ervan is dat je het cijfer van 870 milliseconden behandelt als direct vergelijkbaar met het cijfer van 0,43 seconde. Ze meten verschillende dingen: Meta meet vanaf het einde van een beurt tot de eerste byte van een portret, en Tavus meet de audio-naar-video-latentie binnen een continue duplexstream waarin beurten geen duidelijke gebeurtenissen zijn. De cijfers zijn beide echt en het zijn niet dezelfde meting, en iedereen die ze in één kolom presenteert, doet de lezer tekort.
Kortom
Muse Realtime Avatar is een belichamingslaag: audio erin, portret eruit, 870 milliseconden van het einde van de beurt tot de eerste byte, 448×768 bij 25 fps, geen API en geen datum. Tavus Griffin is een duplex menselijk interactiemodel: de deelnemer erin, een reagerend gezicht eruit, 0,43 seconden gemiddelde audio-naar-video-latentie op H100s, en een leverancier die bereid is te publiceren dat 48% van de mensen dacht dat het een mens was, terwijl hij ook stelt dat klanten het niet kunnen gebruiken. Meta bouwt iets dat bijblijft. Tavus bouwt iets dat slaagt. Geen van beide is te koop, wat betekent dat de enige beslissing die vandaag beschikbaar is, is met welke helft van het probleem te beginnen — en voor de meeste teams is die helft het taalmodel daaronder.
