Een hero-titelkaart voor Tavus Griffin, met als ondertitel "Het eerste Human Interaction Model — aangekondigd op 1 oktober 2026", boven drie chips met de tekst "48% dacht dat het een echte persoon was", "VideoFDB-generatie: 3,83 tegen een menselijke referentie van 3,92" en "0,43 s audio-naar-video-latentie". Voettekst: "Alle cijfers zijn door de leverancier en NVIDIA gerapporteerd; Griffin-Lite is een onderzoekspreview, niet algemeen beschikbaar." Het OrcaRouter-logo is rechtsonder samengesteld.
Guides & Insights

Tavus Griffin: Het eerste menselijke interactiemodel en de 48% die de Video Turing-test doorstond

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zesentwintig van de vierenvijftig mensen rondden een videogesprek van één minuut af en zeiden dat hun gesprekspartner een echt persoon was. Dat is het aantal waarmee Tavus naar buiten komt voor Tavus Griffin, aangekondigd op 1 oktober 2026, en het is een werkelijk opvallend resultaat: met hetzelfde protocol leverde de vorige stack van het bedrijf — Phoenix-4.5 voor het renderen van het gezicht, Raven-1 voor de waarneming, Sparrow-2 voor het beheren van de beurtdynamiek — van de eenenveertig mensen één iemand op die erin geloofde, oftewel 2,4%. De twee voor de hand liggende interpretaties van die sprong zijn beide onjuist, en het onderscheiden daarvan is het grootste deel van wat volgt. Griffin is geen betere avatar-engine, en het is geen product dat je kunt kopen. Het is een onderzoekspreview genaamd Griffin-Lite, toegankelijk voor een selecte groep vertrouwde testers, zonder prijsstelling, zonder publieke API en zonder vermelding op welke onafhankelijke videoranglijst dan ook. Dat beide dingen tegelijk waar zijn, is het eigenlijke verhaal.

Wat de 48% wel en niet meet

De studie is een face-to-face Turingtest in plaats van een voorkeurssurvey, en het protocol moet precies worden beschreven omdat het de dragende claim is. Vierenvijftig deelnemers werden via een onafhankelijk onderzoeksplatform geworven en kregen te horen dat ze aan een andere deelnemer gekoppeld zouden worden voor een videogesprek van één minuut over waar ze dit jaar naar uitkeken. Hun partner was een PAL die Griffin-Lite draaide en in realtime gezicht, stem en reacties genereerde. Pas aan het einde van de enquête werd hun gevraagd of het bij hen was opgekomen dat de partner misschien geen echt persoon was, en elke deelnemer kreeg vervolgens te horen dat het een AI was. De vergelijkingsrun gebruikte hetzelfde protocol op de oudere stack, met eenenveertig deelnemers.

De ondersteunende cijfers doen er net zoveel toe als de kop. Wie geloofde, was zelfverzekerd — gemiddeld 79% — en de twijfelaars waren dat ook, met 81%, precies wat een onderzoek wil: niemand gokte. Meer dan de helft van de deelnemers zei dat de mogelijkheid helemaal niet bij hen was opgekomen tijdens het gesprek, en bijna iedereen uit die groep zei vervolgens dat de partner echt was. De deelnemers die wel iets vermoedden, deden dat doorgaans binnen de eerste twintig seconden. Dat is de minst comfortabele regel in het rapport, en degene die zou moeten bepalen hoe je de veiligheidssectie later leest.

Op een zevenpuntsschaal scoorde het model gemiddeld 5,4 voor natuurlijk overkomen, 5,6 voor betrouwbaar overkomen, 5,8 voor de vraag of deelnemers het leuk zouden vinden om er weer mee te praten — een score die op 5,4 bleef liggen, zelfs onder deelnemers die het correct als een AI identificeerden — en 5,5 voor de vraag of zij het gevoel hadden dat hun gesprekspartner echt luisterde. De laagste score was 4,9, voor de vraag of het gesprek natuurlijk verliep. Als geheel gelezen is dat een specifiek profiel: Griffin-Lite is overtuigend van moment tot moment en iets minder overtuigend als geheel.

De onafhankelijke benchmark, en hoe je de twee tracks ervan leest

De kwaliteitscijfers komen uit NVIDIA's VideoFDB, een benchmark voor full-duplex audio-visuele conversatie die een model beoordeelt op twee afzonderlijke tracks — generatie, dat wil zeggen of het model het juiste gedrag vertoont, en perceptie, dat wil zeggen of het het moment begrijpt — elk met een eigen rubric en een eigen leaderboard. NVIDIA heeft de benchmark gebouwd, voert de evaluatie uit met zijn eigen judge aan de hand van de gepubliceerde metrics, en beoordeelt de reactie op een schaal van nul tot vijf. Tavus heeft het niet uitgevoerd, en dat is de reden om het te citeren.

• Generatie — Griffin-Lite scoorde 3,83, het op een na hoogst gepubliceerde systeem scoorde 2,80 (Gemini 2.5 met Anam), en de menselijke ground-truthreferentie is 3,92. Dat is 1,03 voor op het beste vergelijkbare systeem en 0,09 onder menselijk.

• Perceptie — 3,73 tegenover een menselijke referentie van 4,20, met 3,44 voor de sterkste gerapporteerde baseline, MiniCPM-o 4.5 in zijn audio-only configuratie. Gemini 2.5 Flash Native scoorde 3,17 en OpenAI's gpt-realtime scoorde 2,97.

• Afstemming van het overnamepercentage — 62,8% bij generatie en 73,8% bij perceptie. Dit meet hoe nauw de beslissingen van het model over wanneer te spreken overeenkomen met de timing in de referentiegesprekken, en Tavus beschrijft beide als de hoogste van alle systemen op het scorebord.

Er horen twee kanttekeningen bij die cijfers voordat iemand ze herhaalt. Het generatieverschil ten opzichte van de mens is 0,09 op een schaal van vijf punten, beoordeeld door een taalmodel, wat beter te lezen is als 'dicht bij menselijk volgens deze rubric' dan als 'op menselijk niveau'. En de perceptievergelijking is geen vergelijking van gelijke gevallen: MiniCPM-o 4.5 en gpt-realtime worden gescoord in configuraties met alleen audio, terwijl Griffin ook video leest. De voorsprong van 0,29 punt op een baseline met alleen audio is reëel, maar een deel van wat die meet is de waarde van ogen hebben.

De eigen samenvattingsregel van de leverancier — als eerste op NVIDIA's onafhankelijke test van face-to-face-AI, 37% voor op de op één na beste AI in het direct reageren — is een karakterisering van dezelfde data, niet een afzonderlijke bevinding. Behoud de onderliggende trackscores, niet de framing.

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

Twee motoren die tegelijkertijd draaien

De architectuurclaim is gemakkelijker te beoordelen dan de marketing eromheen, omdat het een claim is over wat gelijktijdig draait. Griffin wordt beschreven als twee systemen die parallel werken in plaats van een pijplijn met overdrachten tussen fasen.

De eerste is een engine voor Continuous Conversational Modeling. Hij neemt de audio en video van de persoon op en beoordeelt de uitwisseling opnieuw met regelmatige intervallen van minder dan een seconde — Tavus noemt deze mini-turns — en beslist bij elk daarvan of hij stil moet blijven, een signaal moet geven, moet backchannelen of de beurt moet nemen. De output bestaat niet alleen uit de woorden, maar uit een reeks expressieve besturingselementen die timing, houding, gezichtsuitdrukking en gebaren met zich meedragen. Het doel van het ontwerp is dat een beslissing die midden in een zin wordt genomen, binnen dezelfde mini-turn zichtbaar wordt in de stem en het gezicht in plaats van na een overdracht. Dat is wat het model in staat stelt om te stoppen wanneer het wordt onderbroken, te knikken terwijl het luistert, en een denkpauze te behandelen als iets anders dan het einde van een beurt.

De tweede is een audiovisuele generatie-engine die die bedieningselementen samen omzet in geluid en pixels: een streaming spraakgenerator en een streaming videogenerator die door dezelfde signalen worden aangestuurd, zodat een verandering van toon en een verandering van expressie op dezelfde tel vallen.

Eén oprechte opmerking over het materiaal dat Tavus hiermee heeft gepubliceerd, want het zou gemakkelijk voor een meting kunnen worden aangezien. Het interactieve diagram van een uitwisseling van negen seconden is in de tekst van de pagina zelf aangeduid als illustratief en expliciet niet gemeten uit een echte sessie. Dezelfde kanttekening geldt voor de timingfiguur voor beurtgebaseerd versus full-duplex. Wat wel wordt gemeten, is het latencygetal verderop.

Binnen de streamingstack

De audiozijde is gebouwd rond een codec genaamd Tavec, een convolutionele autoencoder die 48 kHz-audio omzet in een continue latente representatie van 40 waarden per frame bij 100 frames per seconde, zonder codeboeken. De decoder is volledig causaal, dus hij draagt toestand over tussen chunks en zendt audiopakketten uit van slechts 10 ms zonder vooruitkijken. Een minuut spraak is 6.000 latente frames in plaats van 2,88 miljoen ruwe samples, waardoor de sequentie goedkoop genoeg is voor de spraaktransformator om sneller dan realtime te voorspellen. De spraakgenerator zelf is een autoregressieve diffusietransformator die conditioneert op een gecodeerde sprekerprefix — een stem kan worden gekloond uit ongeveer tien seconden audio — en genereert één latente chunk per keer naarmate de aansturing binnenkomt, zodat het afspelen begint voordat de uiting is voltooid.

De videokant begint vanuit hetzelfde uitgangspunt: sterke temporele compressie is wat een diffusiemodel snel genoeg maakt om een gesprek te voeren. Een autoregressieve generator met enkele stappen neemt een referentiefoto, de streamingaudio en de streamingbesturingselementen, en produceert één latent per stap bij drie diffusiestappen per latent. Een VAE comprimeert de tijd achtvoudig, dus bij 25 fps is één latent acht frames, of 320 ms 720p-video. Oudere latents worden op steeds lagere resolutie bewaard, zodat lange rollouts betaalbaar blijven. Het resultaat is een generator die in realtime 720p produceert in blokken van 320 ms.

Om daar te komen was een distillatie in drie fasen nodig van een grote bidirectionele diffusieleraar met vele stappen: Distribution Matching Distillation naar een student met weinig stappen, teacher forcing om die student om te zetten in een autoregressief model dat steeds één latent tegelijk genereert, en ten slotte training met self-forcing op de door het model zelf gegenereerde geschiedenis plus een extra mechanisme dat op de geschiedenisframes inwerkt, zodat lange rollouts niet afdrijven. Die derde fase is degene die de faalwijze aanpakt die deze klasse van modellen gewoonlijk heeft — een gezicht dat verslechtert, of een achtergrond die langzaam wegdwaalt, gedurende een gesprek dat minuten duurt.

Het latentiecijfer, dat de echte productclaim is

Tegen vier gepubliceerde streaming-diffusiemodellen in een audio-naar-video-opzet, waarbij elk model spraak en een referentieafbeelding krijgt en een pratend gezicht moet produceren, haalde de generator van Griffin-Lite gemiddeld 0,43 seconde werkelijke audio-naar-video-latentie op H100s — de tijd vanaf het aankomen van een stuk audio totdat de video het effect ervan laat zien. Tavus beschrijft dat als de helft van de op een na snelste methode. Het meldt ook een eerste plaats op DOVER en FID voor perceptuele kwaliteit en op THEval, een evaluatieraamwerk voor talking heads, en een tweede plaats op LSE-C lip-sync-betrouwbaarheid met 7,27, achter één baseline — waarbij de leverancier opmerkt dat LSE-C uitgesproken mondbewegingen beloont, waaronder bewegingen voorbij het punt waarop het er natuurlijk uitziet.

Al die dingen zijn Tavus' eigen metingen ten opzichte van baselines die het zelf heeft gekozen. Ze zijn nuttig omdat ze specifiek zijn en omdat het cijfer van 0,43 seconden het soort getal is dat in een live test al dan niet standhoudt. Ze zijn niet onafhankelijk, en de enige onafhankelijke scores in dit artikel zijn de twee VideoFDB-tracks hierboven.

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

Waarom is er geen prijs om te vergelijken

Griffin-Lite is vandaag beschikbaar voor een selecte groep vroege testers als onderzoekspreview, en een bredere release van een capabeler model volgt later. Het is op dit moment niet beschikbaar voor gebruik door klanten. Toegang verloopt via een aanvraagformulier. Het staat niet op het Tavus-platform, en de eigen slotzin van het bedrijf in de aankondiging zegt het ronduit: Griffin staat nog niet op het Tavus-platform, en zal komen zodra Tavus heeft uitgewerkt hoe het veilig kan worden uitgebracht. Alles wat een koper normaal gesproken zou vergelijken — prijzen per seconde of per verzoek, een modelidentificatie, snelheidslimieten, een SLA, een regiolijst — bestaat nog niet. Tavus verwijst iedereen die vandaag wil bouwen naar de modellen die 150.000 ontwikkelaars en bedrijven al gebruiken, namelijk de drie voorgangers, niet Griffin.

Dat is geen technisch detail om in een voetnoot af te doen. Het verandert waar dit model op dit moment voor dient. Het is een evaluatiedoel voor teams wier product ervan afhangt of iemand het kan merken, en een signaal over waar de roadmap van de leverancier naartoe gaat. Het is niet iets om dit kwartaal een klantgerichte route op te bouwen.

De veiligheidspoort is het releaseplan

Het meest interessante dat Tavus over Griffin schreef, gaat niet over het model. Het is de erkenning dat dezelfde eigenschappen die een model voor menselijke interactie een betere interface maken, het ook beter maken in het misleiden van iemand zodat die gelooft dat het geen AI is, dat er aanvullend werk aan alignment en veiligheid nodig is voordat een veilige release mogelijk is, en dat het bedrijf werkt aan openbaarmakingsfuncties en met organisaties aan AI-veiligheidsevaluaties. Aangezien bijna de helft van een live steekproef het niet kon onderscheiden, en degenen die dat wel konden er meestal binnen twintig seconden achter kwamen, is een openbaarmakingsmechanisme dat een informeel gesprek overleeft geen nice-to-have.

Twee dingen zouden dit artikel wezenlijk veranderen. Een gepubliceerde modelkaart met een endpoint en een prijs zou Griffin van onderzoeksresultaat naar inkoopvraagstuk verplaatsen. En een vermelding op een onafhankelijke videoranglijst — met de kanttekening dat die ranglijsten korte clips beoordelen op basis van paarsgewijze voorkeur en niet zijn gebouwd om een livegesprek te beoordelen, waardoor de mismatch mogelijk permanent is in plaats van tijdelijk — zou de latentie- en kwaliteitsclaims een externe toets geven. Tot een van die twee er is, zijn de VideoFDB-tracks het sterkste bewijs dat beschikbaar is en ze komen met een menselijke kloof van respectievelijk 0,09 en 0,47 punten.

Het tegenargument dat het overwegen waard is, is dat een benchmarkrun geen deployment is. Het protocol van NVIDIA geeft elk systeem dezelfde taak voor beurtwisseling en dezelfde beoordelaar; het zegt niets over hoe het negende uur van een gesprek verloopt, wat er gebeurt wanneer twee mensen een volle minuut door elkaar heen praten, of de expressieve besturingselementen achteruitgaan op een gezicht dat de referentiefoto slecht heeft weergegeven. Tavus rapporteert de driftspecifieke training — de self-forcing-fase en het history-mechanisme — als de oplossing voor precies dat, en rapporten zijn alles wat een lezer heeft totdat iemand buiten Tavus een lange sessie uitvoert en die publiceert. Beschouw de benchmark als het best beschikbare bewijs, niet als een deploymentresultaat.

Wat je er in de tussentijd omheen kunt bouwen

De praktische vraag voor een team dat vandaag zoiets wil, is welke delen van de stack al te koop zijn. Een conversationele video-interface is een keten — spraakherkenning, een taalmodel, spraaksynthese, en in het geval van Tavus een rendermodel — en de eerste drie zijn commodity. Die zitten achter één OpenAI-compatibel endpoint bij OrcaRouter met 200+ modellen op dezelfde sleutel en de lijstprijs van de provider die tegen 0% opslag wordt doorgegeven, dus een prijsverlaging van een leverancier is hier dezelfde dag live in plaats van na een contractcyclus. Als je een interactiepijplijn samenstelt en de generatielaag open wilt houden tot Griffin of iets dergelijks een echt product wordt, dan kost de overstap daar een configuratiewijziging in plaats van een migratie. Tavus Griffin zelf is hier geen gerouteerd model, en dat zal het ook niet zijn zolang het een preview achter een aanvraagformulier is.

Wat de moeite waard is om te volgen, is niet nog een demo-reel. Het is de vraag of de disclosure-tooling die Tavus bouwt, wordt gepubliceerd, en of een tweede onderzoeksgroep het face-to-face-protocol reproduceert. Een geslaagde Turing-test van deze omvang is precies het soort resultaat dat een tweede lab nodig heeft om het uit te voeren.

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.