
Tavus Griffin: Den första modellen för mänsklig interaktion och de 48 % som klarade video-Turingtestet
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 223 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Tjugosex av femtiofyra personer slutförde ett videosamtal på en minut och sa att deras samtalspartner hade varit en riktig person. Det är siffran Tavus använder som huvudargument för Tavus Griffin, som tillkännagavs den 1 oktober 2026, och det är ett verkligt slående resultat: enligt samma protokoll gav företagets tidigare stack — Phoenix-4.5 renderade ansiktet, Raven-1 skötte perceptionen, Sparrow-2 hanterade turtagningsdynamiken — en enda troende bland fyrtioen, eller 2,4 %. De två uppenbara tolkningarna av det hoppet är båda fel, och att skilja dem åt är större delen av det som följer. Griffin är inte en bättre avatarmotor, och det är inte en produkt man kan köpa. Det är en forskningsförhandsvisning som heter Griffin-Lite, öppen för utvalda betrodda testare, utan prissättning, utan offentligt API och utan plats på någon oberoende videotopplista. Att båda dessa saker är sanna samtidigt är den egentliga historien.
Vad 48 % mäter, och vad det inte mäter
Studien är ett Turingtest ansikte mot ansikte snarare än en preferensundersökning, och protokollet är värt att ange exakt, eftersom det är det bärande påståendet. Femtiofyra deltagare rekryterades via en oberoende forskningsplattform och fick veta att de skulle matchas med en annan deltagare för ett enminuters videosamtal om vad de såg fram emot i år. Deras partner var en PAL som körde Griffin-Lite och genererade ansikte, röst och svar i realtid. Först i slutet av undersökningen fick de frågan om det hade slagit dem att partnern kanske inte var en riktig person, och varje deltagare fick sedan veta att den var en AI. Jämförelsekörningen använde samma protokoll på den äldre stacken, med fyrtioen deltagare.
Siffrorna som stöder bilden betyder lika mycket som rubriken. De som trodde var säkra – i genomsnitt 79 % – och det var även tvivlarna, med 81 %, vilket är precis vad en studie vill: ingen gissade. Fler än hälften av deltagarna sade att möjligheten inte alls hade slagit dem under samtalet, och nästan alla i den gruppen fortsatte med att säga att partnern var verklig. De deltagare som faktiskt misstänkte något tenderade att misstänka det inom de första tjugo sekunderna. Det är den minst bekväma raden i rapporten och den som bör forma hur du läser säkerhetsavsnittet längre fram.
På en sjugradig skala fick modellen i genomsnitt 5,4 för att verka naturlig, 5,6 för att verka trovärdig, 5,8 för huruvida deltagarna skulle uppskatta att prata med den igen — en poäng som låg kvar på 5,4 även bland deltagare som korrekt identifierade den som en AI — och 5,5 för huruvida de kände att deras samtalspartner verkligen lyssnade. Den lägsta poängen var 4,9, för huruvida samtalet flöt naturligt. Sammantaget är detta en specifik profil: Griffin-Lite är övertygande i stunden och något mindre övertygande som helhet.
Det oberoende benchmarket, och hur man tolkar dess två spår
Kvalitetstalen kommer från NVIDIAs VideoFDB, en benchmark för full-duplex audiovisuell konversation som poängsätter en modell på två separata spår – generering, det vill säga huruvida modellen uppvisar rätt beteende, och perception, det vill säga huruvida den förstår ögonblicket – var och en med sin egen bedömningsmall och sin egen resultattavla. NVIDIA byggde benchmarken, genomför utvärderingen med sin egen domare mot de publicerade mätvärdena och poängsätter svaret på en skala från noll till fem. Tavus körde den inte, vilket är anledningen till att citera den.
• Generering — Griffin-Lite uppnådde 3,83, det näst högst rankade publicerade systemet uppnådde 2,80 (Gemini 2.5 med Anam), och den mänskliga facitreferensen är 3,92. Det är 1,03 före det bästa jämförbara systemet och 0,09 under mänsklig nivå.
• Perception — 3,73 mot en mänsklig referens på 4,20, med 3,44 för den starkaste rapporterade baslinjen, MiniCPM-o 4.5 i dess konfiguration med enbart ljud. Gemini 2.5 Flash Native fick 3,17 och OpenAIs gpt-realtime fick 2,97.
• Justering av övertagandefrekvens – 62,8 % för generering och 73,8 % för perception. Detta mäter hur väl modellens beslut om när den ska tala matchar tajmingen i referenssamtalen, och Tavus beskriver båda som de högsta av alla system på resultattavlan.
Två förbehåll hör till de siffrorna innan någon upprepar dem. Generationsgapet till människa är 0,09 på en femgradig skala bedömd av en språkmodell, vilket snarare bör tolkas som ”nära människa enligt denna bedömningsmall” än som ”på mänsklig nivå”. Och perceptionsjämförelsen är inte på lika villkor: MiniCPM-o 4.5 och gpt-realtime poängsätts i konfigurationer med enbart ljud, medan Griffin även läser video. Försprånget på 0,29 poäng gentemot en baslinje med enbart ljud är verkligt, men en del av det som mäts är värdet av att ha ögon.
Leverantörens egen sammanfattningsrad – etta i NVIDIAs oberoende test av AI för ansikte mot ansikte, 37 % före den näst bästa AI:n på att reagera i stunden – är en karakterisering av samma data snarare än ett separat fynd. Behåll de underliggande poängen per spår, inte inramningen.

Två motorer, som körs samtidigt
Det arkitektoniska påståendet är lättare att utvärdera än marknadsföringen kring det, eftersom det är ett påstående om vad som körs samtidigt. Griffin beskrivs som två system som arbetar parallellt snarare än en pipeline som lämnar över mellan steg.
Den första är en motor för kontinuerlig konversationsmodellering. Den tar in personens ljud och video och omvärderar utbytet med regelbundna subsekundintervall – Tavus kallar dessa för mini-turer – och beslutar vid var och en om den ska vara tyst, signalera, ge backchannel eller ta turen. Utdata är inte bara orden utan en uppsättning expressiva kontroller som bär timing, hållning, ansiktsuttryck och gester. Poängen med designen är att ett beslut som fattas mitt i en mening visas i rösten och ansiktet inom samma mini-tur i stället för efter en överlämning, vilket är vad som gör att modellen kan stanna när den avbryts, nicka medan den lyssnar och behandla en tankepaus som något annat än slutet på en tur.
Den andra är en audiovisuell genereringsmotor som omvandlar dessa kontroller till ljud och pixlar tillsammans: en strömningsbaserad talgenerator och en strömningsbaserad videogenerator som drivs av samma signaler, så att en ändring i tonen och en ändring i uttrycket landar i samma takt.
En not om ärlighet kring materialet som Tavus publicerade tillsammans med detta, eftersom det lätt skulle kunna misstas för en mätning. Det interaktiva diagrammet över ett utbyte på nio sekunder är i sidans egen text annoterat som illustrativt och uttryckligen inte uppmätt från en verklig session. Samma förbehåll gäller tidsfiguren för turvis kontra full-duplex. Det som är uppmätt är latenssiffran längre ner.
Inuti streaming-stacken
Ljudsidan är uppbyggd kring en codec som kallas Tavec, en konvolutionell autoencoder som mappar 48 kHz-ljud till en kontinuerlig latent med 40 värden per frame vid 100 frames per sekund, utan kodböcker. Dess dekoder är helt kausal, så den behåller tillstånd mellan chunkar och sänder ut ljudpaket så små som 10 ms utan lookahead. En minut tal är 6 000 latenta frames i stället för 2,88 miljoner råa sampel, vilket är vad som gör sekvensen tillräckligt billig för taltransformatorn att prediktera snabbare än realtid. Själva talgeneratorn är en autoregressiv diffusionstransformator som betingar på ett kodat talarprefix – en röst kan klonas från ungefär tio sekunder ljud – och genererar en latent chunk i taget allteftersom kontroller anländer, så uppspelningen börjar innan yttrandet är färdigt.
Videosidan utgår från samma premiss: stark tidsmässig komprimering är det som gör en diffusionsmodell tillräckligt snabb för att kunna hålla en konversation. En autoregressiv generator med få steg tar ett referensfoto, det strömmande ljudet och de strömmande styrningarna och producerar en latent per steg vid tre diffusionssteg per latent. En VAE komprimerar tiden åtta gånger, så vid 25 fps är en latent åtta bildrutor, eller 320 ms 720p-video. Äldre latenter behålls vid successivt lägre upplösning så att långa utrullningar förblir överkomliga. Resultatet är en generator som matar ut 720p i 320 ms-block i realtid.
Att komma dit krävde en trestegsdestillation från en stor dubbelriktad diffusionslärare med många steg: Distribution Matching Distillation till en elev med få steg, teacher forcing för att omvandla den eleven till en autoregressiv modell som genererar en latent i taget, och slutligen träning med self-forcing på modellens egen genererade historik plus en tillagd mekanism som verkar på historikens frames så att långa rollouts inte driver iväg. Det tredje steget är det som åtgärdar det felbeteende som denna modellklass vanligtvis uppvisar – ett ansikte som försämras, eller en bakgrund som långsamt vandrar, under ett samtal som pågår i minuter.
Latenssiffran, som är det verkliga produktlöftet
Jämfört med fyra publicerade strömmande diffusionsmodeller i en ljud-till-video-inställning, där varje modell får tal och en referensbild och måste producera det talande ansiktet, uppmätte Griffin-Lites generator i genomsnitt 0,43 sekunders verklig ljud-till-video-latens på H100 — tiden från att en ljudsnutt anländer till att videon visar dess effekt. Tavus beskriver det som hälften av den näst snabbaste metoden. Den rapporterar också första plats på DOVER och FID för perceptuell kvalitet och på THEval, ett utvärderingsramverk för talande huvuden, samt andra plats på LSE-C läppsynk-säkerhet på 7,27, bakom en baslinje — där leverantören noterar att LSE-C belönar uttalade munrörelser, inklusive rörelser förbi den punkt där det ser naturligt ut.
Alla dessa är Tavus egna mätningar mot baslinjer som det har valt. De är användbara eftersom de är specifika och eftersom siffran 0,43 sekunder är en sådan siffra som antingen står sig i ett livetest eller inte. De är inte oberoende, och de enda oberoende resultaten i den här artikeln är de två VideoFDB-spåren ovan.

Varför finns det inget pris att jämföra?
Griffin-Lite är tillgänglig idag för en utvald grupp tidiga testare som en forskningsförhandsvisning, med en bredare lansering av en mer kapabel modell som följer. Den kommer inte att vara tillgänglig för kundanvändning i nuläget. Åtkomst sker via ett förfrågningsformulär. Den finns inte på Tavus plattform, och företagets egen avslutande mening i tillkännagivandet säger det klart och tydligt: Griffin finns ännu inte på Tavus plattform och kommer när Tavus har kommit fram till hur den kan lanseras på ett säkert sätt. Allt en köpare normalt skulle jämföra — pris per sekund eller per begäran, en modellidentifierare, frekvensgränser, ett SLA, en regionlista — finns ännu inte. Tavus hänvisar alla som vill bygga idag till de modeller som 150 000 utvecklare och företag redan använder, vilka är de tre föregångarna, inte Griffin.
Det är inte en teknikalitet att skriva i en fotnot. Det förändrar vad den här modellen är till för just nu. Det är ett utvärderingsmål för team vars produkt beror på om en person kan avgöra det, och en signal om vart leverantörens roadmap är på väg. Det är inte något att bygga en kundvänd väg på under det här kvartalet.
Säkerhetsgrinden är utgivningsplanen
Det mest intressanta som Tavus skrev om Griffin handlar inte om modellen. Det är medgivandet att samma egenskaper som gör en modell för mänsklig interaktion till ett bättre gränssnitt också gör den bättre på att lura någon att tro att den inte är en AI, att ytterligare arbete med alignment och säkerhet krävs före en säker lansering, och att företaget arbetar med funktioner för att avslöja att det är en AI och med organisationer kring AI-säkerhetsutvärderingar. Med tanke på att nästan hälften av ett liveurval inte kunde avgöra det, och att de som kunde det för det mesta listade ut det inom tjugo sekunder, är en avslöjandemekanism som klarar ett vardagligt samtal inte en trevlig extrafunktion.
Två saker skulle förändra den här artikeln i grunden. Ett publicerat modellkort med en slutpunkt och ett pris skulle flytta Griffin från forskningsresultat till upphandlingsfråga. Och en post på en oberoende videotopplista – med förbehållet att sådana topplistor poängsätter korta klipp utifrån parvisa preferenser och inte är byggda för att poängsätta ett samtal i realtid, så missmatchningen kan vara permanent snarare än tillfällig – skulle ge latens- och kvalitetsanspråken en utomstående kontroll. Tills en av dessa inträffar är VideoFDB-spåren de starkaste bevisen som finns, och de kommer med ett gap mot människa på 0,09 respektive 0,47 poäng.
Det motargument som är värt att väga in är att en benchmark-körning inte är en driftsättning. NVIDIA:s protokoll ger varje system samma turtagningsuppgift och samma domare; det säger ingenting om hur den nionde timmen av ett samtal beter sig, vad som händer när två personer pratar i munnen på varandra i en hel minut, eller om de expressiva kontrollerna försämras på ett ansikte som referensfotot återgav dåligt. Tavus rapporterar den driftsspecifika träningen — självtvingningssteget och historikmekanismen — som lösningen på exakt det, och rapporter är allt en läsare har tills någon utanför Tavus kör en lång session och publicerar den. Betrakta benchmarken som det bästa tillgängliga beviset snarare än som ett driftsättningsresultat.
Vad man kan bygga runt det under tiden
Den praktiska frågan för ett team som vill ha något liknande i dag är vilka delar av stacken som redan går att köpa. Ett konverserande videogränssnitt är en kedja – taligenkänning, en språkmodell, talsyntes och, i Tavus fall, en renderingsmodell – och de tre första är standardvaror. De ligger bakom en OpenAI-kompatibel slutpunkt hos OrcaRouter med 200+ modeller på samma nyckel och leverantörens listpris förs vidare med 0 % påslag, så en leverantörsprissänkning slår igenom här samma dag i stället för efter en avtalscykel. Om du sätter ihop en interaktionspipeline och vill hålla generationslagret öppet tills Griffin eller något liknande blir en faktisk produkt, är det där ett byte kostar en konfigurationsändring i stället för en migrering. Tavus Griffin i sig är inte en routad modell här, och det kommer den inte att vara så länge den är en förhandsvisning bakom ett förfrågningsformulär.
Det som är värt att hålla ögonen på är inte ännu en demorulle. Det är huruvida de avslöjandeverktyg som Tavus bygger blir publicerade, och huruvida en andra forskargrupp reproducerar ansikte-mot-ansikte-protokollet. Ett Turingtest som klaras i den här omfattningen är precis den sorts resultat som kräver att ett andra labb kör det.

