
Tavus Griffin: Il primo modello di interazione umana e il 48% che ha superato il test di Turing video
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Ventisei persone su cinquantaquattro hanno portato a termine una videochiamata di un minuto e hanno detto che il loro interlocutore era una persona reale. È il numero su cui Tavus sta puntando per Tavus Griffin, annunciato il 1° ottobre 2026, ed è un risultato davvero sorprendente: sullo stesso protocollo, lo stack precedente dell'azienda — Phoenix-4.5 che renderizzava il volto, Raven-1 che si occupava della percezione, Sparrow-2 che gestiva le dinamiche dei turni — ha prodotto un solo convinto su quarantuno, ovvero il 2,4%. Le due interpretazioni ovvie di quel balzo sono entrambe sbagliate, e separarle è gran parte di ciò che segue. Griffin non è un motore per avatar migliore, e non è un prodotto che si può acquistare. È un'anteprima di ricerca chiamata Griffin-Lite, aperta a selezionati tester fidati, senza prezzi, senza API pubbliche e senza comparire in alcuna classifica video indipendente. Il fatto che entrambe queste cose siano vere contemporaneamente è la vera storia.
Cosa misura il 48%, e cosa non misura
Lo studio è un test di Turing faccia a faccia, non un sondaggio sulle preferenze, e vale la pena enunciare il protocollo con precisione perché è l'affermazione portante. Cinquantaquattro partecipanti sono stati reclutati tramite una piattaforma di ricerca indipendente e gli è stato detto che sarebbero stati abbinati a un altro partecipante per una videochiamata di un minuto su ciò che attendevano con impazienza per quell'anno. Il loro partner era un PAL che eseguiva Griffin-Lite, generando volto, voce e risposte in tempo reale. Solo alla fine del sondaggio è stato chiesto loro se fosse passato loro per la mente che il partner potesse non essere una persona reale, e a ogni partecipante è stato poi detto che era un'IA. La prova di confronto ha utilizzato lo stesso protocollo sullo stack precedente, con quarantuno partecipanti.
I dati di supporto contano quanto il titolo. Chi credeva era fiducioso — in media al 79% — e lo erano anche i dubbiosi, all'81%, ed è ciò che uno studio vuole: nessuno stava tirando a indovinare. Oltre la metà dei partecipanti ha detto che la possibilità non era affatto passata loro per la mente durante la chiamata, e quasi tutti di quel gruppo hanno poi affermato che il partner era reale. I partecipanti che hanno effettivamente sospettato tendevano a sospettarlo entro i primi venti secondi. Questa è la riga meno rassicurante del rapporto e quella che dovrebbe influenzare il modo in cui leggerai la sezione sulla sicurezza più avanti.
Su una scala a sette punti, il modello ha ottenuto in media 5,4 per l'impressione di naturalezza, 5,6 per l'impressione di affidabilità, 5,8 per se i partecipanti avrebbero gradito parlarci di nuovo — un punteggio che si è mantenuto a 5,4 anche tra i partecipanti che lo hanno identificato correttamente come un'IA — e 5,5 per se sentivano che il loro interlocutore li stesse davvero ascoltando. Il punteggio più basso è stato 4,9, per se la conversazione scorresse in modo naturale. Letti nel loro insieme, questi risultati delineano un profilo preciso: Griffin-Lite è convincente momento per momento e leggermente meno convincente nel suo arco complessivo.
Il benchmark indipendente, e come interpretare le sue due tracce
I numeri sulla qualità provengono dal VideoFDB di NVIDIA, un benchmark per la conversazione audiovisiva full-duplex che valuta un modello su due tracce separate — generazione, ovvero se il modello produce il comportamento giusto, e percezione, ovvero se comprende il momento — ciascuna con la propria rubrica e la propria classifica. NVIDIA ha creato il benchmark, conduce la valutazione con un proprio giudice rispetto alle metriche pubblicate e assegna un punteggio alla risposta su una scala da zero a cinque. Tavus non lo ha eseguito, ed è questo il motivo per cui vale la pena citarlo.
• Generazione — Griffin-Lite ha ottenuto 3,83, il secondo sistema pubblicato con il punteggio più alto ha ottenuto 2,80 (Gemini 2.5 con Anam), e il riferimento ground-truth umano è 3,92. Questo è 1,03 avanti rispetto al miglior sistema comparabile e 0,09 sotto l'umano.
• Percezione — 3,73 rispetto a un riferimento umano di 4,20, con 3,44 per la baseline più forte riportata, MiniCPM-o 4.5 nella sua configurazione solo audio. Gemini 2.5 Flash Native ha ottenuto 3,17 e gpt-realtime di OpenAI ha ottenuto 2,97.
• Allineamento del tasso di takeover — 62,8% nella generazione e 73,8% nella percezione. Misura quanto strettamente le decisioni del modello su quando parlare corrispondano alla tempistica nelle conversazioni di riferimento, e Tavus le descrive entrambe come le più alte di qualsiasi sistema presente nella classifica.
Due avvertenze vanno apposte a quei numeri prima che qualcuno li ripeta. Il divario generazionale rispetto all'umano è 0,09 su una scala a cinque punti giudicata da un modello linguistico, che è meglio leggere come «vicino all'umano su questa rubrica» che come «a livello umano». E il confronto sulla percezione non è omogeneo: MiniCPM-o 4.5 e gpt-realtime sono valutati in configurazioni solo audio, mentre Griffin legge anche il video. Il vantaggio di 0,29 punti rispetto a una baseline solo audio è reale, ma parte di ciò che misura è il valore di avere gli occhi.
La riga di riepilogo del fornitore stesso — prima nel test indipendente di NVIDIA sull'IA faccia a faccia, 37% in vantaggio sulla successiva migliore IA nel reagire sul momento — è una caratterizzazione degli stessi dati, non un risultato separato. Mantieni i punteggi delle tracce sottostanti, non l'inquadramento.

Due motori, in funzione allo stesso tempo
L'affermazione architetturale è più facile da valutare del marketing che la circonda, perché riguarda ciò che viene eseguito in modo concorrente. Griffin viene descritto come due sistemi che lavorano in parallelo anziché una pipeline che passa il controllo tra le fasi.
Il primo è un motore di modellazione conversazionale continua. Acquisisce l'audio e il video della persona e rivaluta lo scambio a intervalli regolari inferiori al secondo — Tavus chiama questi mini-turni — decidendo a ciascuno se rimanere in silenzio, segnalare, fare backchannel o prendere il turno. L'output non è solo le parole ma un insieme di controlli espressivi che trasmettono tempismo, postura, espressione facciale e gestualità. Il punto del design è che una decisione presa a metà frase si manifesta nella voce e nel volto all'interno dello stesso mini-turno invece che dopo un passaggio di consegne, il che permette al modello di fermarsi quando viene interrotto, annuire mentre ascolta e trattare una pausa di riflessione come qualcosa di diverso dalla fine di un turno.
Il secondo è un motore di generazione audiovisiva che trasforma quei controlli in suono e pixel insieme: un generatore di parlato in streaming e un generatore video in streaming guidati dagli stessi segnali, così un cambiamento di tono e un cambiamento di espressione arrivano nello stesso battito.
Una nota di onestà sul materiale che Tavus ha pubblicato insieme a questo, perché sarebbe facile scambiarlo per una misurazione. Il diagramma interattivo di uno scambio di nove secondi è annotato nel testo stesso della pagina come illustrativo ed esplicitamente non misurato da una sessione reale. Lo stesso avvertimento vale per la figura temporale turn-based versus full-duplex. Ciò che è misurato è il numero di latenza più in basso.
All'interno dello stack di streaming
Il lato audio è costruito attorno a un codec chiamato Tavec, un autoencoder convoluzionale che mappa l'audio a 48 kHz in un latente continuo di 40 valori per frame a 100 frame al secondo, senza codebook. Il suo decoder è completamente causale, quindi mantiene lo stato tra i chunk ed emette pacchetti audio piccoli fino a 10 ms senza lookahead. Un minuto di parlato corrisponde a 6.000 frame latenti anziché 2,88 milioni di campioni grezzi, ed è questo che rende la sequenza abbastanza economica perché il transformer del parlato possa prevederla più velocemente del tempo reale. Il generatore del parlato stesso è un transformer diffusivo autoregressivo che si condiziona su un prefisso di speaker codificato — una voce può essere clonata da circa dieci secondi di audio — e genera un chunk latente alla volta man mano che arrivano i controlli, così la riproduzione inizia prima che l'enunciato sia terminato.
Il lato video parte dalla stessa premessa: una forte compressione temporale è ciò che rende un modello di diffusione abbastanza veloce da sostenere una conversazione. Un generatore autoregressivo a pochi passaggi prende una foto di riferimento, l'audio in streaming e i controlli in streaming, e produce un latente per passaggio a tre passaggi di diffusione per latente. Un VAE comprime il tempo di otto volte, quindi a 25 fps un latente corrisponde a otto fotogrammi, ovvero 320 ms di video 720p. I latenti più vecchi vengono mantenuti a una risoluzione progressivamente inferiore in modo che i rollout lunghi rimangano sostenibili. Il risultato è un generatore che emette 720p in blocchi da 320 ms in tempo reale.
Arrivarci ha richiesto una distillazione in tre fasi a partire da un grande teacher di diffusione bidirezionale a molti passi: la Distribution Matching Distillation verso uno student a pochi passi, il teacher forcing per convertire quello student in un modello autoregressivo che genera un latente alla volta, e infine l'addestramento con self-forcing sulla cronologia generata dal modello stesso, più un meccanismo aggiuntivo che agisce sui frame della cronologia affinché i rollout lunghi non vadano alla deriva. È la terza fase quella che affronta il modo di fallire che questa classe di modelli presenta di solito: un volto che si degrada, o uno sfondo che vaga lentamente, nel corso di una conversazione che va avanti per minuti.
Il numero di latenza, che è la vera promessa del prodotto
Rispetto a quattro modelli diffusionali in streaming pubblicati in un contesto audio-to-video, in cui ciascun modello riceve il parlato e un'immagine di riferimento e deve produrre il volto parlante, il generatore di Griffin-Lite ha registrato una media di 0,43 secondi di latenza audio-to-video reale su H100s — il tempo che intercorre tra l'arrivo di un frammento audio e il momento in cui il video ne mostra l'effetto. Tavus lo descrive come la metà del metodo successivo più veloce. Riporta inoltre il primo posto per qualità percettiva su DOVER e FID e su THEval, un framework di valutazione per talking-head, e il secondo posto su LSE-C, confidenza di sincronizzazione labiale, a 7,27, dietro a una baseline — con il fornitore che osserva che LSE-C premia movimenti marcati della bocca, compresi movimenti oltre il punto in cui appaiono naturali.
Tutte queste sono misurazioni di Tavus stesso rispetto a baseline che ha selezionato. Sono utili perché sono specifiche e perché il dato di 0,43 secondi è il tipo di numero che o regge in un test dal vivo o non regge. Non sono indipendenti, e gli unici punteggi indipendenti in questo articolo sono i due track VideoFDB qui sopra.

Perché non c'è alcun prezzo da confrontare
Griffin-Lite è disponibile oggi per un gruppo selezionato di early tester come anteprima di ricerca, con un rilascio più ampio di un modello più capace in arrivo. Al momento non sarà disponibile per l’uso da parte dei clienti. L’accesso avviene tramite modulo di richiesta. Non è sulla piattaforma Tavus, e la frase di chiusura dell’annuncio dell’azienda lo dice chiaramente: Griffin non è ancora sulla piattaforma Tavus e arriverà una volta che Tavus avrà capito come rilasciarlo in modo sicuro. Tutto ciò che un acquirente normalmente confronta — prezzi al secondo o per richiesta, un identificatore di modello, limiti di frequenza, un SLA, un elenco di regioni — non esiste ancora. Tavus indirizza chiunque voglia sviluppare oggi verso i modelli già utilizzati da 150.000 sviluppatori e aziende, che sono i tre predecessori, non Griffin.
Non è un tecnicismo da relegare a una nota a piè di pagina. Cambia a cosa serve questo modello in questo momento. È un obiettivo di valutazione per i team il cui prodotto dipende dal fatto che una persona riesca a distinguerlo, e un segnale su dove sta andando la roadmap del fornitore. Non è qualcosa su cui costruire un percorso rivolto al cliente in questo trimestre.
Il gate di sicurezza è il piano di rilascio
La cosa più interessante che Tavus ha scritto su Griffin non riguarda il modello. È l'ammissione che le stesse proprietà che rendono un modello di interazione umana un'interfaccia migliore lo rendono anche più bravo a ingannare qualcuno inducendolo a credere che non sia un'IA, che sono necessari ulteriori lavori di allineamento e sicurezza prima di un rilascio sicuro, e che l'azienda sta lavorando a funzionalità di disclosure e con organizzazioni su valutazioni di sicurezza dell'IA. Dato che quasi la metà di un campione dal vivo non è riuscita a distinguerlo, e che coloro che ci sono riusciti per lo più se ne sono resi conto in meno di venti secondi, un meccanismo di disclosure che sopravvive a una conversazione casuale non è un optional.
Due cose cambierebbero questo articolo in modo sostanziale. Una model card pubblicata con un endpoint e un prezzo sposterebbe Griffin da risultato di ricerca a questione di approvvigionamento. E una voce su una video board indipendente — con l'avvertenza che quelle board valutano clip brevi in base alla preferenza a coppie e non sono progettate per valutare una conversazione dal vivo, quindi il disallineamento potrebbe essere permanente anziché temporaneo — darebbe alle dichiarazioni su latenza e qualità una verifica esterna. Finché una di queste cose non si concretizza, i track di VideoFDB sono la prova più solida disponibile e presentano un divario umano di 0,09 e 0,47 punti rispettivamente.
La controargomentazione che vale la pena soppesare è che un'esecuzione di benchmark non è un deployment. Il protocollo di NVIDIA assegna a ogni sistema lo stesso compito di alternanza dei turni e lo stesso giudice; non dice nulla su come si comporta la nona ora di una chiamata, su cosa succede quando due persone si parlano sopra per un minuto intero, o se i controlli espressivi si degradano su un volto che la fotografia di riferimento ha reso male. Tavus riporta l'addestramento specifico per la deriva — la fase di self-forcing e il meccanismo della cronologia — come la soluzione esattamente a questo, e i report sono tutto ciò che un lettore ha finché qualcuno al di fuori di Tavus non esegue una sessione lunga e la pubblica. Considera il benchmark come la migliore prova disponibile, non come un risultato di deployment.
Cosa costruirci intorno nel frattempo
La domanda concreta per un team che vuole qualcosa del genere oggi è quali parti dello stack siano già acquistabili. Un'interfaccia video conversazionale è una catena — riconoscimento vocale, un modello linguistico, sintesi vocale e, nel caso di Tavus, un rendering — e le prime tre sono commodity. Queste risiedono su un endpoint compatibile con OpenAI presso OrcaRouter con oltre 200 modelli sulla stessa chiave e prezzo di listino del fornitore passato con 0% di ricarico, così un taglio di prezzo del fornitore è attivo qui lo stesso giorno anziché dopo un ciclo contrattuale. Se stai assemblando una pipeline di interazione e vuoi mantenere aperto il livello di generazione finché Griffin o qualcosa di simile non diventa un prodotto reale, è lì che la sostituzione costa un cambio di configurazione invece di una migrazione. Griffin di Tavus stesso non è un modello instradato qui, e non lo sarà finché è un'anteprima dietro un modulo di richiesta.
La cosa che vale la pena osservare non è un altro reel dimostrativo. È se gli strumenti di divulgazione che Tavus sta sviluppando verranno pubblicati, e se un secondo gruppo di ricerca riprodurrà il protocollo faccia a faccia. Un superamento del test di Turing di questa portata è esattamente il tipo di risultato che richiede un secondo laboratorio per essere eseguito.

