
Tavus Griffin vs Google Veo 3.1: Uno appone una filigrana su ogni fotogramma, l'altro ha ingannato il 48% di una stanza
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Metti Tavus Griffin e Google Veo 3.1 fianco a fianco e il confronto convenzionale — prezzo al secondo, Elo, durata della clip — crolla all'istante, perché solo uno dei due ha un prezzo e solo uno dei due è valutato su qualcosa che un acquirente può consultare. Ma sotto c'è un asse reale, e non è la qualità. La risposta di Google ai media sintetici è renderli rilevabili: ogni output di Veo 3.1 porta SynthID, un watermark invisibile scritto nei pixel fotogramma per fotogramma e nello spettro audio, più i C2PA Content Credentials che registrano la provenienza del file, e Google ha integrato un rilevatore nell'app Gemini così che un utente possa chiedere se una clip è stata creata da Google AI. La ragione dichiarata per cui Tavus Griffin esiste in anteprima anziché come prodotto è l'immagine speculare: nello studio dal vivo condotto da Tavus stessa, 26 dei 54 partecipanti hanno terminato una videochiamata di un minuto credendo che il loro interlocutore fosse una persona reale, contro 1 su 41 con lo stack precedente dell'azienda, e Tavus afferma di trattenere il modello finché non avrà capito come divulgare cosa sia. Uno di questi fornitori vende il rilevamento. L'altro è attualmente la ragione per cui il rilevamento conta, e lo sa.
Due prodotti costruiti su presupposti opposti
Veo 3.1 è un generatore di clip con un ambito volutamente ristretto. Sull'API Gemini di Google produce 4, 6 o 8 secondi per passaggio a 24 fps, nativamente a 720p, con 1080p e 4K che arrivano tramite un passaggio di upscaling aggiunto in un aggiornamento di gennaio 2026. L'estensione aggiunge sette secondi per passaggio e può essere ripetuta fino a venti volte per un tetto teorico di circa 148 secondi, ma l'input deve essere una clip generata da Veo di non più di 141 secondi a 720p in 16:9 o 9:16, e la durata di otto secondi è obbligatoria per l'estensione, per l'input di immagini di riferimento e per qualsiasi cosa al di sopra di 720p. Non è possibile creare una clip di quattro secondi a 1080p. L'output è un file di tua proprietà, con filigrana, a cui è allegato un record di provenienza firmato.
Griffin non produce un file. Conduce una conversazione. Un motore di Continuous Conversational Modeling riceve audio e video e rivaluta lo scambio a intervalli inferiori al secondo, scegliendo se restare in silenzio, segnalare, fare backchannel o prendere il turno, ed emette controlli espressivi che guidano insieme un generatore vocale in streaming e un generatore video in streaming. Il generatore video produce 720p in blocchi da 320 ms, un latente alla volta, a 25 fps da una singola fotografia di riferimento, e riproduce ogni blocco man mano che lo decodifica. Non esiste una durata della clip perché non esiste una clip; esiste una sessione che continua finché qualcuno non smette di parlare.
Quella distinzione decide quasi ogni altra riga di questo confronto. Il perimetro di Veo 3.1 è un insieme di vincoli su cui una pipeline di produzione può pianificare — liste di inquadrature da otto secondi, una scala di estensioni per riprese più lunghe, 24 fps fissi, una scala di risoluzioni nota. L'output di Griffin non è affatto storyboardabile in anticipo, perché ciò che renderizza dipende da ciò che fa la persona dopo.
Quanto costa Veo 3.1, a ogni livello
Le tariffe pubblicate da Google per l'API Gemini includono l'audio, sono al secondo di output e non esiste alcun livello gratuito a nessun livello di Veo 3.1. L'audio non può essere disattivato su quell'API — viene generato a ogni richiesta — il che è importante perché fonti di terze parti descrivono una tariffa di Vertex AI in cui il video senza audio costa circa la metà della cifra che include l'audio. La documentazione ufficiale di Google non espone tale opzione. Se una tariffa per il video senza audio è rilevante per la tua fattura, verificala rispetto alla tua fatturazione Vertex anziché su una pagina di confronto, inclusa questa.
• Veo 3.1 Standard — 0,40 $/s a 720p e 1080p, 0,60 $/s a 4K.
• Veo 3.1 Fast — $0,10/s a 720p, $0,12/s a 1080p, $0,30/s a 4K.
• Veo 3.1 Lite — 0,05 $/s a 720p, 0,08 $/s a 1080p, senza livello 4K.
Applica la regola degli otto secondi a quelle tariffe e il costo per tentativo è quello che un team creativo mette effettivamente a budget: 32 centesimi per una ripresa 1080p di otto secondi su Standard, 80 centesimi per una di quattro secondi alla stessa risoluzione perché il minimo di otto secondi non si applica sotto i 720p, e 4,80 dollari per una singola ripresa 4K di otto secondi. È quest'ultimo numero quello su cui soffermarsi, perché una ricerca in quattro tentativi per una singola ripresa 4K utilizzabile costa poco meno di venti dollari, e il requisito degli otto secondi significa che non puoi testare l'idea a metà durata per metà prezzo.
Griffin non ha un prezzo, non ha un piano gratuito e non ha alcun tipo di listino. Griffin-Lite è disponibile per alcuni tester fidati selezionati come anteprima di ricerca tramite modulo di richiesta, non è sulla piattaforma Tavus, e l'annuncio è esplicito nel dire che non sarà disponibile per l'uso da parte dei clienti al momento. La frase conclusiva di Tavus sulla pagina è che Griffin arriverà una volta che l'azienda avrà capito come rilasciarlo in sicurezza. Ogni affermazione in questo articolo che confronta i due su qualcosa che assomigli a una decisione di acquisto ha un buco nella metà di Griffin, e nessuna quantità di ricerca lo colma.
Cosa misurano effettivamente i due tabelloni
I due modelli sono stati valutati con strumenti diversi per lo stesso motivo per cui è difficile stabilirne il prezzo l'uno rispetto all'altro.
Veo 3.1 vive nella video arena di Artificial Analysis, dove l'Elo deriva dalla preferenza umana a coppie in cieco su clip brevi. Rilevato il 2 ottobre 2026 sulla classifica text-to-video con audio:
• Veo 3.1 — 18°–21°, Elo 968 (±11) su 2.857 voti, 24,00 $/min.
• Veo 3.1 Fast — 18°–21°, Elo 961 (±10) su 3.595 voti, $7,20/min.
• Veo 3.1 Lite — 21°–24°, Elo 949 (±11) su 2.762 voti, 4,80 $/min. • Veo 3.1 nella modalità image-to-video (con audio) — 11° su 34, Elo 1.082 su 7.049 voti, 24,00 $/min. Il suo miglior piazzamento su qualsiasi classifica, e quello con il maggior numero di voti alle spalle.
Da tutto ciò discendono due cose. Tutti e tre i livelli si collocano entro diciannove punti Elo l'uno dall'altro, con intervalli di confidenza sovrapposti, quindi il prezzo al secondo quattro volte più alto del livello standard non acquista una preferenza cieca misurabile. E la stessa linea Gemini Omni Flash, più recente, di Google supera ogni livello di Veo 3.1 sulla medesima classifica — 7º–8º a 1.117 Elo su 7.801 voti e 9,12 $/min, davanti a tutti e tre i livelli pur costando tra un quarto e un quinto al minuto — una domanda che ogni acquirente di Veo 3.1 dovrebbe porsi, e alla quale questo articolo non è il luogo adatto per rispondere.
I numeri di Griffin provengono da VideoFDB di NVIDIA, un benchmark per la conversazione audiovisiva full-duplex che NVIDIA ha creato e valutato in modo indipendente a settembre 2026. Griffin-Lite ha ottenuto 3,83 su 5 nella categoria di generazione rispetto a un riferimento umano di 3,92 e 2,80 per il sistema pubblicato con il secondo punteggio più alto, e 3,73 nella categoria di percezione rispetto a un riferimento umano di 4,20. Tavus riporta inoltre 0,43 secondi di latenza reale da audio a video per il generatore, rispetto a quattro baseline pubblicate di diffusione in streaming su H100, descrivendola come la metà di quella del secondo sistema più veloce.
Nessuno dei due set è trasferibile. Un Elo derivante dal voto di preferenza su clip brevi non dice nulla sulla capacità di un modello di essere interrotto; il punteggio di una rubrica assegnato da un giudice su una conversazione non dice nulla sul fatto che una clip appaia corretta in 4K. E le avvertenze valgono in entrambe le direzioni: il divario di 0,09 punti di Griffin rispetto al riferimento umano è abbastanza piccolo, su una rubrica a cinque punti giudicata da un modello linguistico, perché «vicino all'umano» sia la lettura onesta, e parte del suo vantaggio nella percezione è misurata rispetto a sistemi che funzionano del tutto senza input video.

La provenienza, che è la vera differenza del prodotto
Per un'azienda con qualsiasi obbligo di divulgazione, questa è l'unica cosa che conta, e non c'è paragone.
L'output di Veo 3.1 porta SynthID fotogramma per fotogramma nei pixel e nello spettro audio, progettato per resistere a compressione, ridimensionamento, ritaglio e registrazione dello schermo, e i C2PA Content Credentials registrano la provenienza del file e la cronologia delle modifiche, interoperabili con le implementazioni di Adobe e Microsoft. Google ha integrato il rilevamento nell'app Gemini, così un utente può caricare un video e chiedere se è stato creato da Google AI, con il rilevamento che segnala quale sezione della traccia audio o video portava il marchio. Il limite è reale e vale la pena affermarlo: quel rilevatore riconosce solo i modelli di Google. Niente nel catalogo di Alibaba o Kuaishou è comparabile, e nemmeno nulla di Tavus lo è.

Tavus non ha pubblicato una filigrana, un rilevatore o una pipeline di credenziali dei contenuti per Griffin. Ciò che ha pubblicato è la ragione per cui ne ha bisogno. Lo studio faccia a faccia è insolitamente schietto sulla modalità di fallimento: oltre la metà dei partecipanti ha detto che la possibilità di un'IA non aveva sfiorato la loro mente durante la chiamata, quasi tutti di quel gruppo hanno concluso che il loro partner era reale, e le persone che sospettavano tendevano a capirlo entro i primi venti secondi. I credenti erano in media sicuri al 79% e i dubbiosi all'81%. Questo è un modello la cui ingannevolezza non è un effetto collaterale della qualità della generazione — è la qualità della generazione.
La risposta di Tavus è nell'annuncio anziché in una nota a piè di pagina: le stesse proprietà che rendono i Human Interaction Models potenti interfacce per la comunicazione naturale permettono loro di ingannare una persona inducendola a credere che non sia un'IA; sono necessarie ulteriori procedure di allineamento e sicurezza per un rilascio sicuro, e l'azienda sta lavorando a funzionalità di divulgazione sicura e con organizzazioni che si occupano di sicurezza dell'IA. Ecco perché esiste il gate. Griffin-Lite non sarà disponibile per l'uso da parte dei clienti al momento.
I termini aziendali che Google porta e Tavus no
Veo 3.1 è erogato tramite Vertex AI con l'infrastruttura regionale, IAM e la superficie contrattuale enterprise che ciò implica, e Google limita ciò che il modello farà in base alla giurisdizione: tramite un parametro di generazione di persone, UE, Regno Unito, Svizzera e MENA consentono solo soggetti adulti, mentre altre regioni possono consentire tutti. Si tratta di una superficie di policy documentata e sensibile alla regione, e per un acquirente regolamentato può superare una posizione in classifica.
C'è un costo nella sua configurazione. Gli ID dei modelli di Veo 3.1 sull'API Gemini sono ancora ID di anteprima — veo-3.1-generate-preview e i suoi simili — mentre lo SKU Vertex ha una denominazione di disponibilità generale, e report di terze parti stimano la quota di anteprima a circa un quinto della quota di produzione. Google ha ritirato i vecchi SKU Veo 3.0 il 30 giugno 2026, il che dice come viene gestito il ricambio generazionale ed è qualcosa da mettere in conto nel prezzo di tutto ciò che viene costruito su un ID di anteprima. Anche la superficie consumer è davvero limitata: Flow richiede un abbonamento Google AI Pro o Ultra ed è bloccato in UE, Regno Unito, India, Indonesia, Cina continentale e Russia, senza che venga offerta alcuna soluzione alternativa tramite VPN.
Griffin non ha termini di servizio da leggere, perché non esiste alcun servizio. L'accesso è un modulo di richiesta e un'anteprima di ricerca. Tavus ha dichiarato di collaborare con organizzazioni per la sicurezza alle valutazioni e vuole che le persone vi partecipino, il che è un atteggiamento di ricerca più che commerciale.
Ottenere uno dei due
Veo 3.1 è raggiungibile tramite l'API Gemini, Vertex AI, Google AI Studio e Flow, nonché tramite l'app Gemini solo a 720p. Al di fuori della Cina è di gran lunga il più facile dei due per cui ottenere una chiave, il che va contro l'argomentazione sulla qualità sopra esposta ed è il motivo principale per cui questo confronto resta interessante nonostante i numeri.
Griffin è accessibile inviando una richiesta di accesso e venendo selezionati come tester attendibile. Questo è l'intero percorso di approvvigionamento.
Dove un router aiuta davvero in una pipeline Veo è accanto al modello video, non al suo interno. I modelli di testo Google — Gemini 3.5 Flash, Gemini 3.1 Pro Preview, Gemini 3.6 Flash e il resto della linea — sono nel catalogo OrcaRouter e richiamabili sullo stesso endpoint compatibile con OpenAI di oltre 200 altri modelli al prezzo di listino del provider, con 0% di ricarico aggiunto. Le shot list, l'espansione dei prompt, la generazione di didascalie, le note di continuità tra segmenti da otto secondi e la sintesi delle revisioni sono tutti lavori di testo, e quello è lo strato in cui poter mettere un modello economico su una passata in blocco e un modello di frontiera su quella finale costa un cambio di configurazione anziché una migrazione. Veo 3.1 stesso non lo instradiamo, e nemmeno Griffin; vale la pena dirlo esplicitamente anziché lasciare che un paragrafo come questo lasci intendere il contrario.
Quale, sinceramente?
• Scegli Veo 3.1 quando il deliverable richiede una traccia di provenienza, quando l'acquirente è regolamentato, quando la distribuzione deve essere un file con credenziali allegate, o quando il 4K non è negoziabile. Prevedi in budget il limite minimo di otto secondi in ogni modello di costo, e verifica il ciclo di vita dell'ID di anteprima prima di costruirvi sopra un percorso rivolto al cliente.
• Non scegliere Griffin, perché non puoi. Richiedi l'accesso se la tua domanda è se una persona può distinguere un'IA da un essere umano in una chiamata di un minuto, oppure se hai bisogno di sapere dove sta andando il livello di interazione prima di impegnare una roadmap sul livello clip.
• Guarda il rilevatore, non la demo. Se Tavus pubblica un meccanismo di divulgazione che sopravvive a una conversazione informale, il divario tra questi due fornitori si riduce considerevolmente. In caso contrario, Griffin è un risultato che vale la pena citare e Veo 3.1 resta l'unico dei due che puoi mettere davanti a un team di conformità.

