
Tavus Griffin vs Alibaba Wan 2.7: un modello conversazionale contro uno generativo
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il modo allettante di confrontare Tavus Griffin e Alibaba Wan 2.7 è al secondo di video, e questo confronto non si può fare. Wan 2.7 ha un listino prezzi pubblicato — 9,00 $ al minuto a 1080p sugli endpoint internazionali di Singapore di Alibaba Cloud, con una fascia più economica per Pechino e Tokyo — e Tavus Griffin non ha alcun listino prezzi, perché Griffin-Lite è stato rilasciato il 1º ottobre 2026 come anteprima di ricerca per tester fidati selezionati, dietro un modulo di richiesta. Ciò che i due hanno in comune è una parola: video. Al di là di questo, sono risposte a domande diverse. A uno viene chiesto cosa dovrebbe succedere dopo in una conversazione; all'altro viene chiesto che aspetto ha una scena descritta. Il confronto interessante non è la qualità, ma ciò di cui ciascuno ha bisogno da te prima di produrre qualsiasi cosa, e ciò che ricevi indietro.
La differenza è il loop, non la risoluzione
Wan 2.7 genera una clip alla volta a partire da un prompt. Scrivi una descrizione, ottieni un pezzo di filmato, lo guardi, ne scrivi un'altra. Wan 2.7 è una suite di quattro modelli — text-to-video, image-to-video, reference-to-video e video-edit — e l'interazione è fondamentalmente transazionale: un input, un output renderizzato e una decisione se tenerlo. Nulla entra in funzione mentre stai ancora decidendo cosa chiedere.
Griffin è costruito al contrario. È un sistema full-duplex: un motore di Continuous Conversational Modeling che assimila audio e video e rivaluta la conversazione a intervalli inferiori al secondo, decidendo se restare in silenzio, segnalare, fare backchannel o prendere il turno, ed emettendo controlli espressivi che pilotano in parallelo un generatore vocale in streaming e un generatore video in streaming. Genera 720p in blocchi da 320 ms da una singola fotografia di riferimento, e l'affermazione che conta è che una decisione presa a metà frase si manifesta nella voce e nel volto entro lo stesso mini-turno. Il benchmark per questo non è una classifica di clip. È se riesci a interromperlo.
Detto in parole semplici: Wan 2.7 risponde alla domanda "che aspetto ha questa scena in movimento?"; Griffin risponde a "cosa dovrebbero fare questo volto e questa voce nei prossimi duecento millisecondi, dato che la persona si è appena fermata?".
Prezzo, sul lato dove ce n'è uno
Le tariffe pubblicate di Wan 2.7 sono al secondo di video generato, e le fasce non sono uniformi all'interno della suite, ed è proprio questo il dettaglio che la maggior parte delle pagine di confronto trascura.
• wan2.7-t2v e wan2.7-i2v — fatturati solo sulla durata dell'output. Singapore internazionale: $0,10/s a 720p e $0,15/s a 1080p, che corrisponde alla cifra di $9,00/min che appare nelle classifiche. Pechino e Tokyo indicano $0,086/s e $0,143/s per lo stesso lavoro.
• wan2.7-r2v (da riferimento a video) — addebitato in base alla durata del video di input, con un limite massimo di cinque secondi, più l'output. Inserisci un riferimento di cinque secondi in una generazione di quindici secondi e ti viene addebitato il costo di venti secondi.
• wan2.7-videoedit — addebitato solo sull'output, con il filmato di input gratuito.
Due fatti del ciclo di vita vanno accanto a quei numeri. Alibaba ha applicato uno sconto di lancio del 30% a tempo limitato sulle proprie superfici Bailian e Qwen Cloud, valido fino al 23 settembre 2026, ormai trascorso. E l'avviso di dismissione di Model Studio di Alibaba Cloud (ID 118434) mette offline diversi modelli più vecchi il 10 ottobre 2026, inclusi wan2.7-r2v e wan2.7-image. Si tratta di una dismissione a livello di variante, non della generazione — wan2.7-t2v e wan2.7-i2v restano elencati con tariffe attive e pagine aggiornate appena l'11 settembre — ma se reference-to-video è il motivo per cui stavi guardando la 2.7, quella strada ha una data.
Il confronto con Griffin contiene una sola riga onesta: non c'è alcun prezzo da mettere accanto a quello di Wan 2.7, perché Tavus non ne ha pubblicato nessuno. Griffin-Lite non è presente sulla piattaforma Tavus, l'annuncio dichiara che al momento non sarà disponibile per l'uso da parte dei clienti, e la frase di chiusura dell'azienda stessa è che Griffin arriverà quando avrà capito come rilasciarlo in sicurezza. Non esiste una tariffa al secondo, né una tariffa per richiesta, né un piano gratuito, né un piano enterprise. Chiunque citi un prezzo per Griffin se lo sta inventando.
Punteggi di qualità: due consigli che non si riuniscono
I due modelli sono stati valutati su strumenti completamente diversi, motivo per cui non esiste alcun confronto Elo tra loro.
Wan 2.7 ha due voci nella video arena di Artificial Analysis, e non si trovano nello stesso posto — che è la trappola nel citare un unico numero per esso. L'Elo lì è derivato da voti di preferenza umana espressi in cieco e a coppie, una metodologia concepita per brevi clip generate, ed entrambe le letture riportate di seguito provengono da classifiche consultate il 2 ottobre 2026.
• Wan2.7-260612 (la build di giugno) nel text-to-video (con audio) — 13°–14°, Elo 1.032 (±10) su 4.645 voti, 9,00 $/min.
• Wan 2.7 (build di aprile) in image-to-video (con audio) — 12º su 34, Elo 1.077 su 4.571 voti, $9,00/min, una classifica che ha all'incirca lo stesso numero di voti ma lo colloca sensibilmente più in alto.
• Wan 3.0, il fratello più recente — 1° a Elo 1.157 su text-to-video e 6° a 1.164 su image-to-video, entrambi a $12,00/min. Questo è il numero che vale la pena conoscere prima di confrontare Wan 2.7 con qualsiasi cosa: la prossima generazione di Alibaba è in cima alla classifica e 2.7 è una build di metà classifica.

Griffin si basa su VideoFDB di NVIDIA, un benchmark per la conversazione audiovisiva full-duplex che NVIDIA ha creato e valutato in modo indipendente a settembre 2026, usando un giudice basato su modello linguistico rispetto a una rubrica da zero a cinque. Griffin-Lite ha ottenuto 3,83 sulla traccia di generazione rispetto a un riferimento umano di 3,92 e 2,80 per il sistema pubblicato con il punteggio più alto successivo, e 3,73 sulla traccia di percezione rispetto a un riferimento umano di 4,20. Tavus riporta inoltre 0,43 secondi di latenza reale da audio a video per il generatore rispetto a quattro baseline di diffusione in streaming pubblicate su H100s.
Entrambi gli insiemi di numeri sono legittimi e nessuno dei due è trasferibile. L'Elo nell'arena è un conteggio di voti sulla preferenza per le clip; VideoFDB è il punteggio di una rubrica di un giudice sul comportamento conversazionale. Non c'è alcun ponte tra loro, e la trappola del campione ridotto vale anche nella direzione opposta: la banda di ±10 dell'arena su Wan 2.7 è abbastanza ampia da far sì che il suo posizionamento rispetto ai vicini non sia risolto con precisione, e il divario di generazione di 0,09 punti di NVIDIA rispetto all'umano è così piccolo, su una rubrica a cinque punti, che «vicino al riferimento umano» è la lettura onesta, non «a livello umano». Anche il confronto sulla percezione non è omogeneo — diversi dei sistemi che Griffin precede, tra cui gpt-realtime di OpenAI e MiniCPM-o 4.5, sono valutati in configurazioni solo audio mentre Griffin percepisce anche il video. Parte del vantaggio di 0,29 punti misura l'avere occhi.
Di cosa ha bisogno ciascuno da te
È qui che il confronto diventa utile, perché gli input sono i prodotti.
• Input — Wan 2.7 accetta testo, un'immagine, un video e audio. Griffin riprende una persona dal vivo tramite telecamera e microfono e non genera affatto una clip su richiesta.
• Output — Wan 2.7 produce un file video, da 2 a 15 secondi per generazione, fino a 1080p, con audio nativo. Griffin produce una conversazione continua: video 720p a 25 fps in blocchi da 320 ms, generati in tempo reale e riprodotti mentre vengono decodificati.
• Cosa lo guida — Wan 2.7 è guidato dal prompt e da un massimo di cinque immagini di soggetto e cinque clip di riferimento, entro un limite di dieci risorse di riferimento per richiesta. Griffin è guidato da ciò che fa la persona: una pausa, uno sguardo distolto, un gesto, un'interruzione.
• Orizzonte temporale — l'unità di lavoro di Wan 2.7 è una clip di al massimo quindici secondi, che poi assembli. L'unità di lavoro di Griffin è una conversazione, ed è per questo che l'architettura ha dovuto risolvere il drift — la distillazione in tre fasi in un generatore autoregressivo, addestrato sulla propria cronologia generata affinché i rollout lunghi restino stabili — invece di lottare per una singola generazione più lunga.
• Contenitore di output — Wan 2.7 restituisce un file che possiedi e che puoi modificare, correggere nel colore e distribuire. Griffin restituisce una sessione renderizzata. Non c'è alcun file da modificare, perché i pixel vengono generati per chunk da una foto di riferimento e dalla cronologia del modello stesso, e lo sfondo, le ombre e la sedia su cui siede la persona fanno parte della generazione.
Una differenza strutturale che vale la pena menzionare: i costi di Wan 2.7 scalano con la durata dell'output e la sua qualità scala con quanto è specifico il tuo prompt. I costi di Griffin non sono misurati e la sua qualità scala con quanto è naturale la persona dall'altra parte. Puoi migliorare uno scrivendo brief migliori e l'altro solo usandolo con persone reali.

Riferimento e coerenza, dove i due design si scontrano
Wan 2.7 controlla la coerenza del soggetto tramite riferimenti forniti: cinque immagini del soggetto, cinque clip di riferimento, dieci asset in totale. È un approccio fotografico: gli mostri che aspetto ha il soggetto e mantiene quell'aspetto per tutta la generazione.
Griffin controlla la stessa cosa nel modo opposto. Genera ogni pixel di ogni fotogramma da una sola immagine di riferimento in tempo reale, e l'annuncio è esplicito sul fatto che controlla l'intera scena anziché il volto: le braccia e le dita, il movimento della sedia, le ombre proiettate e lo sfondo dietro. La coerenza, in questo caso, si ottiene rendendo l'ambiente un obiettivo di generazione anziché un plate compositato.
Nessuno dei due approcci è strettamente migliore e falliscono in modo diverso. La generazione condizionata da un riferimento fallisce allontanandosi dal soggetto fornito nel corso di una clip lunga. La generazione per chunk con una cronologia autoregressiva fallisce vagando nel corso di una sessione lunga se la gestione del drift è sbagliata, che è esattamente il fallimento che il terzo stadio di distillazione ha lo scopo di prevenire. Wan 2.7 è la scelta più sicura quando il risultato da consegnare è una persona specifica in un look specifico. Griffin non è in competizione per quel brief.
Sicurezza, provenienza e postura di rilascio
Wan 2.7 non ha un sistema di provenienza pubblicato paragonabile a un watermark che sopravvive alla compressione — l'annuncio indica la qualità audio e l'accuratezza del testo a schermo come ambiti che necessitano ancora di lavoro, il che è un caveat sulla fedeltà più che sulla sicurezza.
La storia della sicurezza di Griffin è invertita: la ragione dichiarata da Tavus per tenerlo in anteprima è che le stesse proprietà che lo rendono un'interfaccia migliore lo rendono anche più bravo a persuadere qualcuno che sta parlando con un essere umano, e i numeri supportano la preoccupazione. Nello studio dal vivo della stessa azienda, 26 partecipanti su 54 credevano che il loro interlocutore fosse una persona reale, contro 1 su 41 nel precedente stack Phoenix-4.5 / Raven-1 / Sparrow-2. I partecipanti che avevano dei sospetti tendevano a sospettare entro i primi venti secondi. Tavus afferma che sono necessari ulteriori lavori di allineamento e divulgazione prima del rilascio, che sta sviluppando funzionalità di divulgazione e che sta collaborando con organizzazioni su valutazioni di sicurezza. Questa è la cosa più sostanziosa che chiunque abbia pubblicato su questo modello, ed è anche il motivo per cui non c'è un prodotto da acquistare.
Per chiunque confronti i due come strumenti, la conseguenza pratica è semplice: uno è generabile su richiesta e può essere rilasciato oggi, e l'altro è un target di valutazione il cui rilascio è subordinato a un problema che il fornitore non ha ancora risolto.
Quale, per cosa
• Scegli Wan 2.7 se il risultato da consegnare è un filmato. La modifica basata su istruzioni di materiale esistente è il carico di lavoro in cui è insolitamente forte e insolitamente economico, perché la variante di editing fattura solo sull'output e considera gratuito il filmato di input. Vale la pena verificare la sua variante da riferimento a video rispetto alla dismissione del 10 ottobre prima di impegnarti ad adottarla.
• Non scegliere Griffin per nulla questo trimestre, perché non puoi. Richiedi l'accesso se hai bisogno di sapere se una persona è in grado di distinguere, oppure se la tua roadmap dipende dal livello di interazione anziché dal livello dei filmati.
• Concentrati sul divario, non su nessuno dei due modelli. L'arrivo di Griffin fa sì che il confronto più interessante sia ormai quello futuro: un sistema che genera l'intera conversazione contrapposto a una suite che genera l'intera scena. Il primo prodotto che farà entrambe le cose sarà quello rispetto al quale varrà la pena rileggere questo.
Dove un router è adatto, e dove no
Nessuno di questi modelli è nel catalogo OrcaRouter, e vale la pena dichiararlo prima di qualsiasi altra cosa in questa sezione. Wan 2.7 è raggiungibile tramite le piattaforme di Alibaba — Model Studio su Alibaba Cloud e Qwen Cloud — e tramite strumenti creativi di terze parti che lo hanno integrato dopo il lancio; Tavus Griffin è raggiungibile solo tramite modulo di richiesta. Se uno dei due diventa instradabile, apparirà al prezzo di listino del provider.
La parte di una pipeline video che è un problema di routing è il testo che la circonda. Shot list, espansione dei prompt, generazione di didascalie, riepiloghi di revisione qualità e il lavoro su trascrizioni o dialoghi che alimenta un passaggio reference-to-video sono tutte chiamate di testo, e queste girano sullo stesso endpoint compatibile OpenAI su OrcaRouter di oltre 200 altri modelli al prezzo di listino del provider con 0% di markup aggiunto, quindi un taglio di prezzo del fornitore è attivo lo stesso giorno anziché dopo un ciclo contrattuale. Distribuire un modello economico su un passaggio in blocco e un modello di frontiera su quello finale è lì una modifica di configurazione anziché una seconda relazione con un fornitore — lo stesso argomento che vale per il livello di generazione, una volta che il livello di generazione è qualcosa che puoi chiamare.
Cosa tenere d'occhio: se le varianti di riferimento e di editing della suite Wan 2.7 sopravvivranno invariate al ritiro di Model Studio del 10 ottobre, e se il gate di sicurezza di Griffin produrrà una model card pubblicata con un endpoint riportato. Quei due eventi sono ciò che trasformerebbe questo confronto da un saggio di design in una decisione di approvvigionamento.

