
Tavus Griffin vs Seedance 2.5: Uno genera trenta secondi, l'altro aspetta che tu finisca la tua frase
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il modo più rapido per capire il divario tra Tavus Griffin e Seedance 2.5 è guardare cosa fa ciascuno quando smetti di parlare. Seedance 2.5, rilasciato dal team Seed di ByteDance il 31 luglio 2026, continua: dagli un prompt e produrrà fino a trenta secondi di video in un'unica passata, con audio congiunto, alla risoluzione e alla frequenza di fotogrammi che hai scelto prima di premere invio. Tavus Griffin, annunciato da Tavus in ottobre 2026 come anteprima di ricerca, si ferma — per poi ricominciare, perché è stato in ascolto per tutto il tempo e ha qualcosa da ribattere. Un modello è un motore di produzione che funziona senza supervisione. L'altro è un partecipante che funziona solo se ci sei.
Trenta secondi in un'unica ripresa
Il titolo di Seedance 2.5 è la durata. Dove il suo predecessore si fermava a quindici secondi, 2.5 produce trenta secondi in un'unica generazione — il doppio della finestra, che è la differenza tra un'inquadratura e una scena. Inoltre supporta l'estensione a più riprese, e ByteDance ha mostrato in beta una modalità ultra-lunga in cui al modello viene chiesto di continuare il proprio output anziché ripartire da zero.
La superficie di input è ampia anche per gli standard del 2026. Una singola richiesta può trasportare fino a circa trenta immagini, dieci clip video e dieci clip audio come riferimenti, con video e audio di riferimento che durano ciascuno all'incirca trenta secondi. È materiale sufficiente per specificare contemporaneamente un personaggio, una location, un movimento e una colonna sonora. Il modello include inoltre una serie di modalità denominate che si leggono più come una suite di compositing che come una casella di prompt: una modalità white-model e clay per il previz, green-screen, riferimento di movimento e riferimento creativo. A completare il tutto ci sono il controllo a livello di timestamp e la modifica a livello di regione, ed è qui che la finestra di trenta secondi smette di essere soltanto una durata e comincia a essere una timeline.
Audio e video escono dallo stesso passaggio invece di essere multiplexati in seguito, in più di dieci lingue di dialogo, e l'elenco dei partner di lancio — XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei, Qiongche Intelligence — assomiglia più a una base di clienti industriali e automobilistici che a una di strumenti creativi. La stessa impostazione di ByteDance è che Seedance 2.5 è per chi ha bisogno di un filmato finito, non di un'interazione.

Il modello che esiste solo mentre stai parlando
Griffin è la forma opposta di sistema, e Tavus è insolitamente esplicito riguardo alla forma. Chiama Griffin il primo Human Interaction Model: un sistema video-to-video che osserva e ascolta un partecipante durante una conversazione e genera l'altro lato in tempo reale. L'architettura si divide in Continuous Conversational Modeling, che decide cosa dovrebbe fare la persona momento per momento, e Audio-Visual Generation, che trasmette in streaming il parlato e il volto corrispondenti. È full duplex, quindi può essere interrotto, e non ha bisogno di un segnale pulito di fine turno per rispondere.
Tutto nell'implementazione è ottimizzato per la prossima frazione di secondo piuttosto che per la prossima inquadratura. Il codec audio Tavec funziona a 48 kHz con 40 valori per frame a 100 frame al secondo, nessun codebook, un decoder completamente causale e pacchetti piccoli fino a 10 millisecondi. Il video viene trasmesso in streaming a 720p in blocchi da 320 millisecondi, un latente ogni otto frame a 25 fps, tre passaggi di diffusione per latente, con una compressione temporale 8× nel VAE. Una distillazione in tre fasi — distribution matching, poi autoregressivo con teacher forcing, poi self-forcing — è ciò che rende sostenibili in tempo reale tre passaggi di diffusione. La latenza da audio a video è in media di 0,43 secondi su H100, che secondo Tavus è circa la metà del secondo metodo più veloce che ha misurato. La clonazione vocale richiede un campione di circa dieci secondi.
E poi la frase che determina come pianificare di conseguenza: Tavus afferma che Griffin-Lite, l'anteprima di ricerca, è disponibile per un gruppo selezionato di primi tester, che Griffin-Lite non sarà disponibile per l'uso da parte dei clienti in questo momento, che seguirà un rilascio più ampio di un modello più potente e che Griffin non è ancora sulla piattaforma Tavus — arriverà una volta che l'azienda avrà capito come rilasciarlo in sicurezza.
Le affermazioni che ognuno fa, e quanto valgono
Le prove di Seedance 2.5 riguardano soprattutto la capacità: cosa può accettare, per quanto a lungo può funzionare, quanto costa. Le prove di Griffin riguardano soprattutto l'effetto. In uno studio con la Queen Mary University of London, Tavus riferisce che 26 partecipanti su 54 — il 48% — credevano che Griffin fosse una persona reale dopo una videochiamata di un minuto, contro 1 su 41 (2,4%) con il precedente stack Phoenix-4.5, Sparrow-2 e Raven-1, e chi dubitava di solito sospettava entro i primi venti secondi. Il benchmark VideoFDB di NVIDIA, valutato a settembre 2026, vede Griffin primo nell'IA faccia a faccia secondo il conteggio di Tavus: generazione 3,83 contro un 2,80 come migliore baseline riportata e 3,92 per un essere umano, percezione 3,73 contro 3,44 e 4,20, e un vantaggio del 37% rispetto al secondo miglior sistema nel reagire sul momento. Dati dichiarati dal fornitore, su un benchmark creato da NVIDIA — ma sono i punti di confronto umani quelli che contano.
Non esiste un test indipendente comparabile per «il pubblico ci ha creduto?» su Seedance 2.5, perché non è questo il suo scopo. I due modelli rispondono a domande diverse e nessuno dei due insiemi di numeri è trasferibile all'altro.
Cosa puoi davvero comprare
Seedance 2.5 è un prodotto con un listino prezzi. Sulla piattaforma ModelArk di ByteDance è prezzato a 10,70 $ per milione di token senza input video e a 6,40 $ per milione con esso, il che corrisponde a circa 0,51 $ per una clip di cinque secondi in 16:9 a 480p e a circa 1,16 $ per la stessa clip a 720p. L'accesso avviene tramite le app per consumatori di ByteDance e tramite l'API su Volcano Engine Ark in Cina e BytePlus ModelArk a livello internazionale. Almeno un distributore dichiara che non è disponibile negli Stati Uniti, e le fonti non concordano se la risoluzione massima sia 720p o 1080p — entrambe cose che vale la pena sapere prima di scriverle in una specifica.
Griffin non ha un listino, né un'API pubblica, né una data. Questo è l'intero criterio d'acquisto, e riduce la questione più di quanto ammetta la maggior parte degli articoli di confronto.

Dove un router si guadagna il suo posto
Se stai costruendo qualcosa che ha bisogno di entrambe le cose — un agente che sostiene una conversazione e produce anche filmati finiti — ti trovi davanti a due fornitori, due console, due sistemi di fatturazione e due idee diverse di che cosa sia una richiesta. È proprio quella la giuntura in cui OrcaRouter è davvero utile anziché decorativo: una sola chiave su oltre duecento modelli, con i prezzi di listino dei provider passati a 0% di markup così che un taglio di prezzo di un fornitore arrivi sulla carta lo stesso giorno, failover automatico in modo che un provider saturo non diventi il tuo disservizio, e un DSL di routing per vincolare i job critici a uno specifico backend mentre le bozze vanno dove la capacità costa meno. Anche la fusione di modelli conta ai margini, qui — per un generatore con prezzo a token o al secondo, spendere per un modello di testo economico per affinare un prompt prima di spendere per la generazione costosa è di solito la voce con il rendimento più alto nella pipeline.
Per essere precisi sui due modelli nel titolo: né Seedance 2.5 né Griffin è una route di OrcaRouter. Seedance si raggiunge tramite le piattaforme proprietarie di ByteDance e distributori di terze parti; Griffin non è raggiungibile affatto. Ciò che il catalogo offre effettivamente sul versante video è minimax/minimax-h3, il generatore omnimodale di MiniMax, a 0,08 $ al secondo di output a 768P e 0,13 $ al secondo a 2K, venduto con le stesse unità al secondo di Seedance e disponibile ora.

Domande frequenti, in breve
Potrei eseguire Seedance 2.5 e Griffin nello stesso prodotto?A livello architetturale sì, ed è la suddivisione ovvia: Seedance per tutto ciò che può essere pre-renderizzato, Griffin per la superficie live. A livello commerciale no, perché Griffin non è ancora vendibile a te.
Griffin è solo un generatore di teste parlanti? No, e Tavus ci tiene a sottolineare la distinzione: un generatore di teste parlanti prende in input un testo e restituisce un video, mentre Griffin prende in input il video e l'audio del partecipante e viene valutato in base alla sua capacità di reagire sul momento.
Seedance 2.5 funziona in tempo reale? No. È un generatore in batch con un limite di trenta secondi e una modalità di estensione a più round; la latenza non è l'asse su cui compete.
Il risultato finale
Seedance 2.5 è un motore di produzione già rilasciato: trenta secondi in una singola passata, audio congiunto, fino a trenta immagini e dieci riferimenti video e audio, controllo a livello di timestamp e di regione, circa 0,51 $ per una clip di cinque secondi a 480p e circa 1,16 $ a 720p su ModelArk, disponibile ora tramite le piattaforme di ByteDance e non, per quanto sia stato possibile confermare, negli Stati Uniti. Tavus Griffin non è un prodotto: è un modello duplex di interazione umana i cui risultati pubblicati sono che il 48% dei partecipanti credeva che fosse umano in una chiamata di un minuto e una latenza media da audio a video di 0,43 secondi su H100s, e il cui fornitore ha dichiarato per iscritto che i clienti non possono ancora usarlo. Se ti servono filmati oggi, Seedance è la risposta e ha un prezzo pubblico. Se ti serve un volto che reagisca mentre parli, la risposta è che nessuno ne vende ancora uno.
