Card del titolo hero per 'Tavus Griffin vs Seedance 2.5' con il sottotitolo 'Uno genera trenta secondi, l'altro aspetta che tu finisca la frase', sopra quattro chip: Seedance 2.5 30 s in un solo passaggio; Seedance 2.5 circa 0,51 $ per 5 s a 480p; Griffin 0,43 s da audio a video; Griffin non ancora vendibile ai clienti.
Guides & Insights

Tavus Griffin vs Seedance 2.5: Uno genera trenta secondi, l'altro aspetta che tu finisca la tua frase

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il modo più rapido per capire il divario tra Tavus Griffin e Seedance 2.5 è guardare cosa fa ciascuno quando smetti di parlare. Seedance 2.5, rilasciato dal team Seed di ByteDance il 31 luglio 2026, continua: dagli un prompt e produrrà fino a trenta secondi di video in un'unica passata, con audio congiunto, alla risoluzione e alla frequenza di fotogrammi che hai scelto prima di premere invio. Tavus Griffin, annunciato da Tavus in ottobre 2026 come anteprima di ricerca, si ferma — per poi ricominciare, perché è stato in ascolto per tutto il tempo e ha qualcosa da ribattere. Un modello è un motore di produzione che funziona senza supervisione. L'altro è un partecipante che funziona solo se ci sei.

Trenta secondi in un'unica ripresa

Il titolo di Seedance 2.5 è la durata. Dove il suo predecessore si fermava a quindici secondi, 2.5 produce trenta secondi in un'unica generazione — il doppio della finestra, che è la differenza tra un'inquadratura e una scena. Inoltre supporta l'estensione a più riprese, e ByteDance ha mostrato in beta una modalità ultra-lunga in cui al modello viene chiesto di continuare il proprio output anziché ripartire da zero.

La superficie di input è ampia anche per gli standard del 2026. Una singola richiesta può trasportare fino a circa trenta immagini, dieci clip video e dieci clip audio come riferimenti, con video e audio di riferimento che durano ciascuno all'incirca trenta secondi. È materiale sufficiente per specificare contemporaneamente un personaggio, una location, un movimento e una colonna sonora. Il modello include inoltre una serie di modalità denominate che si leggono più come una suite di compositing che come una casella di prompt: una modalità white-model e clay per il previz, green-screen, riferimento di movimento e riferimento creativo. A completare il tutto ci sono il controllo a livello di timestamp e la modifica a livello di regione, ed è qui che la finestra di trenta secondi smette di essere soltanto una durata e comincia a essere una timeline.

Audio e video escono dallo stesso passaggio invece di essere multiplexati in seguito, in più di dieci lingue di dialogo, e l'elenco dei partner di lancio — XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei, Qiongche Intelligence — assomiglia più a una base di clienti industriali e automobilistici che a una di strumenti creativi. La stessa impostazione di ByteDance è che Seedance 2.5 è per chi ha bisogno di un filmato finito, non di un'interazione.

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard filtered to models with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144 with 7,526 votes and $34.12 per minute, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns.

Il modello che esiste solo mentre stai parlando

Griffin è la forma opposta di sistema, e Tavus è insolitamente esplicito riguardo alla forma. Chiama Griffin il primo Human Interaction Model: un sistema video-to-video che osserva e ascolta un partecipante durante una conversazione e genera l'altro lato in tempo reale. L'architettura si divide in Continuous Conversational Modeling, che decide cosa dovrebbe fare la persona momento per momento, e Audio-Visual Generation, che trasmette in streaming il parlato e il volto corrispondenti. È full duplex, quindi può essere interrotto, e non ha bisogno di un segnale pulito di fine turno per rispondere.

Tutto nell'implementazione è ottimizzato per la prossima frazione di secondo piuttosto che per la prossima inquadratura. Il codec audio Tavec funziona a 48 kHz con 40 valori per frame a 100 frame al secondo, nessun codebook, un decoder completamente causale e pacchetti piccoli fino a 10 millisecondi. Il video viene trasmesso in streaming a 720p in blocchi da 320 millisecondi, un latente ogni otto frame a 25 fps, tre passaggi di diffusione per latente, con una compressione temporale 8× nel VAE. Una distillazione in tre fasi — distribution matching, poi autoregressivo con teacher forcing, poi self-forcing — è ciò che rende sostenibili in tempo reale tre passaggi di diffusione. La latenza da audio a video è in media di 0,43 secondi su H100, che secondo Tavus è circa la metà del secondo metodo più veloce che ha misurato. La clonazione vocale richiede un campione di circa dieci secondi.

E poi la frase che determina come pianificare di conseguenza: Tavus afferma che Griffin-Lite, l'anteprima di ricerca, è disponibile per un gruppo selezionato di primi tester, che Griffin-Lite non sarà disponibile per l'uso da parte dei clienti in questo momento, che seguirà un rilascio più ampio di un modello più potente e che Griffin non è ancora sulla piattaforma Tavus — arriverà una volta che l'azienda avrà capito come rilasciarlo in sicurezza.

Le affermazioni che ognuno fa, e quanto valgono

Le prove di Seedance 2.5 riguardano soprattutto la capacità: cosa può accettare, per quanto a lungo può funzionare, quanto costa. Le prove di Griffin riguardano soprattutto l'effetto. In uno studio con la Queen Mary University of London, Tavus riferisce che 26 partecipanti su 54 — il 48% — credevano che Griffin fosse una persona reale dopo una videochiamata di un minuto, contro 1 su 41 (2,4%) con il precedente stack Phoenix-4.5, Sparrow-2 e Raven-1, e chi dubitava di solito sospettava entro i primi venti secondi. Il benchmark VideoFDB di NVIDIA, valutato a settembre 2026, vede Griffin primo nell'IA faccia a faccia secondo il conteggio di Tavus: generazione 3,83 contro un 2,80 come migliore baseline riportata e 3,92 per un essere umano, percezione 3,73 contro 3,44 e 4,20, e un vantaggio del 37% rispetto al secondo miglior sistema nel reagire sul momento. Dati dichiarati dal fornitore, su un benchmark creato da NVIDIA — ma sono i punti di confronto umani quelli che contano.

Non esiste un test indipendente comparabile per «il pubblico ci ha creduto?» su Seedance 2.5, perché non è questo il suo scopo. I due modelli rispondono a domande diverse e nessuno dei due insiemi di numeri è trasferibile all'altro.

Cosa puoi davvero comprare

Seedance 2.5 è un prodotto con un listino prezzi. Sulla piattaforma ModelArk di ByteDance è prezzato a 10,70 $ per milione di token senza input video e a 6,40 $ per milione con esso, il che corrisponde a circa 0,51 $ per una clip di cinque secondi in 16:9 a 480p e a circa 1,16 $ per la stessa clip a 720p. L'accesso avviene tramite le app per consumatori di ByteDance e tramite l'API su Volcano Engine Ark in Cina e BytePlus ModelArk a livello internazionale. Almeno un distributore dichiara che non è disponibile negli Stati Uniti, e le fonti non concordano se la risoluzione massima sia 720p o 1080p — entrambe cose che vale la pena sapere prima di scriverle in una specifica.

Griffin non ha un listino, né un'API pubblica, né una data. Questo è l'intero criterio d'acquisto, e riduce la questione più di quanto ammetta la maggior parte degli articoli di confronto.

Board titled 'Seconds versus Sentences'. Seedance 2.5 card: what it reads a prompt plus up to 30 images, 10 video clips and 10 audio clips; what it returns up to 30 seconds of video in one pass; audio joint audio and video over 10 languages; latency batch generation, no real-time mode; price about $0.51 per five-second 480p clip on ModelArk; availability shipped 31 July 2026, live on ModelArk. Tavus Griffin card: what it reads the live participant, video and audio; what it returns the other side of the conversation in real time; audio streaming speech with a voice cloned from a ten-second sample; latency 0.43 s average audio to video on H100s; price none published; availability research preview, selected testers only.

Dove un router si guadagna il suo posto

Se stai costruendo qualcosa che ha bisogno di entrambe le cose — un agente che sostiene una conversazione e produce anche filmati finiti — ti trovi davanti a due fornitori, due console, due sistemi di fatturazione e due idee diverse di che cosa sia una richiesta. È proprio quella la giuntura in cui OrcaRouter è davvero utile anziché decorativo: una sola chiave su oltre duecento modelli, con i prezzi di listino dei provider passati a 0% di markup così che un taglio di prezzo di un fornitore arrivi sulla carta lo stesso giorno, failover automatico in modo che un provider saturo non diventi il tuo disservizio, e un DSL di routing per vincolare i job critici a uno specifico backend mentre le bozze vanno dove la capacità costa meno. Anche la fusione di modelli conta ai margini, qui — per un generatore con prezzo a token o al secondo, spendere per un modello di testo economico per affinare un prompt prima di spendere per la generazione costosa è di solito la voce con il rendimento più alto nella pipeline.

Per essere precisi sui due modelli nel titolo: né Seedance 2.5 né Griffin è una route di OrcaRouter. Seedance si raggiunge tramite le piattaforme proprietarie di ByteDance e distributori di terze parti; Griffin non è raggiungibile affatto. Ciò che il catalogo offre effettivamente sul versante video è minimax/minimax-h3, il generatore omnimodale di MiniMax, a 0,08 $ al secondo di output a 768P e 0,13 $ al secondo a 2K, venduto con le stesse unità al secondo di Seedance e disponibile ora.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Domande frequenti, in breve

Potrei eseguire Seedance 2.5 e Griffin nello stesso prodotto?A livello architetturale sì, ed è la suddivisione ovvia: Seedance per tutto ciò che può essere pre-renderizzato, Griffin per la superficie live. A livello commerciale no, perché Griffin non è ancora vendibile a te.

Griffin è solo un generatore di teste parlanti? No, e Tavus ci tiene a sottolineare la distinzione: un generatore di teste parlanti prende in input un testo e restituisce un video, mentre Griffin prende in input il video e l'audio del partecipante e viene valutato in base alla sua capacità di reagire sul momento.

Seedance 2.5 funziona in tempo reale? No. È un generatore in batch con un limite di trenta secondi e una modalità di estensione a più round; la latenza non è l'asse su cui compete.

Il risultato finale

Seedance 2.5 è un motore di produzione già rilasciato: trenta secondi in una singola passata, audio congiunto, fino a trenta immagini e dieci riferimenti video e audio, controllo a livello di timestamp e di regione, circa 0,51 $ per una clip di cinque secondi a 480p e circa 1,16 $ a 720p su ModelArk, disponibile ora tramite le piattaforme di ByteDance e non, per quanto sia stato possibile confermare, negli Stati Uniti. Tavus Griffin non è un prodotto: è un modello duplex di interazione umana i cui risultati pubblicati sono che il 48% dei partecipanti credeva che fosse umano in una chiamata di un minuto e una latenza media da audio a video di 0,43 secondi su H100s, e il cui fornitore ha dichiarato per iscritto che i clienti non possono ancora usarlo. Se ti servono filmati oggi, Seedance è la risposta e ha un prezzo pubblico. Se ti serve un volto che reagisca mentre parli, la risposta è che nessuno ne vende ancora uno.