Card del titolo principale per 'Tavus Griffin vs MiniMax H3' con il sottotitolo 'Un modello conversazionale duplex incontra un generatore video già rilasciato', sopra quattro chip: Tavus Griffin anteprima di ricerca, solo per tester; MiniMax H3 pesi aperti, rilasciato; MiniMax H3 0,08 $/s a 768P; Griffin: nessuna API, nessun prezzo.
Guides & Insights

Tavus Griffin vs MiniMax H3: Un modello conversazionale duplex incontra un generatore video già rilasciato

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tavus Griffin e MiniMax H3 mettono entrambi sullo schermo un essere umano in movimento che parla, e superata quella prima impressione, appartengono a malapena alla stessa categoria di prodotto. Griffin è un Modello di Interazione Umana — un sistema video-to-video progettato per sostenere una conversazione bidirezionale in tempo reale, annunciato da Tavus nell'ottobre 2026 e attualmente limitato a un gruppo selezionato di primi tester. MiniMax H3 è un generatore video omni-modale: gli si fornisce un prompt più riferimenti opzionali a immagini, video e audio e restituisce una clip finita. Uno viene valutato a porte chiuse; l'altro è scaricabile, licenziabile e fatturabile da mesi. Quella differenza — non la risoluzione o il frame rate — è ciò che decide quale dei due appartiene al tuo stack.

Cosa sia in realtà ognuno

Griffin è il tentativo di Tavus di costruire un modello che si comporti come un partecipante anziché come un renderer. L'azienda lo descrive come il primo Human Interaction Model, e l'architettura che ha pubblicato divide il compito in due: Continuous Conversational Modeling, che decide cosa dovrebbe fare il personaggio momento per momento, e Audio-Visual Generation, che trasmette in streaming il parlato e il volto corrispondenti. Cosa cruciale, è full duplex — osserva e ascolta mentre parla, quindi può essere interrotto, può reagire a metà enunciato e non attende un segnale netto di fine turno prima di rispondere. La stessa impostazione di Tavus è che i sistemi precedenti hanno imparato a generare volti; Griffin è stato costruito per apprendere il comportamento conversazionale dalle persone.

MiniMax H3 è la generazione Hailuo 3, pubblicata il 31 luglio 2026 e resa open source il 3 agosto 2026 secondo la MiniMax H3 Community License, con le varianti H3-Base-FL2VA e H3-Base-Ref2VA pubblicate apertamente. Legge riferimenti testuali, immagini, video e audio come un unico contesto unificato e restituisce una clip da 4 a 15 secondi a 768P o 2K con audio stereo nativo, generata tramite una pipeline a tre stadi (H3-Context-IR, poi H3-Base a 768p, poi H3-Regenerate-2K). È un generatore con una superficie di input insolitamente ampia e una licenza davvero permissiva — tutto ciò che Griffin attualmente non è.

Le specifiche, a confronto

Two-card board titled 'One Is a Product'. Left card, MiniMax H3: omni-modal video generator, Hailuo 3 generation; released 31 July 2026 with open weights on 3 August 2026; 4 to 15 seconds at 768P or 2K with native stereo audio; text, image, video and audio inputs in one context; $0.08 per second at 768P and $0.13 at 2K; hosted and billable today. Right card, Tavus Griffin: duplex Human Interaction Model, video to video; announced October 2026 as a research preview; 720p at 25 fps in 320-millisecond chunks; the live participant's video and audio as input; no published price; selected testers only, not for customer use.

Perché "duplex" è la parola interessante

Ogni generatore di video, H3 incluso, viene giudicato da come appare una clip una volta terminata. Griffin viene giudicato su qualcosa che una clip non può mostrare: ciò che accade nei 200 millisecondi successivi al momento in cui lo interrompi. È questo il problema a cui punta l'inquadramento dell'Human Interaction Model, ed è il motivo per cui i numeri di punta di Tavus sono comportamentali anziché visivi.

Il dato più citato è che il 48% delle persone credeva che Griffin fosse una persona reale dopo una videochiamata di un minuto — 26 su 54 partecipanti — contro il 2,4% del precedente stack di Tavus composto da Phoenix-4.5, Sparrow-2 e Raven-1, che è riuscito a convincere 1 su 41. Tavus riporta anche che le persone non convinte tendevano a sospettare entro i primi 20 secondi, un dettaglio più utile del titolo: significa che l'illusione o regge subito o crolla subito.

Il secondo insieme di numeri proviene dal benchmark VideoFDB di NVIDIA, con punteggio assegnato a settembre 2026, in cui Tavus afferma che Griffin si è classificato primo in un test indipendente sull'IA faccia a faccia. Sul fronte della generazione, Griffin ha ottenuto 3,83 contro 2,80 della baseline più forte riportata (una configurazione Gemini 2.5 più Anam), con un riferimento umano di 3,92 e un tasso di obiettivo del task del 62,8%. Sulla percezione ha ottenuto 3,73 contro 3,44 di MiniCPM-o 4.5, 3,17 di Gemini 2.5 Flash Native e 2,97 di una configurazione solo audio di OpenAI gpt-realtime, rispetto a un riferimento umano di 4,20 e a un tasso di obiettivo del task del 73,8%, su quindici modelli valutati. Tavus sostiene inoltre che Griffin sia in vantaggio del 37% rispetto al secondo miglior sistema nel reagire sul momento. Si tratta di cifre riportate dal fornitore, basate su un benchmark creato da NVIDIA, e vanno lette come tali — ma i punti di confronto umani sono quelli che vale la pena conservare, perché un 3,83 contro un punteggio umano di 3,92 è un divario molto più piccolo di quanto la generazione video abbia storicamente mostrato.

Cosa puoi comprare oggi

Qui i due modelli smettono del tutto di essere confrontabili.

MiniMax H3 è un prodotto. È ospitato, il prezzo è calcolato al secondo di output generato, e le sue varianti open sono su un hub di modelli in attesa di essere scaricate. Se vuoi una clip di quindici secondi, 2K, con audio stereo, di qualcosa che non esiste, puoi averla già questo pomeriggio, e puoi eseguire i pesi da solo se preferisci non noleggiarli.

Tavus Griffin non è un prodotto. Tavus dichiara esplicitamente nel documento su Griffin che Griffin-Lite, l'anteprima di ricerca, è disponibile oggi per un gruppo selezionato di primi tester, che seguirà un rilascio più ampio di un modello più potente, e che Griffin non è ancora sulla piattaforma Tavus e arriverà solo quando l'azienda avrà capito come rilasciarlo in sicurezza. È una quantità insolita di franchezza da parte di un fornitore riguardo al proprio risultato più eclatante, ed è importante per la pianificazione: non puoi inserire Griffin in una roadmap di prodotto come dipendenza, e non puoi attribuirgli un prezzo, perché non esiste.

Quindi la domanda di pianificazione onesta non è "quale sia migliore" ma "quale esiste al livello di cui ho bisogno".

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard, the Overall board for text-to-video, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns. The board lists MiniMax H3 and MiniMax H3 Max fourth and fifth with audio, though the with-audio filter itself is not applied in this capture.

Dove si inserisce OrcaRouter

MiniMax H3 è nel nostro catalogo. La pagina del modello si trova su minimax/minimax-h3, e viene fatturato nello stesso modo in cui lo fattura il fornitore: 0,08 $ al secondo di output generato a 768P e 0,13 $ al secondo a 2K. OrcaRouter trasferisce i prezzi di listino dei fornitori con 0% di markup, quindi una variazione di prezzo di MiniMax compare sulla nostra scheda lo stesso giorno in cui viene annunciata, anziché al ciclo di fatturazione successivo. Griffin non è nel catalogo e non lo sarà finché Tavus non lo renderà disponibile ai clienti — non ospitiamo un modello che non possiamo servire, e un'anteprima di ricerca limitata a tester selezionati non è qualcosa verso cui un router possa instradare.

La conseguenza pratica è che uno di questi due modelli dista una sola riga di codice dalla tua applicazione, mentre l'altro è un paper di ricerca con un numero di telefono. Se già instradi diversi modelli video e linguistici, la fatturazione al secondo di H3 lo rende anche il tipo di instradamento che vale la pena mettere dietro failover automatico: una richiesta che incontra un provider saturo viene ritentata su uno sano invece di restituire un timeout, e un DSL di routing ti consente di fissare i job in 2K a un provider specifico lasciando che le bozze in 768P finiscano dove la capacità costa meno. La fusione dei modelli è l'altra leva che vale la pena menzionare qui — il prezzo al secondo di H3 è abbastanza basso che usare un modello testuale per riscrivere e ritagliare un prompt prima della generazione costa spesso meno dei secondi sprecati da un primo tentativo andato male.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Dove il confronto potrebbe ribaltarsi

Tre cose cambierebbero questo confronto, e solo tre.

Innanzitutto, se Tavus mette Griffin su un'API commerciale con una tariffa pubblicata, l'intera impostazione "conversazione rispetto a clip" diventa una vera decisione di acquisto anziché una decisione di pianificazione, e il dato del 48% sulle interazioni faccia a faccia inizia a competere direttamente con la qualità dell'output generativo. In secondo luogo, se il discorso in tempo reale di H3 migliora — e MiniMax ha rilasciato con aggressività — un generatore al secondo in grado di fare streaming smorzerebbe il vantaggio principale di Griffin. In terzo luogo, se NVIDIA o un'altra parte neutrale riesegue VideoFDB includendo H3 o il suo successore, l'affermazione che Griffin è il primo nell'IA faccia a faccia smette di essere infalsificabile. Tavus afferma di prevedere di rilasciare Griffin molto presto, dopo che le preoccupazioni relative alla sua sicurezza saranno affrontate; quella frase è l'intera tempistica.

Il risultato finale

MiniMax H3 e Tavus Griffin non sono rivali al momento, perché solo uno dei due è acquistabile. H3 è un generatore omni-modale già rilasciato, a pesi aperti, con tariffazione al secondo, un prezzo pubblicato e una finestra di output da 4 a 15 secondi; Griffin è un modello conversazionale duplex con i migliori numeri faccia a faccia che chiunque abbia pubblicato, nessuna API, nessun prezzo e una dichiarazione esplicita del suo stesso fornitore secondo cui i clienti non possono ancora usarlo. Se ti serve la generazione video oggi, H3 è la risposta ed è misurabile in centesimi al secondo. Se ti serve un volto in tempo reale che possa essere interrotto, tieni d'occhio Tavus — ma costruisci prima il resto del prodotto, perché la data di rilascio è una frase, non una data.