
Tavus Griffin vs MiniMax H3: Un modello conversazionale duplex incontra un generatore video già rilasciato
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Tavus Griffin e MiniMax H3 mettono entrambi sullo schermo un essere umano in movimento che parla, e superata quella prima impressione, appartengono a malapena alla stessa categoria di prodotto. Griffin è un Modello di Interazione Umana — un sistema video-to-video progettato per sostenere una conversazione bidirezionale in tempo reale, annunciato da Tavus nell'ottobre 2026 e attualmente limitato a un gruppo selezionato di primi tester. MiniMax H3 è un generatore video omni-modale: gli si fornisce un prompt più riferimenti opzionali a immagini, video e audio e restituisce una clip finita. Uno viene valutato a porte chiuse; l'altro è scaricabile, licenziabile e fatturabile da mesi. Quella differenza — non la risoluzione o il frame rate — è ciò che decide quale dei due appartiene al tuo stack.
Cosa sia in realtà ognuno
Griffin è il tentativo di Tavus di costruire un modello che si comporti come un partecipante anziché come un renderer. L'azienda lo descrive come il primo Human Interaction Model, e l'architettura che ha pubblicato divide il compito in due: Continuous Conversational Modeling, che decide cosa dovrebbe fare il personaggio momento per momento, e Audio-Visual Generation, che trasmette in streaming il parlato e il volto corrispondenti. Cosa cruciale, è full duplex — osserva e ascolta mentre parla, quindi può essere interrotto, può reagire a metà enunciato e non attende un segnale netto di fine turno prima di rispondere. La stessa impostazione di Tavus è che i sistemi precedenti hanno imparato a generare volti; Griffin è stato costruito per apprendere il comportamento conversazionale dalle persone.
MiniMax H3 è la generazione Hailuo 3, pubblicata il 31 luglio 2026 e resa open source il 3 agosto 2026 secondo la MiniMax H3 Community License, con le varianti H3-Base-FL2VA e H3-Base-Ref2VA pubblicate apertamente. Legge riferimenti testuali, immagini, video e audio come un unico contesto unificato e restituisce una clip da 4 a 15 secondi a 768P o 2K con audio stereo nativo, generata tramite una pipeline a tre stadi (H3-Context-IR, poi H3-Base a 768p, poi H3-Regenerate-2K). È un generatore con una superficie di input insolitamente ampia e una licenza davvero permissiva — tutto ciò che Griffin attualmente non è.
Le specifiche, a confronto

Perché "duplex" è la parola interessante
Ogni generatore di video, H3 incluso, viene giudicato da come appare una clip una volta terminata. Griffin viene giudicato su qualcosa che una clip non può mostrare: ciò che accade nei 200 millisecondi successivi al momento in cui lo interrompi. È questo il problema a cui punta l'inquadramento dell'Human Interaction Model, ed è il motivo per cui i numeri di punta di Tavus sono comportamentali anziché visivi.
Il dato più citato è che il 48% delle persone credeva che Griffin fosse una persona reale dopo una videochiamata di un minuto — 26 su 54 partecipanti — contro il 2,4% del precedente stack di Tavus composto da Phoenix-4.5, Sparrow-2 e Raven-1, che è riuscito a convincere 1 su 41. Tavus riporta anche che le persone non convinte tendevano a sospettare entro i primi 20 secondi, un dettaglio più utile del titolo: significa che l'illusione o regge subito o crolla subito.
Il secondo insieme di numeri proviene dal benchmark VideoFDB di NVIDIA, con punteggio assegnato a settembre 2026, in cui Tavus afferma che Griffin si è classificato primo in un test indipendente sull'IA faccia a faccia. Sul fronte della generazione, Griffin ha ottenuto 3,83 contro 2,80 della baseline più forte riportata (una configurazione Gemini 2.5 più Anam), con un riferimento umano di 3,92 e un tasso di obiettivo del task del 62,8%. Sulla percezione ha ottenuto 3,73 contro 3,44 di MiniCPM-o 4.5, 3,17 di Gemini 2.5 Flash Native e 2,97 di una configurazione solo audio di OpenAI gpt-realtime, rispetto a un riferimento umano di 4,20 e a un tasso di obiettivo del task del 73,8%, su quindici modelli valutati. Tavus sostiene inoltre che Griffin sia in vantaggio del 37% rispetto al secondo miglior sistema nel reagire sul momento. Si tratta di cifre riportate dal fornitore, basate su un benchmark creato da NVIDIA, e vanno lette come tali — ma i punti di confronto umani sono quelli che vale la pena conservare, perché un 3,83 contro un punteggio umano di 3,92 è un divario molto più piccolo di quanto la generazione video abbia storicamente mostrato.
Cosa puoi comprare oggi
Qui i due modelli smettono del tutto di essere confrontabili.
MiniMax H3 è un prodotto. È ospitato, il prezzo è calcolato al secondo di output generato, e le sue varianti open sono su un hub di modelli in attesa di essere scaricate. Se vuoi una clip di quindici secondi, 2K, con audio stereo, di qualcosa che non esiste, puoi averla già questo pomeriggio, e puoi eseguire i pesi da solo se preferisci non noleggiarli.
Tavus Griffin non è un prodotto. Tavus dichiara esplicitamente nel documento su Griffin che Griffin-Lite, l'anteprima di ricerca, è disponibile oggi per un gruppo selezionato di primi tester, che seguirà un rilascio più ampio di un modello più potente, e che Griffin non è ancora sulla piattaforma Tavus e arriverà solo quando l'azienda avrà capito come rilasciarlo in sicurezza. È una quantità insolita di franchezza da parte di un fornitore riguardo al proprio risultato più eclatante, ed è importante per la pianificazione: non puoi inserire Griffin in una roadmap di prodotto come dipendenza, e non puoi attribuirgli un prezzo, perché non esiste.
Quindi la domanda di pianificazione onesta non è "quale sia migliore" ma "quale esiste al livello di cui ho bisogno".

Dove si inserisce OrcaRouter
MiniMax H3 è nel nostro catalogo. La pagina del modello si trova su minimax/minimax-h3, e viene fatturato nello stesso modo in cui lo fattura il fornitore: 0,08 $ al secondo di output generato a 768P e 0,13 $ al secondo a 2K. OrcaRouter trasferisce i prezzi di listino dei fornitori con 0% di markup, quindi una variazione di prezzo di MiniMax compare sulla nostra scheda lo stesso giorno in cui viene annunciata, anziché al ciclo di fatturazione successivo. Griffin non è nel catalogo e non lo sarà finché Tavus non lo renderà disponibile ai clienti — non ospitiamo un modello che non possiamo servire, e un'anteprima di ricerca limitata a tester selezionati non è qualcosa verso cui un router possa instradare.
La conseguenza pratica è che uno di questi due modelli dista una sola riga di codice dalla tua applicazione, mentre l'altro è un paper di ricerca con un numero di telefono. Se già instradi diversi modelli video e linguistici, la fatturazione al secondo di H3 lo rende anche il tipo di instradamento che vale la pena mettere dietro failover automatico: una richiesta che incontra un provider saturo viene ritentata su uno sano invece di restituire un timeout, e un DSL di routing ti consente di fissare i job in 2K a un provider specifico lasciando che le bozze in 768P finiscano dove la capacità costa meno. La fusione dei modelli è l'altra leva che vale la pena menzionare qui — il prezzo al secondo di H3 è abbastanza basso che usare un modello testuale per riscrivere e ritagliare un prompt prima della generazione costa spesso meno dei secondi sprecati da un primo tentativo andato male.

Dove il confronto potrebbe ribaltarsi
Tre cose cambierebbero questo confronto, e solo tre.
Innanzitutto, se Tavus mette Griffin su un'API commerciale con una tariffa pubblicata, l'intera impostazione "conversazione rispetto a clip" diventa una vera decisione di acquisto anziché una decisione di pianificazione, e il dato del 48% sulle interazioni faccia a faccia inizia a competere direttamente con la qualità dell'output generativo. In secondo luogo, se il discorso in tempo reale di H3 migliora — e MiniMax ha rilasciato con aggressività — un generatore al secondo in grado di fare streaming smorzerebbe il vantaggio principale di Griffin. In terzo luogo, se NVIDIA o un'altra parte neutrale riesegue VideoFDB includendo H3 o il suo successore, l'affermazione che Griffin è il primo nell'IA faccia a faccia smette di essere infalsificabile. Tavus afferma di prevedere di rilasciare Griffin molto presto, dopo che le preoccupazioni relative alla sua sicurezza saranno affrontate; quella frase è l'intera tempistica.
Il risultato finale
MiniMax H3 e Tavus Griffin non sono rivali al momento, perché solo uno dei due è acquistabile. H3 è un generatore omni-modale già rilasciato, a pesi aperti, con tariffazione al secondo, un prezzo pubblicato e una finestra di output da 4 a 15 secondi; Griffin è un modello conversazionale duplex con i migliori numeri faccia a faccia che chiunque abbia pubblicato, nessuna API, nessun prezzo e una dichiarazione esplicita del suo stesso fornitore secondo cui i clienti non possono ancora usarlo. Se ti serve la generazione video oggi, H3 è la risposta ed è misurabile in centesimi al secondo. Se ti serve un volto in tempo reale che possa essere interrotto, tieni d'occhio Tavus — ma costruisci prima il resto del prodotto, perché la data di rilascio è una frase, non una data.
