
Tavus Griffin vs HeyGen Video 1: Trentasei ore di distanza, e solo uno è acquistabile
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Due lanci sono arrivati a trentasei ore di distanza l'uno dall'altro nello stesso angolo del mercato, e il calendario è la cosa più interessante dell'abbinamento. HeyGen Video è andato live il 30 settembre 2026 a 0,01 $ al secondo fino a ottobre, messo a punto a partire da MiniMax H3 e distribuito con l'identificatore heygen-video-1. Tavus Griffin è stato annunciato il 1° ottobre 2026 con uno studio dal vivo faccia a faccia in cui 26 dei 54 partecipanti credevano che il proprio interlocutore fosse una persona reale, ed è disponibile solo per alcuni tester fidati selezionati, dietro un modulo di richiesta, senza identificatore, senza endpoint e senza prezzo. Entrambi riguardano la generazione di un essere umano convincente. La ragione onesta per confrontare Tavus Griffin e HeyGen Video 1 non è che un acquirente sceglierebbe tra i due — oggi solo uno dei due si può comprare — ma che la differenza spiega a cosa è stato costruito ciascuno, e quanto vale davvero un secondo di umano generato.
Uno vende una clip, l'altro vende una conversazione
HeyGen Video è un modello video generico che risulta essere insolitamente bravo con le persone. Prende un prompt, o un prompt più un'immagine, o un prompt più fino a nove immagini di riferimento, tre video di riferimento e tre clip audio di riferimento, e restituisce una clip lunga tra 5 e 15 secondi a 480p o 768p, 24 fps, con audio AAC a 32 kHz stereo che trasporta dialoghi generati, ambiente ed effetti. Tre modalità coprono il condizionamento — text_to_video, image_to_video, e reference_to_video, che è quella predefinita — e l'ordine dell'elenco diventa l'etichetta a cui ci si rivolge nel prompt, quindi la prima voce di reference_images è <Picture 1>. I campi sconosciuti nella richiesta vengono rifiutati anziché ignorati, e un seed è un intero senza segno a 32 bit che rende ripetibile un'inquadratura quando lo si mantiene fisso e si cambia una clausola alla volta. È uno strumento di produzione con un involucro deterministico.
Griffin inverte quasi tutte quelle proprietà. Genera 720p in blocchi da 320 ms a 25 fps da una singola fotografia di riferimento e riproduce ogni blocco mentre lo decodifica, quindi non c'è alcuna durata della clip da specificare e nessun file da restituire. Un motore di Continuous Conversational Modeling acquisisce audio e video e rivaluta lo scambio a intervalli inferiori al secondo, scegliendo se rimanere in silenzio, segnalare, fare backchannel o prendere il turno, e i suoi controlli espressivi guidano in parallelo un generatore di parlato in streaming e un generatore video in streaming. Una decisione presa a metà frase si manifesta nella voce e sul volto nello stesso mini-turno. Non si scrive un prompt; gli si parla, e risponde a una pausa, a uno sguardo distolto o a un'interruzione.
Ecco perché i due non sono sostituti anche se entrambi generano un essere umano. A HeyGen Video viene chiesto come appare un momento descritto. A Griffin viene chiesto cosa dovrebbe accadere dopo.
Quanto costa ogni secondo, su quello dove puoi comprare secondi
Il prezzo di lancio di HeyGen Video è di 0,01 $ al secondo fino alla fine di ottobre, e il testo descrittivo di HeyGen lo presenta come uno sconto del 50% rispetto a un prezzo standard di 0,02 $. Il grafico dei costi sulla stessa pagina, con nota a piè di pagina che lo indica come prezzo di listino al secondo a 768p con audio prima delle promozioni di lancio, lo colloca a 0,03 $. Si tratta di un divario del 50% tra il testo descrittivo e il grafico nel materiale di lancio dello stesso fornitore, e finché HeyGen non pubblicherà una pagina di prezzi API, l'interpretazione prudente è che 0,01 $ sia confermato perché è in vigore, e che la cifra successiva a ottobre sia compresa tra 0,02 $ e 0,03 $.
Fai i calcoli per mille secondi — cento clip da dieci secondi — che è l'unità in cui un team bulk ragiona davvero:
• HeyGen Video in ottobre — $10 a $0,01 al secondo.
• Video HeyGen dopo ottobre — $20 a $0.02, oppure $30 al $0.03 del grafico.
• MiniMax H3, il modello base da cui è stato messo a punto — 80 $ al prezzo di listino di MiniMax di 0,08 $ al secondo.
• Kling 3.0 Pro — $168 a $0.168 al secondo.
• Veo 3.1 — 400 $ a 0,40 $ al secondo.
Il motivo per cui l'aritmetica è il titolo del lancio di HeyGen è il tasso di scarto. I team che realizzano cutdown per i social, varianti pubblicitarie e loop di prodotto generano molto più di quanto pubblicano, e a dieci centesimi per tentativo da dieci secondi l'economia del buttare via i candidati cambia forma del tutto. Il problema è il tetto: 768p a 24 fps non è un formato di consegna 2K, e MiniMax H3 raggiunge il 2K tramite un modulo di rigenerazione separato sull'API ospitata di MiniMax a 0,13 $ al secondo, senza un equivalente su HeyGen Video. Se il tuo target di consegna è superiore a 768p, il secondo economico non è il secondo di cui hai bisogno.
La colonna di Griffin in quell'elenco è vuota, e non in modo promettente. Tavus non ha pubblicato una tariffa, perché Griffin-Lite è un'anteprima di ricerca che, come afferma il suo stesso annuncio, al momento non sarà disponibile per l'uso da parte dei clienti e non è sulla piattaforma Tavus. Con un modello a mille secondi non c'è nulla da inserire. Chiunque citi una cifra per Griffin se la sta inventando.
I numeri della qualità, e chi è
Nessuno di questi due modelli dispone di un punteggio indipendente, cosa che vale la pena precisare fin dall'inizio, dato che entrambi i fornitori presentano dei grafici.
Quella di HeyGen è una tabella Elo con HeyGen Video normalizzato a 1000, poi Dreamina Seedance 2.0 a 955, la famiglia H3 Max che si estende da 952 fino a 860, Kling 3.0 Pro a 857 e Veo 3.1 a 744. La nota a piè di pagina fa gran parte del lavoro: i punteggi provengono da un set di valutazione interno di query dell'Artificial Analysis Arena con 4.800 voti, e il punteggio di HeyGen stesso è normalizzato a 1000 per rendere più semplice il confronto. Un fornitore che normalizza se stesso in cima al proprio grafico è una scelta di presentazione, non una prova che sia in testa. La parte informativa è la spaziatura relativa al di sotto.
Più utile è il confronto diretto, che è l'unico punto in cui HeyGen si misura con qualcosa che non ha sviluppato. HeyGen afferma che i tester in cieco hanno preferito il suo modello all'H3 Max post-train riportato nel grafico nel 55,8% dei confronti su 650 voti, con un intervallo del 49–62%. Quell'intervallo è il dettaglio onesto: all'estremo inferiore è a cavallo del 50%, quindi secondo i numeri dello stesso fornitore la preferenza rispetto a quel rivale non è chiaramente separata dal rumore. La ripartizione per asse è mista in un modo che somiglia a un profilo di errore specifico — 65% sulla fedeltà all'immagine di origine e 66% sul timing, contro 43% sulla coerenza e 45% sulla musica.
I numeri di Griffin provengono da uno strumento costruito da qualcun altro, ed è questa la differenza che conta. VideoFDB di NVIDIA è un benchmark per conversazioni audiovisive full-duplex, valutato su due tracce, e NVIDIA lo ha creato e conduce la valutazione con un proprio giudice secondo una rubrica pubblicata. Griffin-Lite ha ottenuto 3,83 su 5 nella generazione rispetto a un riferimento umano di 3,92 e 2,80 per il secondo sistema pubblicato per punteggio più alto, e 3,73 nella percezione rispetto a un riferimento umano di 4,20. Tavus riporta inoltre 0,43 secondi di latenza reale da audio a video per il generatore rispetto a quattro baseline pubblicate di diffusione in streaming su H100. Le avvertenze restano valide — un divario di 0,09 punti dall'umano su una rubrica a cinque punti giudicata da un modello linguistico è "vicino", non "uguale", e parte del vantaggio nella percezione è misurato rispetto a sistemi che funzionano senza input video — ma il valutatore non è il fornitore.
• Punteggi di qualità indipendenti — nessuno dei due ne ha. HeyGen Video non compare in nessuna delle tre classifiche video di Artificial Analysis al 2 ottobre 2026, e nemmeno Griffin. Griffin potrebbe non comparirvi mai: la votazione di preferenza a coppie su clip brevi non può valutare una conversazione dal vivo.
Le stesse classifiche contengono effettivamente il modello base. MiniMax H3 si colloca 4º nel text-to-video (con audio) con un Elo di 1.139 e 2º nell'image-to-video con 1.181, entrambi a $4,80/min — quindi il post-training di HeyGen compete su un substrato che un'arena indipendente valuta già ai vertici, che è l'argomento più forte a suo favore che HeyGen non ha pubblicato essa stessa.

Entrambi sono economici o non hanno prezzo per lo stesso motivo.
Il fatto strutturale alla base di entrambi i lanci è che produrre un umano convincente è diventato economico, e il vantaggio di costo di nessuna delle due aziende deriva da ciò che vende.
HeyGen Video è un post-training di MiniMax H3, che MiniMax ha rilasciato con pesi disponibili secondo la propria licenza community. Ciò ha trasformato H3 in un substrato che altre aziende possono specializzare e rivendere, e HeyGen è il secondo prodotto a farlo in cinque settimane per un verticale diverso — video aziendali, demo di prodotto, formazione, tour immobiliari. Il pattern è il motivo per cui HeyGen può prezzare al di sotto della base: non si sta facendo carico del costo del modello base, e la base è il rilascio open-weights di qualcun altro.
Griffin è la scommessa opposta. Tavus ha costruito l'intero sistema — il codec, il generatore vocale in streaming, il generatore video in streaming, il modello conversazionale — attorno all'interazione stessa, distillando un grande teacher diffusion bidirezionale in un generatore autoregressivo a pochi passaggi in tre fasi, così che i rollout lunghi non vadano alla deriva. Si tratta di ricerca costosa senza una base aperta su cui appoggiarsi, ed è una parte plausibile del motivo per cui il rilascio è ad accesso limitato: non c'è un substrato economico sotto di esso da ammortizzare.
Anche le due aziende arrivano allo stesso scomodo punto da direzioni diverse. La documentazione di HeyGen stessa elenca ciò in cui il modello è peggiore, cosa rara e che vale la pena leggere: testo lungo a schermo, movimento organico morbido come petali, carta e capelli, e lavoro ravvicinato con le mani, come assemblare o azionare attrezzature. Dà il meglio di sé in inquadrature brevi e contenute — un soggetto, un luogo, un'azione, una camera fissa o quasi immobile. La limitazione di Griffin non è un elenco di modalità di fallimento, ma un problema di sicurezza irrisolto: Tavus afferma chiaramente che le proprietà che rendono un modello di interazione con gli esseri umani un'interfaccia migliore lo rendono anche migliore nel persuadere qualcuno che sta parlando con un essere umano, e che sta trattenendo l'anteprima mentre sviluppa meccanismi di divulgazione.
Cosa può effettivamente fare oggi un acquirente
HeyGen Video è ora invocabile. Funziona su POST /v3/models/videos con un x-api-key header, solo su chiavi API a pagamento, con link di download firmati e che scadono — quindi il polling li aggiorna — e callback tentate una sola volta per job, che HeyGen stesso ti dice di considerare un'ottimizzazione della latenza anziché una garanzia. Se lo stai testando questo mese, il secondo promozionale da $0,01 è attivo, il tetto di output è 768p, e la modalità di miglioramento del prompt è una vera leva di costo: turbo per impostazione predefinita, quality per una passata più lunga, disabilitata per inviare il tuo testo inalterato.
Griffin non è invocabile. L'accesso è un modulo di richiesta e un'anteprima di ricerca. Non esiste alcuna chiave, alcun identificatore, alcun endpoint e alcun SLA, e l'unica dichiarazione pubblicata sulla disponibilità è che arriverà una volta che Tavus avrà capito come rilasciarlo in sicurezza.
Una cosa che entrambi hanno in comune è che nessuno dei due è un modello che un router può aiutarti a raggiungere, e nel caso di Griffin si tratta di un problema di categoria, non temporaneo — una sessione full-duplex in tempo reale non è una chiamata request-response. Ciò con cui un router aiuta in entrambe le pipeline è lo strato attorno al video. L'espansione dei prompt, l'inventario delle immagini di riferimento, le descrizioni delle inquadrature, la generazione di didascalie e la sintesi delle revisioni sono tutte chiamate testuali, e quelle di OpenAI, Google e gli altri si trovano sul catalogo OrcaRouter dietro un unico endpoint compatibile con OpenAI, con oltre 200 modelli sulla stessa chiave, al prezzo di listino del provider con 0% di ricarico aggiunto, così una variazione di prezzo del provider è live lo stesso giorno. Per quanto riguarda il modello video in sé, c'è un fatto utile: MiniMax H3 — la base da cui è stato messo a punto HeyGen Video, e ciò il cui prezzo al secondo viene battuto dallo $0.01 di HeyGen — è instradato qui come minimax/minimax-h3 a $0.08 al secondo, con il 2K a $0.13. HeyGen Video stesso non è nel nostro catalogo e nemmeno Griffin; entrambi sono serviti tramite le API dei rispettivi fornitori e diverse piattaforme di terze parti.

Quale, e per chi?
• Usa HeyGen Video se il prodotto finale è un filmato breve, contenuto, incentrato sulla persona, con audio integrato e se puoi accontentarti di 768p a 24 fps. Prevedi in budget la tariffa post-ottobre tra $0,02 e $0,03 al secondo invece della tariffa promozionale di dieci centesimi, e testa a fondo testo lungo a schermo e lavoro ravvicinato con le mani prima di dedicare un flusso di lavoro ad esso, perché HeyGen ti ha già detto che sono i punti in cui si rompe.
• Non pianificare su Griffin. Richiedi l'accesso se la tua domanda è se una persona può distinguere un umano generato da uno reale in una chiamata di un minuto, oppure se devi vedere dove si sta dirigendo uno strato di interazione in tempo reale prima di impegnare una roadmap su clip renderizzate.
• Tieni d'occhio la questione della divulgazione, perché è l'unica cosa che smuoverà entrambe. I clienti di HeyGen Video hanno a disposizione una risposta semplice — il modello è un post-addestramento di una base open-weights e l'output è un file con una provenienza nota — mentre Tavus trattiene un modello proprio perché non ne ha ancora uno. Qualunque azienda pubblichi il miglior meccanismo di divulgazione avrà risolto il problema più prezioso.

