
Tavus Griffin vs Muse Realtime Avatar: due volti del 2026, due problemi diversi
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Sia Tavus Griffin che Muse Realtime Avatar esistono per risolvere lo stesso imbarazzante problema — un modello linguistico che sa parlare ma non ha un volto — e lo affrontano da estremità opposte. Griffin è un Human Interaction Model video-to-video che osserva un partecipante attraverso una telecamera e genera l'altro lato della conversazione in tempo reale, ed è stato annunciato da Tavus in ottobre 2026 come anteprima di ricerca per tester selezionati. Muse Realtime Avatar è il livello di incarnazione di Meta per il suo agente Muse, annunciato al Meta Connect il 23 settembre 2026, e prende l'audio e lo trasforma in un ritratto parlante sincronizzato. Nessuno dei due può essere acquistato. La differenza sta in ciò che ciascuno cerca di fare bene, e si manifesta nel momento in cui ti chiedi cosa stia effettivamente ricevendo in input ciascun modello.
La versione breve
• L'input di Griffin è la persona dall'altra parte — video e audio di un partecipante in diretta, che deve leggere, a cui deve rispondere e da cui deve essere interrotto.
• L'input di Muse Realtime Avatar è il parlato dell'agente stesso — un flusso di token da Muse Realtime Voice che converte in un volto corrispondente.
• Tavus misura Griffin in base al fatto che le persone ci credano, e pubblica un dato del 48% da una videochiamata di un minuto.
Meta valuta Muse Realtime Avatar in base alla sua capacità di stare al passo e pubblica 870 millisecondi dalla fine del turno al primo byte.
• Nessuno dei due dispone di un'API pubblica, di un prezzo pubblicato o di una data di disponibilità generale.
Leggi insieme quelle quattro righe e la forma del disaccordo è evidente. Tavus sta ottimizzando per la credenza dell'altra persona. Meta sta ottimizzando per il tempo.

Griffin: il modello a cui si deve credere
Secondo l'impostazione di Tavus, Griffin è il primo Human Interaction Model, e l'architettura alla base di questa affermazione è un sistema in due parti che combina Continuous Conversational Modeling con Audio-Visual Generation. La prima parte è comportamentale: decide cosa dovrebbe fare la persona da un momento all'altro, in base a ciò che riesce a vedere e sentire. La seconda parte è il rendering, e Tavus la divide a sua volta in generazione vocale in streaming e generazione video in streaming.
I numeri che Tavus mette in evidenza non sono numeri di throughput. In uno studio condotto dall'azienda con la Queen Mary University of London, 26 dei 54 partecipanti — il 48% — hanno creduto che Griffin fosse una persona reale dopo una videochiamata di un minuto, contro 1 su 41 (2,4%) per il suo precedente stack composto da Phoenix-4.5 per la generazione del volto, Sparrow-2 per l'alternanza dei turni e Raven-1 per la visione. I partecipanti che non sono stati ingannati di solito hanno iniziato a dubitare entro i primi 20 secondi. Sul benchmark VideoFDB di NVIDIA, valutato a settembre 2026, Tavus riporta Griffin al primo posto nell'IA faccia a faccia con un punteggio di generazione di 3,83 rispetto a una baseline più forte riportata di 2,80 e a un riferimento umano di 3,92, e un punteggio di percezione di 3,73 rispetto a 3,44 per la migliore baseline riportata e a un riferimento umano di 4,20. Questi dati sono riportati dal fornitore e specifici del benchmark, ma i punti di confronto umani sono quelli interessanti.
L'ingegneria alla base di quei numeri è un codec chiamato Tavec e un transformer diffusion autoregressivo. Tavec funziona a 48 kHz con 40 valori per frame a 100 frame al secondo, senza codebook, un decoder completamente causale e pacchetti piccoli fino a 10 millisecondi — progettato in modo che un volto possa iniziare a muoversi prima che una frase sia terminata. Il percorso video spinge 720p in blocchi da 320 millisecondi, dove un latente equivale a otto frame a 25 fps, tre passi di diffusione per latente e una compressione temporale 8× nel VAE. Un processo di distillazione in tre fasi (distribution matching, poi autoregressivo con teacher-forcing, poi self-forcing) è ciò che gli permette di eseguire quei tre passi in tempo reale. La latenza dichiarata di punta è una media di 0,43 secondi dall'audio al video su H100, che secondo Tavus è circa la metà del secondo metodo più veloce che ha misurato. La clonazione vocale richiede all'incirca un campione di 10 secondi.
Il prezzo di tutto questo è che Tavus non può distribuirlo. Griffin-Lite, l'anteprima di ricerca, è disponibile solo per un gruppo selezionato di primi tester; in una nota sul rilascio, l'azienda dichiara chiaramente che Griffin-Lite non sarà disponibile per l'uso da parte dei clienti al momento e che prevede di rilasciare Griffin molto presto, una volta affrontate alcune preoccupazioni relative alla sicurezza. Griffin non è sulla piattaforma Tavus e vi arriverà «una volta che avremo capito come rilasciarlo in sicurezza». Un modello che è convincente nel 48% dei casi in una chiamata di un minuto è, dal punto di vista del deployment, un modello che è convincente nel 48% dei casi in una chiamata di un minuto.

Muse Realtime Avatar: il modello che deve tenere il passo
Muse Realtime Avatar è stato annunciato il 23 settembre 2026 al Meta Connect e descritto lo stesso giorno da Meta Superintelligence Labs con il titolo "Dare vita alla tua Muse". L'impostazione di Meta è più ristretta e più meccanica di quella di Tavus: l'agente Muse aveva già una voce, grazie a Muse Realtime Voice, e l'avatar è lo strato che dà un corpo a quella voce.
La cifra pubblicata è di 870 millisecondi dalla fine del turno al primo byte, cioè dal momento in cui l'utente smette di parlare al momento in cui è pronto il primo byte video dell'avatar. L'avatar renderizza un ritratto 448×768 a 25 fotogrammi al secondo. Meta afferma che il sistema esegue circa 60× meno valutazioni per chunk rispetto alla sua baseline, e che un singolo NVIDIA GB200 può gestire 12 sessioni in tempo reale simultanee con un guadagno di capacità di 8× rispetto a un'implementazione BF16 a due passaggi.
La differenza architetturale rispetto a Griffin sta nella provenienza delle informazioni. Muse Realtime Avatar estende Muse Realtime Voice e condivide il suo flusso di token vocali — la stessa rappresentazione VQ che il modello vocale produce è ciò che guida il volto, anziché una comprensione visiva separata di un partecipante. Ciò lo rende uno strato di incarnazione DiT guidato dall'audio: efficiente, strettamente accoppiato al proprio modello vocale, e che non tenta affatto di leggere l'essere umano all'altro capo della chiamata. È una bocca e un volto per un agente, non un partner conversazionale che ti osserva.
Meta non ha pubblicato né un'API, né un prezzo, né una data di uscita per Muse Realtime Avatar. Il post di ricerca costituisce l'intero documento pubblico.
Dove i due progetti divergono realmente
Il modo più chiaro per vedere la divisione è chiedere cosa succede quando l'utente interrompe.
Griffin è full duplex ed è progettato per essere interrotto a metà discorso — può guardare e ascoltare mentre parla, ed è per questo che il marketing di Tavus punta sull'idea che Griffin impari il comportamento conversazionale anziché il video. È anche per questo che la sua suite di benchmark è incentrata sulla percezione e sulla reazione, e che il vantaggio del 37% rispetto al secondo miglior sistema nel reagire sul momento è un'affermazione che l'azienda si prende la briga di fare.
Il numero di 870 millisecondi di fine turno di Muse Realtime Avatar racconta la storia opposta: è una pipeline in cui il turno termina, i token audio si risolvono e poi il volto si allinea. È veloce — 870 ms è un buon valore per un renderer di ritratti — ma la misura stessa presuppone che esista un confine di turno, che è esattamente il presupposto che un modello duplex è progettato per buttare via.
Non è una critica a nessuno dei due design. Meta sta costruendo un volto per un agente che vive all'interno delle superfici del proprio assistente, dove un confine di turno netto è un modello ragionevole dell'interazione. Tavus sta costruendo qualcosa che deve sopravvivere a uno sconosciuto che, in venti secondi, decide se la persona sullo schermo è reale.
Nessuno dei due è in un listino prezzi — e solo una parte di Muse è richiamabile
Né Tavus Griffin né Muse Realtime Avatar possono essere messi in produzione oggi. Griffin è limitato a tester selezionati; Muse Realtime Avatar non ha API, né prezzo né data. Se stai pianificando una build, entrambe queste informazioni devono rientrare nel piano.
Ciò che vale la pena segnalare è la parte dello stack Muse che è raggiungibile. La famiglia Muse di Meta include Muse Spark, e un suo checkpoint — meta/muse-spark-1.2 — è attivo sul nostro catalogo a $1.25 per milione di token di input e $4.25 per milione di token di output con zero ricarico sul prezzo di listino di Meta. Non è l'avatar: accetta input di testo, immagini, video, audio e PDF e restituisce testo, con una finestra di contesto di 1M token e sforzo di ragionamento configurabile. Ma è la parte della linea Muse che puoi effettivamente chiamare, e se stai costruendo l'agente che un giorno siederà dietro un avatar, la metà linguistica è la metà da cui puoi iniziare. OrcaRouter trasmette i prezzi di listino dei provider con uno markup dello 0%, quindi una variazione di prezzo di Meta viene riflessa sulla nostra scheda lo stesso giorno anziché nel ciclo di fatturazione successivo, e una richiesta che fallisce su un provider viene ritentata su un provider sano invece di manifestarsi come timeout.

La stessa logica vale per il lato video del mondo. Non instradiamo Muse Realtime Avatar e non instradiamo Tavus Griffin, e non affermeremo il contrario. Ciò che instradiamo è un catalogo di oltre duecento modelli nelle stesse modalità, così un prototipo che passa tra un agente testuale, un modello vocale e un generatore video resta su una sola chiave mentre i due modelli in questo articolo rimangono non rilasciati.
Qual è quello più lontano dalla spedizione?
Secondo le informazioni pubbliche, Muse Realtime Avatar è più lontano. Ha un post di ricerca e nessuna API, nessun prezzo e nessuna data. Anche Griffin non ha API né prezzo, ma ha un'esplicita intenzione di rilascio — "molto presto dopo che queste preoccupazioni per la sicurezza saranno state affrontate" — un livello di anteprima denominato che esiste oggi per tester selezionati, e una serie di risultati di benchmark pubblicati da un sistema di test indipendente. Questa è una posizione più avanzata, anche se comporta l'ammissione che il modello non è abbastanza sicuro da essere consegnato ai clienti.
Il tranello nel confrontarli è trattare il dato di 870 millisecondi come direttamente comparabile a quello di 0,43 secondi. Misurano cose diverse: Meta misura dalla fine di un turno al primo byte di un ritratto, e Tavus misura la latenza audio-video all'interno di un flusso duplex continuo in cui i turni non sono eventi netti. I numeri sono entrambi reali e non sono la stessa misurazione, e chiunque li presenti in un'unica colonna rende un cattivo servizio al lettore.
Il risultato finale
Muse Realtime Avatar è uno strato di incarnazione: audio in ingresso, ritratto in uscita, 870 millisecondi dalla fine del turno al primo byte, 448×768 a 25 fps, nessuna API e nessuna data. Tavus Griffin è un modello di interazione umana duplex: il partecipante in ingresso, un volto che reagisce in uscita, 0,43 secondi di latenza media da audio a video su H100, e un fornitore disposto a pubblicare che il 48% delle persone lo riteneva umano mentre dichiara anche che i clienti non possono usarlo. Meta sta costruendo qualcosa che tiene il passo. Tavus sta costruendo qualcosa che passa. Nessuno dei due è acquistabile, il che significa che l'unica decisione disponibile oggi è da quale metà del problema iniziare — e per la maggior parte dei team, quella metà è il modello linguistico che sta sotto.
