
Muse Realtime Avatar vs Gemini 3.8 Live: un volto contro una linea vocale
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 180 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Questi due non sono intercambiabili, e il modo più rapido per rendersene conto è chiedersi cosa restituisce ciascuno. Muse Realtime Avatar, annunciato da Meta il 23 settembre 2026, restituisce video sincronizzato di un personaggio che parla — tu fornisci un'immagine di riferimento e lui renderizza quella cosa che parla e gesticola in fotogrammi verticali da 448×768. Gemini 3.8 Live, annunciato da Google il 15 settembre 2026 e reso generalmente disponibile agli sviluppatori lo stesso giorno, restituisce audio e testo. Non ha alcun output video. Metterli nella stessa comparazione non è un errore — i due competono per la stessa superficie conversazionale, e gli acquirenti stanno già chiedendo su quale dei due costruire — ma la decisione non è "quale sia migliore". È "quale dei due prodotti diversi mi serve", e quasi ogni confronto pubblicato della coppia sbaglia proprio questo, allineando benchmark che misurano cose diverse.
Ecco l'asimmetria che dovrebbe fare da cornice a tutto ciò che segue. Puoi chiamare Gemini 3.8 Live oggi, da un terminale, con una chiave. Non puoi chiamare Muse Realtime Avatar affatto — nessuna API, nessun prezzo, nessuna data. Meta l'ha dimostrato al Connect e ha pubblicato un post di ricerca; Google ha pubblicato un listino prezzi e un ID modello. Questo è un confronto tra un prodotto e un annuncio, e significa che la domanda utile non è quale dei due vince, ma a cosa ciascuno ti impegna.
Che cosa produce effettivamente ciascuno
Questo è l'intero confronto in sei righe, e nessuna delle sei si avvicina.
• Output — Muse Realtime Avatar restituisce voce e video ritratto sincronizzati, generati insieme da un unico flusso di token vocali; Gemini 3.8 Live restituisce audio e testo, senza alcuna generazione video all'interno del modello.
• Accesso per sviluppatori — Muse Realtime Avatar non ne ha: è stato annunciato il 23 settembre 2026 come funzionalità dell'agente Muse di Meta, senza API, senza endpoint e senza una data dichiarata. Gemini 3.8 Live è disponibile nell'API Gemini e in Google AI Studio dal 15 settembre 2026, con due ID modello, gemini-3.8-live e gemini-3.8-live-extended-thinking.
• Prezzo — Muse Realtime Avatar non ha un prezzo pubblicato perché non c'è nulla da acquistare. Gemini 3.8 Live pubblica $0,005 al minuto per l'input audio e $0,018 al minuto per l'output audio tramite la Live API.
• Valutazione indipendente — Muse Realtime Avatar non ne ha alcuna; i suoi dati sono quelli di Meta stessa, misurati rispetto a baseline scelte da Meta. Gemini 3.8 Live riporta 76,0 sull'Artificial Analysis Speech to Speech Index, con la variante extended-thinking a 82,6 — un dato di terze parti, che rappresenta una classe di prove diversa.
• Latenza — i due valori pubblicati non corrispondono alla stessa misurazione, ed è qui che la maggior parte degli articoli sbaglia. Meta dichiara 870 ms dalla fine del tuo turno al primo byte di una risposta sincronizzata voce e video. Il numero di Google, misurato da Artificial Analysis, è di 1,18 secondi al primo audio per il modello standard e 1,35 secondi per la variante di ragionamento.
• Frame e lingua — Muse Realtime Avatar esegue il rendering di video verticale 448×768 a 25 fotogrammi al secondo. Gemini 3.8 Live gestisce il passaggio automatico a metà conversazione tra 97 lingue supportate ed elabora input visivi quasi in tempo reale.
Quell'ultima riga contiene la distinzione che le persone continuano ad appiattire. Gemini 3.8 Live può vedere. Non può mostrare. Muse Realtime Avatar può mostrare. Se possa vedere non è ciò di cui parla il post di Meta — è un generatore guidato dall'audio, condizionato da token vocali e da un'immagine di riferimento, e il suo compito è produrre un volto anziché leggerlo.

I numeri sulla latenza non sono comparabili, e il divario è più piccolo di quanto sembri.
870 ms contro 1,18 secondi sembra indicare che Meta sia il 26% più veloce. Leggi le misurazioni e il confronto svanisce. Il dato di Meta è il tempo dalla fine del turno dell'utente al primo byte di una risposta che include video — e il post di Meta è esplicito: si tratta di una misura del primo byte, non del tempo necessario a una risposta completa né della latenza di consegna continua per il resto della chiamata. Un sistema può raggiungere 870 ms al primo byte e risultare comunque lento al dodicesimo secondo. Il dato di Google è il tempo al primo audio, una cosa strettamente più piccola da produrre, ed è misurato da un valutatore esterno anziché dal fornitore.
Entrambi sono il tipo di numero che ti dice che un sistema è conversazionale invece che a turni, e nessuno dei due ti dice come ci si sente durante la chiamata al quinto minuto. Se stai scegliendo tra loro in base alla reattività, la posizione onesta è che nessuno ha pubblicato una misurazione omogenea, e l'unico modo per ottenerne una è eseguire quello che è chiamabile.
Ciò su cui puoi costruire oggi e ciò che aspetteresti
Gemini 3.8 Live include ciò che serve per prendere una decisione di produzione: due ID di modello che puoi fissare, tariffe al minuto pubblicate, un punteggio di un indice di terze parti e una data di disponibilità generale dichiarata. Include anche i vincoli che un prodotto vocale di solito ha — audio in ingresso, audio e testo in uscita e nessuna generazione video.
Muse Realtime Avatar arriva con le cose che ha un post di ricerca: un'architettura, quattro cifre riportate dall'azienda e una serie di test di preferenza divulgati che Meta ha condotto contro due sistemi avatar commerciali, uno dei quali Meta stessa riporta come statisticamente indistinguibile dalla parità quanto a manierismi. Quello che non ha è un modo per acquistarlo. Il post di Meta osserva anche che le demo mostrate non riflettono tutte gli avatar disponibili nell'app Muse, ed è la frase che dovrebbe governare qualsiasi piano tu costruisca su questo.
C'è una terza opzione che vale la pena menzionare, perché è quella che la maggior parte dei team adotta effettivamente. Nessuno di questi modelli è un agente completo. Gemini 3.8 Live affida il lavoro in background a strumenti e API mentre continua a parlare; GPT-Live-1 delega il proprio ragionamento interamente a un modello backend separato. Il livello conversazionale è il front end, e il pensiero è una chiamata diversa a un modello diverso. Quella seconda chiamata è una normale inferenza testuale, ed è instradabile.
Su OrcaRouter, quello strato è un unico endpoint: 196 modelli da 15 provider dietro un'unica chiave, al prezzo di listino del provider, trasferito senza alcun ricarico, con failover automatico se il modello che hai scelto dà errore o va in timeout. Non ospitiamo Gemini 3.8 Live — l'API Live è solo di Google — e non ospitiamo Muse Realtime Avatar, che nessuno ospita. Ciò che offriamo è la metà di un voice agent che scala in base a quanto a fondo pensano i tuoi chiamanti, e la metà che puoi cambiare senza rinegoziare nulla.

Dove i due potrebbero davvero incontrarsi
Il motivo per metterli a confronto diretto non sono i benchmark. È che entrambi cercano di occupare lo stesso posto in un prodotto: la cosa con cui l'utente parla. La scommessa di Google è che quello spazio sia una conversazione e che il risultato sia una buona conversazione — 97 lingue, esecuzione di strumenti in background, una variante di reasoning che risolve il 68,6% degli scenari di assistenza clienti di τ-Voice contro il 30,1% del modello standard. La scommessa di Meta è che quello spazio sia una presenza, e che un utente che può vedere l'agente sia un utente che resta nella conversazione.
Quelle scommesse non si escludono a vicenda. Un prodotto potrebbe plausibilmente usare Gemini 3.8 Live per il loop vocale e qualcosa come Muse Realtime Avatar per il livello visivo, se mai il livello avatar diventasse richiamabile. Ciò che non può fare è trattarli come intercambiabili, perché uno dei due non ti darà mai un volto e l'altro potrebbe non darti mai un endpoint.
Come decidere
Se stai lanciando un prodotto vocale questo trimestre, la decisione è già presa per te: Gemini 3.8 Live è richiamabile e Muse Realtime Avatar no. Scegli la tua variante sull'asse su cui verte effettivamente il rilascio — il modello con pensiero esteso garantisce 38 punti di completamento di attività agentiche per poco più di quattro volte il costo audio orario, e il modello standard è il modello vocale competente più economico sulla classifica pubblica. Poi instrada separatamente il ragionamento delegato, perché è lì che risiedono sia il costo che la latenza.
Se stai valutando un livello avatar, la risposta onesta è che non c'è ancora nulla da valutare. Quello che esiste è un post di ricerca con quattro numeri dichiarati dall'azienda e una dimostrazione. La cosa da tenere d'occhio non è l'indice — Muse Realtime Avatar non comparirà su uno — ma se Meta pubblicherà un tariffario, un endpoint e una data, e se i suoi 870 ms reggeranno quando l'avatar gira su un telefono con connessione cellulare anziché in una demo di Connect.
Fino ad allora il confronto ha una forma più breve di quella che gli danno la maggior parte degli articoli. Uno di questi è un prodotto con un prezzo, un ID modello e un punteggio esterno. L'altro è una dimostrazione molto valida di qualcosa che non possiede ancora nessuno di questi elementi.

