Una hero card generata per l'articolo «Muse Realtime Avatar vs Gemini 3.8 Live», che mostra due card arrotondate ai due lati del titolo. La card di sinistra riporta «Muse Realtime Avatar» sopra un'icona di fotogramma video e le righe «uscita video + voce», «448x768 verticale, 25 fps» e «annunciato il 23 settembre, senza API»; la card di destra riporta «Gemini 3.8 Live» sopra un'icona con microfono e fumetto e le righe «uscita audio + testo», «audio in ingresso a $0.005/min» e «GA 15 settembre, Live API». Un sottotitolo recita «Uno renderizza un volto. L'altro gestisce una linea telefonica.» Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Muse Realtime Avatar vs Gemini 3.8 Live: un volto contro una linea vocale

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Questi due non sono intercambiabili, e il modo più rapido per rendersene conto è chiedersi cosa restituisce ciascuno. Muse Realtime Avatar, annunciato da Meta il 23 settembre 2026, restituisce video sincronizzato di un personaggio che parla — tu fornisci un'immagine di riferimento e lui renderizza quella cosa che parla e gesticola in fotogrammi verticali da 448×768. Gemini 3.8 Live, annunciato da Goog​le il 15 settembre 2026 e reso generalmente disponibile agli sviluppatori lo stesso giorno, restituisce audio e testo. Non ha alcun output video. Metterli nella stessa comparazione non è un errore — i due competono per la stessa superficie conversazionale, e gli acquirenti stanno già chiedendo su quale dei due costruire — ma la decisione non è "quale sia migliore". È "quale dei due prodotti diversi mi serve", e quasi ogni confronto pubblicato della coppia sbaglia proprio questo, allineando benchmark che misurano cose diverse.

Ecco l'asimmetria che dovrebbe fare da cornice a tutto ciò che segue. Puoi chiamare Gemini 3.8 Live oggi, da un terminale, con una chiave. Non puoi chiamare Muse Realtime Avatar affatto — nessuna API, nessun prezzo, nessuna data. Meta l'ha dimostrato al Connect e ha pubblicato un post di ricerca; Google ha pubblicato un listino prezzi e un ID modello. Questo è un confronto tra un prodotto e un annuncio, e significa che la domanda utile non è quale dei due vince, ma a cosa ciascuno ti impegna.

Che cosa produce effettivamente ciascuno

Questo è l'intero confronto in sei righe, e nessuna delle sei si avvicina.

Output — Muse Realtime Avatar restituisce voce e video ritratto sincronizzati, generati insieme da un unico flusso di token vocali; Gemini 3.8 Live restituisce audio e testo, senza alcuna generazione video all'interno del modello.

Accesso per sviluppatori — Muse Realtime Avatar non ne ha: è stato annunciato il 23 settembre 2026 come funzionalità dell'agente Muse di Meta, senza API, senza endpoint e senza una data dichiarata. Gemini 3.8 Live è disponibile nell'API Gemini e in Goog​le AI Studio dal 15 settembre 2026, con due ID modello, gemini-3.8-live e gemini-3.8-live-extended-thinking.

Prezzo — Muse Realtime Avatar non ha un prezzo pubblicato perché non c'è nulla da acquistare. Gemini 3.8 Live pubblica $0,005 al minuto per l'input audio e $0,018 al minuto per l'output audio tramite la Live API.

Valutazione indipendente — Muse Realtime Avatar non ne ha alcuna; i suoi dati sono quelli di Meta stessa, misurati rispetto a baseline scelte da Meta. Gemini 3.8 Live riporta 76,0 sull'Artificial Analysis Speech to Speech Index, con la variante extended-thinking a 82,6 — un dato di terze parti, che rappresenta una classe di prove diversa.

Latenza — i due valori pubblicati non corrispondono alla stessa misurazione, ed è qui che la maggior parte degli articoli sbaglia. Meta dichiara 870 ms dalla fine del tuo turno al primo byte di una risposta sincronizzata voce e video. Il numero di Google, misurato da Artificial Analysis, è di 1,18 secondi al primo audio per il modello standard e 1,35 secondi per la variante di ragionamento.

Frame e lingua — Muse Realtime Avatar esegue il rendering di video verticale 448×768 a 25 fotogrammi al secondo. Gemini 3.8 Live gestisce il passaggio automatico a metà conversazione tra 97 lingue supportate ed elabora input visivi quasi in tempo reale.

Quell'ultima riga contiene la distinzione che le persone continuano ad appiattire. Gemini 3.8 Live può vedere. Non può mostrare. Muse Realtime Avatar può mostrare. Se possa vedere non è ciò di cui parla il post di Meta — è un generatore guidato dall'audio, condizionato da token vocali e da un'immagine di riferimento, e il suo compito è produrre un volto anziché leggerlo.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

I numeri sulla latenza non sono comparabili, e il divario è più piccolo di quanto sembri.

870 ms contro 1,18 secondi sembra indicare che Meta sia il 26% più veloce. Leggi le misurazioni e il confronto svanisce. Il dato di Meta è il tempo dalla fine del turno dell'utente al primo byte di una risposta che include video — e il post di Meta è esplicito: si tratta di una misura del primo byte, non del tempo necessario a una risposta completa né della latenza di consegna continua per il resto della chiamata. Un sistema può raggiungere 870 ms al primo byte e risultare comunque lento al dodicesimo secondo. Il dato di Goog​le è il tempo al primo audio, una cosa strettamente più piccola da produrre, ed è misurato da un valutatore esterno anziché dal fornitore.

Entrambi sono il tipo di numero che ti dice che un sistema è conversazionale invece che a turni, e nessuno dei due ti dice come ci si sente durante la chiamata al quinto minuto. Se stai scegliendo tra loro in base alla reattività, la posizione onesta è che nessuno ha pubblicato una misurazione omogenea, e l'unico modo per ottenerne una è eseguire quello che è chiamabile.

Ciò su cui puoi costruire oggi e ciò che aspetteresti

Gemini 3.8 Live include ciò che serve per prendere una decisione di produzione: due ID di modello che puoi fissare, tariffe al minuto pubblicate, un punteggio di un indice di terze parti e una data di disponibilità generale dichiarata. Include anche i vincoli che un prodotto vocale di solito ha — audio in ingresso, audio e testo in uscita e nessuna generazione video.

Muse Realtime Avatar arriva con le cose che ha un post di ricerca: un'architettura, quattro cifre riportate dall'azienda e una serie di test di preferenza divulgati che Meta ha condotto contro due sistemi avatar commerciali, uno dei quali Meta stessa riporta come statisticamente indistinguibile dalla parità quanto a manierismi. Quello che non ha è un modo per acquistarlo. Il post di Meta osserva anche che le demo mostrate non riflettono tutte gli avatar disponibili nell'app Muse, ed è la frase che dovrebbe governare qualsiasi piano tu costruisca su questo.

C'è una terza opzione che vale la pena menzionare, perché è quella che la maggior parte dei team adotta effettivamente. Nessuno di questi modelli è un agente completo. Gemini 3.8 Live affida il lavoro in background a strumenti e API mentre continua a parlare; GPT-Live-1 delega il proprio ragionamento interamente a un modello backend separato. Il livello conversazionale è il front end, e il pensiero è una chiamata diversa a un modello diverso. Quella seconda chiamata è una normale inferenza testuale, ed è instradabile.

Su OrcaRouter, quello strato è un unico endpoint: 196 modelli da 15 provider dietro un'unica chiave, al prezzo di listino del provider, trasferito senza alcun ricarico, con failover automatico se il modello che hai scelto dà errore o va in timeout. Non ospitiamo Gemini 3.8 Live — l'API Live è solo di Goog​le — e non ospitiamo Muse Realtime Avatar, che nessuno ospita. Ciò che offriamo è la metà di un voice agent che scala in base a quanto a fondo pensano i tuoi chiamanti, e la metà che puoi cambiare senza rinegoziare nulla.

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

Dove i due potrebbero davvero incontrarsi

Il motivo per metterli a confronto diretto non sono i benchmark. È che entrambi cercano di occupare lo stesso posto in un prodotto: la cosa con cui l'utente parla. La scommessa di Goog​le è che quello spazio sia una conversazione e che il risultato sia una buona conversazione — 97 lingue, esecuzione di strumenti in background, una variante di reasoning che risolve il 68,6% degli scenari di assistenza clienti di τ-Voice contro il 30,1% del modello standard. La scommessa di Meta è che quello spazio sia una presenza, e che un utente che può vedere l'agente sia un utente che resta nella conversazione.

Quelle scommesse non si escludono a vicenda. Un prodotto potrebbe plausibilmente usare Gemini 3.8 Live per il loop vocale e qualcosa come Muse Realtime Avatar per il livello visivo, se mai il livello avatar diventasse richiamabile. Ciò che non può fare è trattarli come intercambiabili, perché uno dei due non ti darà mai un volto e l'altro potrebbe non darti mai un endpoint.

Come decidere

Se stai lanciando un prodotto vocale questo trimestre, la decisione è già presa per te: Gemini 3.8 Live è richiamabile e Muse Realtime Avatar no. Scegli la tua variante sull'asse su cui verte effettivamente il rilascio — il modello con pensiero esteso garantisce 38 punti di completamento di attività agentiche per poco più di quattro volte il costo audio orario, e il modello standard è il modello vocale competente più economico sulla classifica pubblica. Poi instrada separatamente il ragionamento delegato, perché è lì che risiedono sia il costo che la latenza.

Se stai valutando un livello avatar, la risposta onesta è che non c'è ancora nulla da valutare. Quello che esiste è un post di ricerca con quattro numeri dichiarati dall'azienda e una dimostrazione. La cosa da tenere d'occhio non è l'indice — Muse Realtime Avatar non comparirà su uno — ma se Meta pubblicherà un tariffario, un endpoint e una data, e se i suoi 870 ms reggeranno quando l'avatar gira su un telefono con connessione cellulare anziché in una demo di Connect.

Fino ad allora il confronto ha una forma più breve di quella che gli danno la maggior parte degli articoli. Uno di questi è un prodotto con un prezzo, un ID modello e un punteggio esterno. L'altro è una dimostrazione molto valida di qualcosa che non possiede ancora nessuno di questi elementi.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.