Una hero card generata per l'articolo "Muse Realtime Avatar vs GPT-Live-1", che mostra due card arrotondate ai lati del titolo. La card di sinistra riporta "Muse Realtime Avatar" sopra un'icona avatar ritratto e le righe "video + voce, un unico stream" e "nessuna API, nessun prezzo, nessuna data"; la card di destra riporta "GPT-Live-1" sopra un'icona a fumetto e le righe "$0,05 al minuto, fatturato al secondo" e "sessioni simultanee, WebRTC". Un sottotitolo recita "Uno vende minuti. L'altro vende presenza." Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1: Presenza contro Conversazione

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

L'unità di fatturazione ti dice cosa ciascuna azienda pensa di vendere. GPT-Live-1, il modello vocale full-duplex di Open​AI, fattura a una tariffa fissa di 0,05 $ al minuto di voce, con addebito al secondo, e i suoi limiti di frequenza sono espressi in sessioni simultanee — 25 al Livello 1, che salgono a 500 al Livello 5. Questa è l'unità di una linea telefonica. Muse Realtime Avatar, annunciato da Meta il 23 settembre 2026, non ha un'unità di fatturazione, perché non c'è nulla da fatturare: nessuna API, nessun endpoint, nessun prezzo, nessuna data. La sua unità pubblicata è invece un dato hardware — 12 sessioni in tempo reale simultanee su una NVIDIA GB200. Un'azienda vende conversazione al minuto. L'altra ti mostra quanto costa renderizzare un volto, e non ha ancora deciso di venderlo.

Entrambi i modelli sono piuttosto recenti e nessuno dei due è un lancio nel senso che di solito si attribuisce a questa parola. GPT-Live-1 è stato distribuito all'interno di ChatGPT l'8 luglio 2026 ed è arrivato all'API per sviluppatori solo il 10 settembre — due mesi durante i quali è stata la voce predefinita di un prodotto di consumo e non era disponibile per chiunque stesse sviluppando. Muse Realtime Avatar è stato annunciato il 23 settembre 2026 al Meta Connect, è mostrato nel post di ricerca di Meta stesso e rimane una funzionalità dell'agente Muse più che un prodotto. Confrontarli significa confrontare due fasi diverse della stessa idea: cosa succede quando un modello conversazionale è abbastanza valido che la domanda successiva diventa cosa sta guardando l'utente mentre parla.

Ciò che OpenAI ha costruito: una conversazione che non si blocca mai

GPT-Live-1 è full-duplex nel senso che conta operativamente — non aspetta che tu abbia finito prima di iniziare a lavorare. Raggiunge l'API per sviluppatori attraverso esattamente un endpoint, l'endpoint Live Sessions, sotto esattamente un ID modello, gpt-live-1, senza snapshot datati da fissare e senza endpoint fratelli abilitati. Nessun Chat Completions, nessun Responses, nessun Realtime, nessun fine-tuning, nessun endpoint di trascrizione audio o di sintesi vocale. L'input di immagini e video è esplicitamente non supportato.

La decisione di progettazione che determina tutto a valle è la delega. GPT-Live-1 non si occupa da solo dei propri ragionamenti complessi. La documentazione di OpenAI abbina il livello vocale a un backend di ragionamento separato e, nell'esempio WebRTC pubblicato, quel backend è GPT-5.6 Terra. Quindi una sessione GPT-Live-1 è composta da due contatori che girano contemporaneamente: 0,05 $ al minuto per la voce, più le normali tariffe per token del modello backend per ogni chiamata di strumento, ricerca e fase di ragionamento che delega. Nel Speech to Speech Index questa doppia personalità si manifesta con lo stesso modello che ottiene due punteggi: 81,5 con GPT-6 Astra che fa il ragionamento a sforzo medio, 80,1 con GPT-5.6 Sol a sforzo basso. Il divario di 1,4 punti tra queste due configurazioni è più ampio del margine di 0,2 punti che porta la migliore configurazione di GPT-Live-1 al primo posto.

Questa è la forma onesta del modello. Il front end vocale è fisso; l'intelligenza è un parametro che imposti, e sposta il punteggio più di quanto faccia qualsiasi modello concorrente.

Ciò che Meta ha costruito: un volto che si muove con la voce

Muse Realtime Avatar affronta un problema che GPT-Live-1 non ha — mantenere il video generato in perfetto sincrono con il parlato generato. La risposta di Meta è renderli lo stesso flusso: Muse Realtime Voice emette token vocali che portano sia contenuto che prosodia, e l'avatar è un Diffusion Transformer guidato dall'audio che consuma quegli stessi token, condizionato su un'immagine di riferimento e una finestra scorrevole di latenti video recenti. Nulla è sincronizzato labialmente a posteriori, perché non esiste un "a posteriori" — voce, bocca ed espressione provengono da un unico processo.

Le cifre pubblicate sono di Meta stessa, misurate rispetto a baseline scelte da Meta, e nessuna è stata riprodotta al di fuori dell'azienda. 870 ms dalla fine del tuo turno al primo byte di una risposta sincronizzata voce e video. Video verticale 448×768 a 25 fotogrammi al secondo, con filigrana tramite un overlay trasparente così che chi guarda possa capire che non proviene da una videocamera. Dodici sessioni simultanee su una GB200, un guadagno di capacità di 8× rispetto alla baseline BF16 in due fasi di Meta, grazie a training quantization-aware a quattro bit, cache KV persistenti e batching dinamico consapevole della latenza. E un risultato di preferenza che Meta riporta passare dal 45% al 55% rispetto a quella baseline, con due vittorie dichiarate contro sistemi avatar commerciali — più la dichiarazione che, sui manierismi, il risultato contro uno di essi non è statisticamente distinguibile dalla parità.

Niente in quell’elenco è una tariffa, un endpoint o una data.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

La fattura da due metri, e dove il routing si guadagna il suo posto

La struttura dei costi di GPT-Live-1 non è un singolo numero, e considerarla tale è il modo in cui un modello vocale dall’aria economica produce un mese costoso. La voce costa $0,05 al minuto, fatturata al secondo senza arrotondamenti per eccesso, e i primi 15 secondi di una sessione vengono fatturati in anticipo ma accreditati sulla durata successiva anziché aggiunti sopra. Tutto ciò che la sessione delega — il ragionamento, le chiamate agli strumenti, qualsiasi ricerca — viene fatturato separatamente alle tariffe proprie del modello di backend. Punta la delega su un reasoner di frontiera e lascialo cercare a ogni turno: hai creato una linea aperta da $3 l’ora con dietro un modello premium.

Quel secondo contatore è la metà instradabile. Su OrcaRouter il backend di una sessione GPT-Live-1 è solo un'altra chiamata a un modello: 196 modelli da 15 provider dietro un'unica chiave, al prezzo di listino del provider, passato senza alcun ricarico, con failover automatico quando il modello che hai scelto dà errore o va in timeout. Non puoi instradare il livello vocale — Live Sessions è solo l'endpoint di OpenAI — ma tutto ciò a cui il livello vocale delega poggia su un'unica chiave, il che significa che la parte della bolletta che cresce in base a quanto intensamente pensano i tuoi chiamanti è anche la parte che puoi cambiare senza un contratto.

Muse Realtime Avatar, al contrario, non ha meter da instradare. È una funzionalità di un'app.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Due scommesse su a cosa serve un agente vocale

Tolte le specifiche, le due aziende non sono d'accordo sul prodotto. La scommessa di OpenAI è che la conversazione è il prodotto — che un agente vocale è una linea telefonica, e il lavoro consiste nel farla sembrare tale: non bloccarsi mai, affidare il ragionamento difficile a un modello dietro di essa, fatturare al minuto, scalare in base alle chiamate simultanee. Ogni scelta nella superficie API di GPT-Live-1 deriva da questo. Limiti di frequenza basati sulla concorrenza, trasporto solo WebRTC, un singolo endpoint deliberatamente ristretto, nessun video in entrata né in uscita.

La scommessa di Meta è che la presenza sia il prodotto — che un utente che può vedere l'agente sia un utente che resta nella conversazione, e che l'ingegneria interessante non sia l'alternanza dei turni ma mantenere un personaggio renderizzato coerente per tutta la durata di una chiamata. Queste scelte producono un sistema ottimizzato per il frame rate e la densità di sessione su una GPU, senza alcuna superficie commerciale.

Esiste una concreta possibilità che entrambe abbiano ragione e che le due cose si compongano. Un prodotto potrebbe far girare la sua conversazione su un modello vocale full-duplex e il suo livello visivo su un renderer di avatar, e l’unica cosa che oggi lo impedisce è che il renderer di avatar non ha un endpoint. Ciò che non è plausibile è trattarle come due versioni dello stesso acquisto.

Chi dovrebbe agire, e chi dovrebbe aspettare

Se stai costruendo un prodotto vocale adesso, GPT-Live-1 è chiamabile e Muse Realtime Avatar no, e questo chiude la decisione. La scelta interessante dentro GPT-Live-1 è il backend a cui deleghi, perché è lì che si muovono davvero sia il punteggio sia il conto — ed è l'unica parte dello stack che puoi instradare, scambiare e sottoporre a failover senza toccare l'integrazione vocale.

Se quello che vuoi è un avatar, aspettare non è passivo. Le cose che vale la pena osservare sono specifiche: se Meta pubblica un tariffario e un endpoint, se compare una data dichiarata, e se 870 ms sopravvive al contatto con un telefono su una connessione cellulare anziché in una demo del Connect. Il post di Meta stesso fa notare che non tutte le sue demo riflettono gli avatar disponibili nell'app Muse, ed è questa la frase a cui aggrapparsi.

Finché una di queste cose non cambia, il confronto ha una risposta in una riga. GPT-Live-1 è una linea telefonica con un cervello che scegli tu. Muse Realtime Avatar è una faccia senza numero di telefono.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.