Una hero card generata per 'Muse Realtime Avatar: Meta dà un volto al suo Muse Agent, a 870 millisecondi per turno', che mostra l'occhiello 'Meta Superintelligence Labs — 23 settembre 2026', il titolo e tre dati dal post di ricerca di Meta: video verticale 448×768 a 25 fps, circa 870 ms dalla fine del turno al primo byte e 12 sessioni in tempo reale concorrenti su una NVIDIA GB200. Un sottotitolo recita: 'Non è una testa parlante. È un livello di rendering al di sopra di un modello vocale.' Il logo OrcaRouter è inserito in composizione nell'angolo in basso a destra.
Engineering & Research

Muse Realtime Avatar: Meta dà un volto al suo agente Muse, a 870 millisecondi per turno

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il numero con cui Meta ha scelto di aprire è 870 millisecondi. È il tempo che Muse Realtime Avatar impiega, secondo la misurazione di Meta stessa, dal momento in cui smetti di parlare al momento in cui arriva il primo byte di una risposta sincronizzata voce e video. È una cifra davvero aggressiva per un sistema che deve generare video, e vale la pena leggerla con precisione — perché quasi tutto ciò che c'è di interessante nel nuovo modello di embodiment di Meta sta nel divario tra ciò che quel numero misura e ciò che le persone presumeranno che misuri.

Muse Realtime Avatar è stato annunciato il 23 settembre 2026 al Meta Connect e descritto lo stesso giorno da Meta Superintelligence Labs in un post di ricerca intitolato "Bringing Your Muse to Life". Estende Muse Realtime Voice, lo strato conversazionale all'interno dell'agente Muse di Meta, dando a quest'ultimo un corpo. Non è un chatbot con un avatar preconfezionato: gli si fornisce un'immagine di riferimento — una fotografia, un'illustrazione a figura intera, un animale, un oggetto domestico — e questo rende quella cosa mentre parla, gesticola e cambia postura in video continuo per tutta la durata della conversazione. Zuckerberg ha detto sul palco che l'avatar collegato al suo Muse si chiama Jolly.

Un flusso di token condiviso, non una passata di lip-sync

L'architettura è la parte che vale la pena comprendere, perché spiega perché Meta continua a dire "embodiment" invece di "avatar". Muse Realtime Voice produce un flusso di token vocali — il post li chiama VQ — che trasportano sia il contenuto di ciò che viene detto sia la sua prosodia: il ritmo, l'enfasi, l'ascesa e la caduta. Muse Realtime Avatar consuma quello stesso flusso. È un Diffusion Transformer guidato dall'audio, condizionato da quei token vocali, dai media di riferimento che hai fornito e da una finestra scorrevole di recenti latenti video, e genera video in brevi blocchi causali, alimentando ogni nuovo latente in avanti come contesto di movimento per quello successivo.

Condividere un unico flusso di token è ciò che tiene insieme voce, movimento delle labbra ed espressione. L'alternativa — generare l'audio, poi applicarvi un modello di lip-sync separato — è il modo in cui funziona gran parte del settore degli avatar, ed è il motivo per cui tanti di quegli avatar sembrano doppiati. Il design di Meta elimina questa giuntura per costruzione. La finestra latente scorrevole è la seconda metà dell'idea: senza di essa, un generatore basato su chunk va alla deriva e, al terzo minuto, il tuo personaggio è silenziosamente diventato qualcun altro.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

Quattro numeri pubblicati, e ciò che ciascuno di essi misura realmente

Meta ha pubblicato più numeri di quanto sia usuale per un post di ricerca collegato a una funzionalità consumer. Tutti e quattro quelli di seguito sono dichiarati dall'azienda, misurati da Meta rispetto a baseline scelte da Meta; nessuno di essi è stato riprodotto al di fuori dell'azienda.

870 ms dalla fine del turno al primo byte. Questo è un dato relativo all'avvio della risposta. Non è il tempo necessario per una risposta completa, né è la latenza di consegna continua per il resto della chiamata. Un sistema può raggiungere 870 ms al primo byte e risultare comunque lento al dodicesimo secondo. Il post di Meta è esplicito sul fatto che questa è la misura del primo byte; una trattazione che omette la precisazione la interpreta come reattività end-to-end, cosa che non è.

Video verticale 448×768 a 25 fotogrammi al secondo. Si tratta di un formato alto a forma di telefono, non orizzontale, e 25 fps è più cinematografico che fluido — la frequenza standard per il cinema, inferiore ai 30 o 60 fps che fornirebbe un feed nativo della fotocamera. Meta afferma che le demo sono contrassegnate da una filigrana con una sovrapposizione trasparente, così un destinatario può capire che non sta guardando un normale feed della fotocamera.

60× meno valutazioni del modello. Trattato adeguatamente di seguito, perché è il numero che più facilmente può essere frainteso.

12 sessioni concorrenti in tempo reale su una NVIDIA GB200. Meta riferisce che il suo lavoro di serving — cache KV persistenti, routing consapevole della cache, batching dinamico consapevole della latenza, addestramento consapevole della quantizzazione a quattro bit, kernel fusi e CUDA Graph capture, sviluppato con NVIDIA — ha aumentato la capacità di 8× rispetto alla propria baseline BF16 a due passaggi. L'aritmetica alla base è semplice: ogni passo di generazione produce otto frame, che corrispondono a 320 ms di riproduzione, in 20 ms di tempo modello, ovvero 2,5 ms per frame. Sia il 12 sia l'8× si riferiscono alla baseline specificata da Meta, non all'hardware di un altro fornitore.

Perché 60× non è 60× più veloce

La compressione è l'affermazione che verrà ripetuta di più e capita di meno. Il modello teacher di Meta era un modello di diffusione a 40 passi con classifier-free guidance a tre vie — tre passaggi per passo, quindi 120 valutazioni del modello per produrre un blocco di video. Il modello studente è un modello causale non guidato a due passi con una KV cache a lunghezza fissa, addestrato tramite distillazione e self-forcing, e richiede due valutazioni per lo stesso blocco. Si tratta di una riduzione di 60× delle valutazioni per blocco, con una qualità, per usare le parole di Meta, quasi pari a quella del teacher.

È una riduzione del calcolo per chunk. Sessanta volte meno valutazioni non significa che un utente attenda un sessantesimo del tempo, perché la latenza era influenzata da altri fattori prima della distillazione e lo è ancora dopo. Il grafico nel post di Meta stesso mostra ciò che la riduzione ha fruttato in termini di qualità: la preferenza umana che sale dal 45% al 55%. Questa è la versione onesta della storia — lo scopo della distillazione era rendere un sistema in grado di funzionare in tempo reale, e il costo in termini di qualità è stato contenuto a circa dieci punti di preferenza anziché essere eliminato.

La valutazione, incluso il risultato che è andato nella direzione opposta

Meta ha condotto test su due sistemi di avatar commerciali, Runway Characters e HeyGen LiveAvatar, utilizzando identità avatar abbinate, in modo che i valutatori confrontassero l'animazione anziché il design del personaggio. I valutatori hanno avuto conversazioni dal vivo di due-tre minuti con ciascun sistema e poi hanno confrontato la qualità visiva, la sincronizzazione, la coerenza del personaggio e i modi di fare.

Meta riferisce di essere preferito per il 78% contro il 22% rispetto a Runway Characters e per l'88% contro il 12% rispetto a HeyGen LiveAvatar, e di essere preferito in ogni dimensione valutata. Poi il post fa qualcosa che la maggior parte delle valutazioni dei fornitori non fa: divulga che il confronto dei gesti caratteristici rispetto a Runway Characters non era statisticamente distinguibile da una condizione di parità. Un pareggio all'interno di una vittoria a tutto campo è una piccola cosa, ma è il dettaglio che ti dice che la vittoria a tutto campo viene riportata onestamente anziché selezionata ad arte.

I limiti del test contano più del pareggio. Due o tre minuti sono una conversazione breve. I valutatori erano di Meta. E il post stesso avverte che le sue dimostrazioni "illustrano le capacità del modello e non tutte riflettono gli avatar disponibili nell'app Muse" — il che equivale a un team di ricerca che dice, chiaramente, che il video che hai guardato non è necessariamente il prodotto che otterrai.

Cosa non puoi fare con esso

Non esiste un'API per Muse Realtime Avatar. Non c'è un prezzo, né un listino, né una lista d'attesa, né una data di pubblicazione. Meta non ha detto quando gli utenti o gli sviluppatori potranno usarlo. L'app Muse per i maggiori di 18 anni è l'unica superficie a cui è destinato, e l'avatar arriverà insieme a una serie di altre funzionalità di Muse — personalizzazione della voce, un indirizzo email Muse, controllo del computer Mac, integrazione con gli occhiali — che hanno tempistiche proprie, alcune delle quali indicate come "prossimi mesi".

Il confronto che conta qui non è con Runway o HeyGen. È con il resto dello stack Muse. Muse Spark, il modello di ragionamento su cui gira l'agente, è disponibile per gli sviluppatori da quando Meta l'ha reso accessibile tramite la Meta Model API, e Muse Spark 1.2 è erogato tramite OrcaRouter come meta/muse-spark-1.2 a $1,25 per milione di token in input e $4,25 per milione di token in output, prezzo di listino del provider senza alcun ricarico, all'interno di una finestra di contesto da un milione di token che accetta già testo, immagini, video, audio e file. Questa è la parte di Muse che puoi chiamare oggi. Il volto è la parte che non puoi.

Vale la pena soffermarsi su questa asimmetria se state pianificando qualcosa. Un agente che ragiona nel corso di una videochiamata e un agente che vi appare dentro sono prodotti diversi con vincoli diversi, e solo uno dei due è su un listino prezzi.

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

Cosa guardare dopo

Tre cose trasformerebbero questo da un annuncio in una decisione. La prima è una data di uscita per l'avatar dentro Muse, perché tutto ciò che Meta ha pubblicato riguarda un modello, e nulla di ciò che ha pubblicato riguarda un prodotto che puoi usare di giovedì. La seconda è una misurazione della latenza effettuata su una lunga conversazione anziché al primo byte — 870 ms sono un segnale di partenza, e la domanda che pone una vera chiamata è che cosa succede al decimo minuto. La terza è se il sistema resta nel personaggio in condizioni avversariali: un utente che cambia deliberatamente argomento, si muove velocemente, o gli fornisce un'immagine di riferimento progettata per sembrare una persona reale.

Fino ad allora, il riassunto onesto è quello che il post di ricerca implica senza dirlo. Muse Realtime Avatar è un vero pezzo di ingegneria con un vero risultato di compressione alle spalle, dimostrato in un contesto controllato, valutato dall'azienda che l'ha costruito, in conversazioni che duravano quanto l'ordinazione di un caffè. Non è vaporware. E non è nemmeno qualcosa che puoi comprare, instradare o sottoporre a benchmark — e queste sono affermazioni diverse.

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.