Una hero card generata per 'Muse Realtime Avatar', con l'overline 'Meta AI Research - 23 settembre 2026', il titolo e tre card etichettate che recitano 'Muse Realtime Voice - lo strato conversazionale, che trasmette i token vocali in streaming', 'Muse Realtime Avatar - lo strato di incarnazione costruito sopra di esso, solo ricerca' e 'Muse Spark 1.2 - il modello Muse instradabile su OrcaRouter oggi'. Il logo di OrcaRouter è composto nell'angolo in basso a destra.
Engineering & Research

Muse Realtime Avatar: cosa ha costruito Meta, su cosa si basa e perché ancora non puoi chiamarlo

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Muse Realtime Avatar è la tecnologia di incarnazione di Meta. Prende il flusso vocale che Muse Realtime Voice produce e genera la performance corrispondente: puntalo su un ritratto fotografico e il volto risponde con piccoli cambiamenti di espressione, puntalo su un'illustrazione a figura intera e la figura gesticola e cambia postura mentre parla. Meta AI Research l'ha introdotto il 23 settembre 2026 in un post intitolato "Bringing Your Muse to Life". È un risultato di ricerca, non un prodotto — la pagina di Meta stessa non offre API, prezzo, lista d'attesa né data di pubblicazione — quindi la risposta onesta a "posso usarlo oggi" è no. Il modello Muse che puoi chiamare oggi è un altro, Meta Muse Spark 1.2.

Quella risposta merita di essere enunciata nel primo paragrafo anziché nell'ultimo, perché un lettore che cerca questo nome di solito sta decidendo se pianificare tenendone conto. Pianifica in funzione della ricerca, non di un endpoint.

Una cosa da dire chiaramente prima di ogni altra, perché questa pagina infrange una regola che dovrebbe ammettere. Questo blog di solito scrive dei modelli nella settimana del loro lancio. Muse Realtime Avatar è stato annunciato una settimana prima che questa pagina andasse online, quindi, in un'interpretazione rigorosa della finestra di freschezza, l'elemento verrebbe saltato. Non è un articolo di cronaca su un evento datato. È la pagina di riferimento per un modello che oggi è vivo nella conversazione sul catalogo: la pagina a cui un lettore arriva dopo aver digitato il nome stesso del modello, il cui fondamento è una domanda di ricerca costante che abbiamo misurato noi stessi, non la freschezza di un lancio. L'annuncio di settembre è menzionato qui come un fatto che data il modello, non come un evento da riportare, e nulla di ciò che segue è un secondo annuncio. La nostra copertura di quel giorno è un pezzo separato e resta separato.

Dove si colloca nella famiglia Muse

Meta è esplicita sul fatto che questi sono due livelli di un unico sistema, non due prodotti. Nelle parole di Meta, «Muse Realtime Voice e Muse Realtime Avatar formano un unico sistema di streaming che collega intelligenza, voce e incarnazione». Il livello vocale fornisce l'intelligenza conversazionale ed emette un flusso di token vocali — Meta li chiama VQ — che trasportano sia ciò che viene detto sia il modo in cui viene pronunciato. Un decoder audio trasforma quei token in suono, e il livello avatar consuma lo stesso flusso per generare l'immagine. Condividere un unico flusso di token è ciò che mantiene allineati voce, movimento delle labbra ed espressione; non c'è alcuna fase separata di lip-sync aggiunta a posteriori.

Muse Realtime Voice è il livello conversazionale. Muse Realtime Avatar è il livello di incarnazione costruito sopra di esso. Nessuno dei due è la cosa che puoi chiamare.

Fai altrettanta attenzione a un nome vicino, perché è quello che più facilmente può essere confuso con l'uno o con l'altro. Muse Voice Transcribe è un endpoint di trascrizione ed è un prodotto realmente diverso. La documentazione per sviluppatori di Meta è inequivocabile: «È solo speech-to-text; non sintetizza la voce né fornisce un'API di conversazione speech-to-speech». Restituisce timestamp a livello di turno e non a livello di parola, e Meta lo indica a 0,18 $ all'ora in quella pagina. È un endpoint reale e a pagamento. Non è una voce, e certamente non è un avatar.

Il modello Muse effettivamente chiamabile è Meta Muse Spark 1.2, il modello di ragionamento che Meta distribuisce con un contesto da un milione di token e input di testo, immagini, video, file e audio. Quello è instradabile qui oggi, al prezzo di listino del provider senza alcun ricarico, sulla stessa chiave di tutto il resto del catalogo, e la sua scheda live riporta la specifica completa. Non disponiamo di Muse Realtime Avatar. Abbiamo ricontrollato l'elenco dei modelli live mentre scrivevamo questo e le uniche voci Muse presenti sono i due checkpoint Spark, 1.2 e il suo predecessore 1.1. Dire qualcosa di più morbido — che la famiglia è "parzialmente disponibile" — implicherebbe che instradiamo qualcosa che non instradiamo.

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

La tecnologia, nelle parole di Meta

La descrizione che Meta fa dell'architettura è abbastanza compatta da citarla anziché parafrasarla. Muse Realtime Avatar è un Diffusion Transformer guidato dall'audio, condizionato da token vocali, media di riferimento e una finestra scorrevole di latenti video recenti, e «genera video in brevi blocchi causali». La seconda metà di quella frase è la parte portante: man mano che ciascun blocco si completa, i suoi latenti generati più recenti diventano il contesto di movimento per quello successivo. La ragione dichiarata da Meta è la continuità — l'aspetto e i modi di fare dell'avatar si conservano di turno in turno mentre il calcolo resta contenuto, ed è ciò che permette alla generazione di proseguire finché dura la conversazione invece di andare alla deriva o esaurire il budget.

Il meccanismo di provenienza va inserito nello stesso paragrafo, perché Meta lo presenta come parte del sistema anziché come un ripensamento: il video generato reca una filigrana invisibile e durevole applicata tramite Meta Video Seal, che secondo Meta non aggiunge latenza al percorso in tempo reale.

Meta ha misurato questa cosa e ne ha pubblicato quattro cifre. Quelle cifre — e le avvertenze specifiche che ciascuna richiede, inclusa quella che sembra un'accelerazione e non lo è — appartengono all'articolo di lancio, che le riporta con il loro contesto intatto. Non ripeteremo qui i numeri nudi, perché un numero nudo è esattamente ciò che la versione con avvertenze esiste per prevenire.

Abbiamo trattato l'annuncio il giorno stesso nel nostro articolo sul lancio di Muse Realtime Avatar, e resta il posto dove leggere per intero le dichiarazioni ponderate.

Ciò che il nome non è

Vale la pena scartare tre falsi vicini uno alla volta, perché ciascuno di essi è una supposizione ragionevole solo in base al nome.

• Non è Muse Voice Transcribe. Quel endpoint converte il parlato in testo e, da parte di Meta, non fa nulla nella direzione opposta. Se quello di cui hai bisogno è una trascrizione, Meta ne vende una ed è una cosa diversa, con un prezzo diverso.

• Non è un servizio di clonazione vocale. Nulla nelle pagine di Meta descrive la sintesi della voce di una persona specifica, la vendita di un modello vocale o l'accettazione di un campione vocale da parte di un utente. Il livello vocale è descritto come produttore di un flusso di token; il livello avatar è descritto come consumatore di tale flusso. La forma del prodotto che quella frase di solito implica — caricare un campione, ottenere un clone — non è quella descritta qui, e il materiale demo che Meta effettivamente pubblica è presentato come illustrazione delle capacità del modello.

• Non è un avatar per consumatori nell'app di Meta stessa. Meta accompagna i suoi esempi con un avvertimento facile da trascurare e che vale la pena ricordare: le dimostrazioni "illustrano le capacità del modello e non tutti riflettono gli avatar disponibili nell'app Muse", e Muse è per utenti di età pari o superiore a 18 anni. Prendilo alla lettera. Parte di ciò che il post mostra riguarda le capacità, non la disponibilità effettiva.

Un quarto nome vale la pena distinguere per una ragione diversa. Muse Realtime Avatar non è Muse Video, il modello di generazione video che è rimasto su una classifica pubblica per gran parte di quest'anno senza essere rilasciato. La nostra stessa pagina su quella situazione — Muse Video: data di uscita, accesso API e cosa Meta Connect potrebbe cambiare — contiene un vincolo che ripeteremo qui alla lettera invece di migliorarlo: qualsiasi pagina che citi un giorno di lancio specifico o un prezzo per Muse Video senza un annuncio più recente di Meta sta facendo congetture. La stessa disciplina vale per l'argomento di questa pagina, quindi questa pagina non cita né l'uno né l'altro. Quel pezzo fornisce anche la data che non sta a noi confondere: Muse Video è in anteprima il 7 luglio 2026 e non è stato rilasciato, motivo per cui una ricerca per questa famiglia restituisce date che appartengono a un modello diverso.

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

A cosa serve questa pagina, e cosa la cambierebbe

Il motivo per cui una pagina di riferimento è la forma giusta in questo caso è misurabile. Nei 28 giorni fino al 25 settembre 2026, il termine esatto ha totalizzato 164 impression sulla nostra proprietà di ricerca e zero clic, con la sua posizione migliore al 9,3. Più di cinquanta delle nostre pagine menzionano il frammento da qualche parte, e quasi tutto quel traffico arriva su un unico post di annuncio. Un termine con domanda reale e sostenuta, che si posiziona appena fuori dalla prima pagina e non converte nessuno, non è un problema di domanda né di qualità: è un problema di pagina. Non esisteva una pagina che avesse come soggetto il modello stesso. Questa è quella pagina.

La posizione è anche il motivo per cui nulla qui viene presentato come notizia. Un lettore che arriva da una ricerca per nome vuole tre cose, in ordine: che cos'è, se è disponibile e su cosa si basa. A queste si risponde sopra, in quest'ordine, senza inventare date e senza nominare alcun concorrente.

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

Ciò che cambierebbe la pagina è un singolo annuncio. Se Meta pubblica un endpoint, un prezzo, una lista d'attesa o una data per Muse Realtime Avatar, la sezione sulla disponibilità smette di essere un "no" e diventa una specifica, e questa pagina verrebbe riscritta anziché ampliata. Se Meta rilascia Muse Video, il paragrafo qui sopra cambia di conseguenza. Finché non accade nessuna delle due cose, la mossa utile per uno sviluppatore è quella poco appariscente: mantenere l'interfaccia che già si ha puntata sul modello che si può effettivamente raggiungere. Ogni modello del catalogo, Meta Muse Spark 1.2 incluso, si trova dietro un endpoint compatibile con OpenAI e una chiave, il che significa che provare la parte di questa famiglia che esiste costa un cambio di stringa del modello anziché un nuovo contratto. Quando il livello di embodiment diventerà richiamabile, anche il costo di passaggio dovrebbe essere una stringa.