Una card hero generata per l'articolo 'Muse Realtime Avatar vs SeedRealtime', che mostra due card arrotondate ai lati del titolo. La card di sinistra riporta 'Muse Realtime Avatar' sopra un'icona di fotogramma video in uscita e le righe 'genera il video' e 'Meta, annunciato il 23 settembre'; la card di destra riporta 'SeedRealtime' sopra un'icona con schermo e occhio e le righe 'guarda il video' e 'ByteDance, rilasciato il 5 agosto'. Un sottotitolo recita 'Nessuno dei due ha un listino prezzi.' Il logo di OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Muse Realtime Avatar vs SeedRealtime: Due modelli che puoi solo guardare

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Nessuno dei due ha un listino prezzi. Muse Realtime Avatar, annunciato da Meta il 23 settembre 2026 al Meta Connect, non ha API, né endpoint, né prezzo né data — è una funzionalità dell'agente Muse di Meta, dimostrata in un post di ricerca intitolato «Bringing Your Muse to Life». SeedRealtime, rilasciato da ByteDance Seed il 5 agosto 2026, non ha API, né pesi, né report tecnico né numero di parametri — esiste all'interno dell'app Doubao di ByteDance, e il post di ByteDance dice soltanto che è stato «distribuito completamente». Due delle più grandi aziende di IA per i consumatori al mondo hanno rilasciato sistemi audiovisivi in tempo reale a sette settimane di distanza l'una dall'altra e nessuno dei due è acquistabile. Questo è il confronto, ed è più interessante della tabella di benchmark che nessuno può costruire.

Ciò che li separa è la direzione in cui scorre il video. SeedRealtime guarda, ascolta e parla di ciò che vede — audio, video e testo in un'unica rete end-to-end, con l'alternanza dei turni spostata da un rilevatore esterno di attività vocale al modello stesso. Muse Realtime Avatar genera: gli si fornisce un'immagine di riferimento, una fotografia, un'illustrazione o un oggetto, e la renderizza mentre parla e gesticola in video continuo per tutta la durata della conversazione. Il video di SeedRealtime è input. Il video di Muse Realtime Avatar è output. Entrambi sono descritti come full-duplex, entrambi sono audio-visivi, e svolgono lavori opposti con l'etichetta.

Cos'è ciascuno e dove si trova

Sei righe, e le ultime due sono quelle che decidono qualcosa.

Video — Muse Realtime Avatar lo genera, a una risoluzione verticale di 448×768 e 25 fotogrammi al secondo, con una filigrana trasparente sovrapposta, così che chi guarda possa capire che non si tratta di un feed della telecamera; SeedRealtime lo percepisce, trasmettendo i fotogrammi nella stessa rete che gestisce l'audio.

La scommessa architetturale — Muse Realtime Avatar condivide un unico flusso di token tra voce e video, così un Diffusion Transformer guidato dall'audio consuma direttamente i token vocali di Muse Realtime Voice e nulla viene sincronizzato labialmente in seguito; SeedRealtime integra l'alternanza dei turni nel modello, così chi parla e quando smette di essere una decisione di un rilevatore esterno di attività vocale.

Dove funziona — Muse Realtime Avatar è una funzionalità all'interno dell'agente Muse di Meta; SeedRealtime è all'interno dell'app Doubao di ByteDance.

Accesso sviluppatore — nessuno dei due ha un'API. Nessuno dei due pubblica i pesi. Non esiste un'opzione serverless, né un endpoint ospitato, né una piattaforma di terze parti che ne offra alcuno.

Prezzo — non pubblicato per entrambi, perché non esiste un'offerta commerciale da nessuna delle due parti.

Valutazione indipendente — nessuna per nessuno dei due sistemi. Ogni numero che l'una o l'altra azienda ha pubblicato sul proprio modello è di prima parte, e nessun valutatore esterno ha testato nessuno dei due.

Due basi probatorie, entrambe di prima parte, e una delle due è molto più esile.

Qui il confronto smette di essere simmetrico. Meta ha pubblicato quattro cifre per Muse Realtime Avatar, tutte dichiarate dall'azienda, misurate rispetto a baseline scelte da Meta, nessuna riprodotta al di fuori dell'azienda: 870 ms dalla fine del proprio turno al primo byte di una risposta sincronizzata audio e video; video verticale 448×768 a 25 fotogrammi al secondo; 60× meno valutazioni del modello rispetto alla propria baseline; e 12 sessioni in tempo reale simultanee su una singola NVIDIA GB200, un guadagno di capacità di 8× rispetto alla baseline BF16 a due passaggi di Meta, ottenuto grazie al training consapevole della quantizzazione a quattro bit e al batching dinamico consapevole della latenza. Meta ha anche pubblicato un confronto di preferenza rispetto a due sistemi avatar commerciali — 78/22 contro uno, 88/12 contro l'altro — e ha rivelato che, sui manierismi, il risultato contro uno dei due non è statisticamente distinguibile dalla parità. Quella divulgazione vale più delle vittorie; è il tipo di risultato che la maggior parte dei post di lancio omette.

L'evidenza pubblicata da SeedRealtime è una singola valutazione umana end-to-end. ByteDance afferma che, rispetto ai sistemi a cascata — un modello di visione collegato a un modello ASR collegato a un LLM collegato a una voce text-to-speech — SeedRealtime dimezza i problemi di ritmo conversazionale audiovisivo, con meno interruzioni, meno falsi inneschi e risposte più lente e naturali. Ciò che ByteDance non ha pubblicato è un'ampiezza del campione, una metodologia, un numero di annotatori, un dato di latenza in millisecondi, il nome di un benchmark o un punteggio. Un rapporto secondario cita un guadagno del 12% nella fluidità conversazionale rispetto ai modelli precedenti del team. Questa è l'intera base di evidenze pubbliche.

Quindi la classifica onesta della verificabilità è questa: nessuno dei due ha un'esecuzione indipendente; quello di Meta è un insieme di misurazioni con baseline dichiarate e un risultato negativo reso noto; quello di ByteDance è un'unica affermazione di preferenza il cui disegno non è descritto. Nessuno dei due è riproducibile, ma solo uno dei due è abbastanza specifico da poter essere contestato.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

La mossa che ciascuno fece

Entrambi i sistemi sono risposte allo stesso problema, e vale la pena vedere che le due risposte sono diverse.

Per un sistema che osserva, la parte difficile è sapere quando parlare. Un modello che riceve continuamente fotogrammi della telecamera e audio deve decidere, senza un trigger esterno, se la persona davanti a sé ha finito, se è stato interpellato e se l'oggetto appena entrato nell'inquadratura è rilevante. È il problema che SeedRealtime ha spostato all'interno del modello, e ByteDance ha compiuto il passo su tre modalità anziché due — una versione più difficile di ciò che Google, OpenAI e NVIDIA hanno fatto ciascuno solo per l'audio. I comportamenti mostrati nella demo derivano da questo: associare una voce a un volto in una conversazione di gruppo, prendere la parola senza essere sollecitato quando qualcosa entra nell'inquadratura, guidare qualcuno attraverso un museo o una riparazione.

Per un sistema che esegue rendering, la parte difficile è mantenere la coerenza. Generare video in brevi blocchi causali significa che ogni blocco è condizionato dal precedente, e la modalità di errore è la deriva: al terzo minuto, il personaggio è silenziosamente diventato qualcun altro. La finestra scorrevole di Meta sui latenti video recenti è la risposta a questo, e il flusso di token condiviso è la risposta a un altro problema, l'aspetto doppiato che si ottiene quando l'audio viene generato prima e un modello di lip-sync viene applicato a posteriori.

Nessuna delle due mosse è disponibile nell'altro sistema. SeedRealtime non ha un'immagine di riferimento a cui restare fedele, perché non sta renderizzando nessuno. Muse Realtime Avatar non ha un mondo esterno da tracciare, perché il suo intero compito è produrre un volto che corrisponda a una voce.

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

Perché un modello non richiamabile è comunque una questione di routing

Entrambi questi sistemi delegano. Muse Realtime Avatar si basa su Muse Realtime Voice, che è lo strato conversazionale di un agente il cui ragionamento viene eseguito su Muse Spark — è il modello a fare il rendering, non il pensiero. Il design di SeedRealtime mantiene viva la conversazione mentre avviene il lavoro in background, il che significa che il lavoro che supera ciò che può fare inline va altrove e poi ritorna. In entrambe le architetture, ciò con cui l'utente interagisce è un front end, e l'intelligenza è un modello di testo separato dietro di esso.

Quel modello di testo separato è inferenza ordinaria, ed è la parte dello stack che puoi effettivamente acquistare. Su OrcaRouter è un unico endpoint che copre 196 modelli da 15 provider, al prezzo di listino del provider passato senza alcun ricarico, con failover automatico quando il modello che hai scelto genera errori o va in timeout. Noi non ospitiamo SeedRealtime — è di ByteDance, dentro Doubao, e non c'è nulla da instradare. Non ospitiamo nemmeno Muse Realtime Avatar, e neanche chiunque altro. Ciò che offriamo è lo strato a cui entrambi i sistemi affidano il proprio lavoro più impegnativo, ovvero lo strato che cambia quando vuoi che sia un modello diverso a fare il ragionamento.

Cosa cambierebbe la risposta

Per SeedRealtime, il tassello mancante non è una funzionalità: sono le prove. Un rapporto tecnico con un conteggio dei parametri, una suite di benchmark e una valutazione umana descritta lo farebbero passare da "una dimostrazione all'interno di un'app" a qualcosa su cui un team potrebbe ragionare. Il post di ByteDance inoltre rimanda a destinazioni generiche "Prova Dola" e "Prova nel Playground" senza rivendicare pesi o un'API documentata, che è il pattern di una funzionalità di prodotto piuttosto che di un rilascio di modello.

Per Muse Realtime Avatar, il tassello mancante è di natura commerciale: un listino prezzi, un endpoint, una data e i termini su regione ed età che Meta non ha specificato del tutto. Il post di Meta osserva che le sue demo non riflettono tutte gli avatar disponibili nell'app Muse, ed è questa la frase che dovrebbe governare qualsiasi piano costruito su questo.

Finché una di quelle cose non cambia, il confronto ha una forma insolitamente breve. Entrambi i modelli sono audiovisivi, entrambi sono full-duplex, entrambi sono ingegneria davvero impressionante, e nessuno dei due può essere invocato da un terminale da chiunque stia leggendo questo. La differenza sta in ciò che faresti con loro se potessi: uno ti dà un personaggio che parla, e uno ti dà un sistema che nota.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.