
Muse Realtime Avatar vs SeedRealtime: Due modelli che puoi solo guardare
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 180 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Nessuno dei due ha un listino prezzi. Muse Realtime Avatar, annunciato da Meta il 23 settembre 2026 al Meta Connect, non ha API, né endpoint, né prezzo né data — è una funzionalità dell'agente Muse di Meta, dimostrata in un post di ricerca intitolato «Bringing Your Muse to Life». SeedRealtime, rilasciato da ByteDance Seed il 5 agosto 2026, non ha API, né pesi, né report tecnico né numero di parametri — esiste all'interno dell'app Doubao di ByteDance, e il post di ByteDance dice soltanto che è stato «distribuito completamente». Due delle più grandi aziende di IA per i consumatori al mondo hanno rilasciato sistemi audiovisivi in tempo reale a sette settimane di distanza l'una dall'altra e nessuno dei due è acquistabile. Questo è il confronto, ed è più interessante della tabella di benchmark che nessuno può costruire.
Ciò che li separa è la direzione in cui scorre il video. SeedRealtime guarda, ascolta e parla di ciò che vede — audio, video e testo in un'unica rete end-to-end, con l'alternanza dei turni spostata da un rilevatore esterno di attività vocale al modello stesso. Muse Realtime Avatar genera: gli si fornisce un'immagine di riferimento, una fotografia, un'illustrazione o un oggetto, e la renderizza mentre parla e gesticola in video continuo per tutta la durata della conversazione. Il video di SeedRealtime è input. Il video di Muse Realtime Avatar è output. Entrambi sono descritti come full-duplex, entrambi sono audio-visivi, e svolgono lavori opposti con l'etichetta.
Cos'è ciascuno e dove si trova
Sei righe, e le ultime due sono quelle che decidono qualcosa.
• Video — Muse Realtime Avatar lo genera, a una risoluzione verticale di 448×768 e 25 fotogrammi al secondo, con una filigrana trasparente sovrapposta, così che chi guarda possa capire che non si tratta di un feed della telecamera; SeedRealtime lo percepisce, trasmettendo i fotogrammi nella stessa rete che gestisce l'audio.
• La scommessa architetturale — Muse Realtime Avatar condivide un unico flusso di token tra voce e video, così un Diffusion Transformer guidato dall'audio consuma direttamente i token vocali di Muse Realtime Voice e nulla viene sincronizzato labialmente in seguito; SeedRealtime integra l'alternanza dei turni nel modello, così chi parla e quando smette di essere una decisione di un rilevatore esterno di attività vocale.
• Dove funziona — Muse Realtime Avatar è una funzionalità all'interno dell'agente Muse di Meta; SeedRealtime è all'interno dell'app Doubao di ByteDance.
• Accesso sviluppatore — nessuno dei due ha un'API. Nessuno dei due pubblica i pesi. Non esiste un'opzione serverless, né un endpoint ospitato, né una piattaforma di terze parti che ne offra alcuno.
• Prezzo — non pubblicato per entrambi, perché non esiste un'offerta commerciale da nessuna delle due parti.
• Valutazione indipendente — nessuna per nessuno dei due sistemi. Ogni numero che l'una o l'altra azienda ha pubblicato sul proprio modello è di prima parte, e nessun valutatore esterno ha testato nessuno dei due.
Due basi probatorie, entrambe di prima parte, e una delle due è molto più esile.
Qui il confronto smette di essere simmetrico. Meta ha pubblicato quattro cifre per Muse Realtime Avatar, tutte dichiarate dall'azienda, misurate rispetto a baseline scelte da Meta, nessuna riprodotta al di fuori dell'azienda: 870 ms dalla fine del proprio turno al primo byte di una risposta sincronizzata audio e video; video verticale 448×768 a 25 fotogrammi al secondo; 60× meno valutazioni del modello rispetto alla propria baseline; e 12 sessioni in tempo reale simultanee su una singola NVIDIA GB200, un guadagno di capacità di 8× rispetto alla baseline BF16 a due passaggi di Meta, ottenuto grazie al training consapevole della quantizzazione a quattro bit e al batching dinamico consapevole della latenza. Meta ha anche pubblicato un confronto di preferenza rispetto a due sistemi avatar commerciali — 78/22 contro uno, 88/12 contro l'altro — e ha rivelato che, sui manierismi, il risultato contro uno dei due non è statisticamente distinguibile dalla parità. Quella divulgazione vale più delle vittorie; è il tipo di risultato che la maggior parte dei post di lancio omette.
L'evidenza pubblicata da SeedRealtime è una singola valutazione umana end-to-end. ByteDance afferma che, rispetto ai sistemi a cascata — un modello di visione collegato a un modello ASR collegato a un LLM collegato a una voce text-to-speech — SeedRealtime dimezza i problemi di ritmo conversazionale audiovisivo, con meno interruzioni, meno falsi inneschi e risposte più lente e naturali. Ciò che ByteDance non ha pubblicato è un'ampiezza del campione, una metodologia, un numero di annotatori, un dato di latenza in millisecondi, il nome di un benchmark o un punteggio. Un rapporto secondario cita un guadagno del 12% nella fluidità conversazionale rispetto ai modelli precedenti del team. Questa è l'intera base di evidenze pubbliche.
Quindi la classifica onesta della verificabilità è questa: nessuno dei due ha un'esecuzione indipendente; quello di Meta è un insieme di misurazioni con baseline dichiarate e un risultato negativo reso noto; quello di ByteDance è un'unica affermazione di preferenza il cui disegno non è descritto. Nessuno dei due è riproducibile, ma solo uno dei due è abbastanza specifico da poter essere contestato.

La mossa che ciascuno fece
Entrambi i sistemi sono risposte allo stesso problema, e vale la pena vedere che le due risposte sono diverse.
Per un sistema che osserva, la parte difficile è sapere quando parlare. Un modello che riceve continuamente fotogrammi della telecamera e audio deve decidere, senza un trigger esterno, se la persona davanti a sé ha finito, se è stato interpellato e se l'oggetto appena entrato nell'inquadratura è rilevante. È il problema che SeedRealtime ha spostato all'interno del modello, e ByteDance ha compiuto il passo su tre modalità anziché due — una versione più difficile di ciò che Google, OpenAI e NVIDIA hanno fatto ciascuno solo per l'audio. I comportamenti mostrati nella demo derivano da questo: associare una voce a un volto in una conversazione di gruppo, prendere la parola senza essere sollecitato quando qualcosa entra nell'inquadratura, guidare qualcuno attraverso un museo o una riparazione.
Per un sistema che esegue rendering, la parte difficile è mantenere la coerenza. Generare video in brevi blocchi causali significa che ogni blocco è condizionato dal precedente, e la modalità di errore è la deriva: al terzo minuto, il personaggio è silenziosamente diventato qualcun altro. La finestra scorrevole di Meta sui latenti video recenti è la risposta a questo, e il flusso di token condiviso è la risposta a un altro problema, l'aspetto doppiato che si ottiene quando l'audio viene generato prima e un modello di lip-sync viene applicato a posteriori.
Nessuna delle due mosse è disponibile nell'altro sistema. SeedRealtime non ha un'immagine di riferimento a cui restare fedele, perché non sta renderizzando nessuno. Muse Realtime Avatar non ha un mondo esterno da tracciare, perché il suo intero compito è produrre un volto che corrisponda a una voce.

Perché un modello non richiamabile è comunque una questione di routing
Entrambi questi sistemi delegano. Muse Realtime Avatar si basa su Muse Realtime Voice, che è lo strato conversazionale di un agente il cui ragionamento viene eseguito su Muse Spark — è il modello a fare il rendering, non il pensiero. Il design di SeedRealtime mantiene viva la conversazione mentre avviene il lavoro in background, il che significa che il lavoro che supera ciò che può fare inline va altrove e poi ritorna. In entrambe le architetture, ciò con cui l'utente interagisce è un front end, e l'intelligenza è un modello di testo separato dietro di esso.
Quel modello di testo separato è inferenza ordinaria, ed è la parte dello stack che puoi effettivamente acquistare. Su OrcaRouter è un unico endpoint che copre 196 modelli da 15 provider, al prezzo di listino del provider passato senza alcun ricarico, con failover automatico quando il modello che hai scelto genera errori o va in timeout. Noi non ospitiamo SeedRealtime — è di ByteDance, dentro Doubao, e non c'è nulla da instradare. Non ospitiamo nemmeno Muse Realtime Avatar, e neanche chiunque altro. Ciò che offriamo è lo strato a cui entrambi i sistemi affidano il proprio lavoro più impegnativo, ovvero lo strato che cambia quando vuoi che sia un modello diverso a fare il ragionamento.
Cosa cambierebbe la risposta
Per SeedRealtime, il tassello mancante non è una funzionalità: sono le prove. Un rapporto tecnico con un conteggio dei parametri, una suite di benchmark e una valutazione umana descritta lo farebbero passare da "una dimostrazione all'interno di un'app" a qualcosa su cui un team potrebbe ragionare. Il post di ByteDance inoltre rimanda a destinazioni generiche "Prova Dola" e "Prova nel Playground" senza rivendicare pesi o un'API documentata, che è il pattern di una funzionalità di prodotto piuttosto che di un rilascio di modello.
Per Muse Realtime Avatar, il tassello mancante è di natura commerciale: un listino prezzi, un endpoint, una data e i termini su regione ed età che Meta non ha specificato del tutto. Il post di Meta osserva che le sue demo non riflettono tutte gli avatar disponibili nell'app Muse, ed è questa la frase che dovrebbe governare qualsiasi piano costruito su questo.
Finché una di quelle cose non cambia, il confronto ha una forma insolitamente breve. Entrambi i modelli sono audiovisivi, entrambi sono full-duplex, entrambi sono ingegneria davvero impressionante, e nessuno dei due può essere invocato da un terminale da chiunque stia leggendo questo. La differenza sta in ciò che faresti con loro se potessi: uno ti dà un personaggio che parla, e uno ti dà un sistema che nota.

