Una hero card generata per l'articolo «Muse Realtime Avatar vs Realtime-Venus», che mostra due card arrotondate ai due lati del titolo. La card di sinistra riporta «Muse Realtime Avatar» sopra un'icona di fotogramma video in uscita e le righe «genera il video» e «448x768 a 25 fps, closed»; la card di destra riporta «Realtime-Venus» sopra un'icona di fotocamera in entrata e le righe «legge il video» e «2 x 9B, Apache-2.0, scaricabile». Un sottotitolo recita «Uno genera un volto. L'altro lo osserva.» Il logo OrcaRouter è sovrapposto nell'angolo in basso a destra.
Guides & Insights

Muse Realtime Avatar vs Realtime-Venus: video in uscita contro video in ingresso

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due sistemi annunciati a nove giorni di distanza si definiscono entrambi in tempo reale ed entrambi rivendicano l'etichetta audiovisiva, e puntano in direzioni opposte lungo lo stesso asse. Muse Realtime Avatar, annunciato da Meta il 23 settembre 2026, prende una fotografia e genera un video in cui parla — il suo video è l'output, fotogrammi verticali 448×768 a 25 al secondo, prodotti da un Diffusion Transformer guidato dall'audio che condivide un flusso di token con Muse Realtime Voice. Realtime-Venus, caricato su arXiv il 12 settembre 2026 dal Venus Team di Ant Group con la Tsinghua University, consuma video: il checkpoint Realtime-Venus-Omni trasmette in streaming fotogrammi della fotocamera attraverso un encoder SigLIP2 e parla di ciò che vede, mentre il checkpoint Realtime-Venus-Audio è lo stesso backbone con la visione disattivata al momento del caricamento. Uno renderizza un volto. L'altro ne osserva uno. Nessuno dei due è invocabile, e solo uno dei due è scaricabile — il che si rivela la differenza più significativa.

L'inversione della disponibilità vale la pena dichiararla chiaramente prima di ogni altra cosa, perché va contro ogni aspettativa su un prodotto Meta e un rilascio di un laboratorio di ricerca. Il sistema di Meta è chiuso: annunciato a Connect, dimostrato in un post di ricerca, integrato nell'agente Muse, senza API, senza pesi, senza prezzo e senza data. Il sistema di Ant Group è aperto: due checkpoint da 9B come safetensors BF16 sotto Apache-2.0 su inclusionAI/Realtime-Venus su Hugging Face, con codice Transformers personalizzato, un file requirements, una voce di riferimento, una pagina di progetto e un repository GitHub di accompagnamento. L'azienda con il prodotto di consumo non ha rilasciato nulla che si possa tenere in mano. Il team di ricerca ha rilasciato tutto quanto.

Cosa fa ciascuno con un frame

La direzione del video è l'intera differenza architetturale, e non è una questione di enfasi.

Video — Muse Realtime Avatar lo genera, condizionato da token vocali, un'immagine di riferimento e una finestra scorrevole di latent video recenti; Realtime-Venus-Omni lo percepisce, con un encoder visivo SigLIP2 che invia in streaming i fotogrammi al modello insieme all'audio.

Audio — Muse Realtime Avatar guida la generazione a partire dai token vocali di Muse Realtime Voice, che racchiudono insieme contenuto e prosodia; Realtime-Venus genera il parlato come token S3 discreti decodificati da un decoder streaming flow-matching, anziché aggiungere alla fine un modello text-to-speech separato.

Backbone — L'architettura di Meta è un Diffusion Transformer audio-driven di dimensioni non dichiarate; Realtime-Venus si basa su un backbone linguistico Qwen3-8B con un encoder audio Whisper-Medium, e la sua model card dichiara che il checkpoint Omni è adattato da MiniCPM-o 4.5.

Pesi — I Muse Realtime Avatar non sono pubblicati e non c'è alcuna indicazione che lo saranno; Realtime-Venus distribuisce due checkpoint da 9B, BF16, con contesto di 40.960 token su entrambi, sotto licenza Apache-2.0.

Accesso — Muse Realtime Avatar non ha API né una data; anche Realtime-Venus non ha API, e la sua scheda dichiara chiaramente che non è distribuito da alcun fornitore di inferenza.

Dove gira — Muse Realtime Avatar gira all'interno dell'app Muse per gli utenti che Meta non ha enumerato, a condizioni 18+; Realtime-Venus gira sulle tue GPU, oggi, se hai l'hardware e l'appetito.

Leggi insieme le ultime due righe e la differenza pratica emerge. Nessuno dei due sistemi può essere chiamato. Uno dei due può essere eseguito.

Il download da 9B è reale, e lo è anche ciò che ti costa

Realtime-Venus non è uno stub di repository. I pesi ci sono, il codice di caricamento personalizzato c'è, e la licenza al livello superiore è Apache-2.0. Ci sono due cose che vale la pena sapere prima di pianificare in base a esso.

La prima è ciò che non è nei pesi. Il runtime a doppio ciclo che rende distintiva l'architettura — il ciclo di interazione di un secondo più uno scheduler in background che l'articolo chiama Realtime-Venus-Harness, il quale esegue attività delegate su un'istantanea isolata dello stato della conversazione, così che un lavoro di lunga durata non possa essere corrotto dal fatto che la conversazione prosegua — risiede nel repository GitHub come componente separato. Il design della delega, che è l'idea davvero nuova nel report, è la parte che assembli e di cui ti fidi da solo.

Il secondo è la genealogia. La scheda afferma che il checkpoint Omni è adattato da MiniCPM-o 4.5, il modello omni-modale da 9B che OpenBMB ha reso open source all'inizio del 2026. Non è una nota a piè di pagina. Significa che il contributo di Ant Group è il post-training, il runtime e il design della delega sovrapposti al backbone di streaming di qualcun altro, il che è un'affermazione più ristretta e più specifica di «un nuovo modello omni da 9B» — e anche più utile, perché ti dice dove guardare se qualcosa nel visual encoder si comporta in modo anomalo.

I numeri, e esattamente di chi sono

È qui che i due sistemi convergono in modo poco utile: nessuno dei due ha una singola valutazione indipendente. Le quattro cifre di Meta sono riportate dall'azienda rispetto a baseline scelte da Meta. Quelle di Realtime-Venus sono riportate dagli autori in un rapporto tecnico, senza che terze parti abbiano pubblicato un'esecuzione e senza alcuna voce in classifica con cui confrontarsi. Non esiste una misurazione pubblica di nessuno dei due sistemi da parte di qualcuno che non lo abbia costruito.

I quattro di Meta, come pubblicati: 870 ms dalla fine del tuo turno al primo byte di una risposta sincronizzata voce e video; video verticale 448×768 a 25 fotogrammi al secondo; 60 volte meno valutazioni del modello rispetto alla propria baseline; e 12 sessioni in tempo reale simultanee su una singola NVIDIA GB200, un guadagno di capacità di 8 volte rispetto alla baseline BF16 a due passaggi di Meta. Meta divulga anche i risultati di preferenza rispetto a due sistemi avatar commerciali, uno dei quali riferisce come non statisticamente distinguibile dalla parità quanto a gestualità — una divulgazione meritevole di riconoscimento, poiché è il tipo di risultato che la maggior parte dei post di lancio omette.

Di Ant Group, come pubblicato: miglior punteggio su sei degli otto benchmark video utilizzati dal report, inclusi StreamingBench 70.2, OVO-Bench 64.7 e Daily-Omni 81.3 per il checkpoint Omni; e per il checkpoint Audio, MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8 e un punteggio VoiceBench AlpacaEval di 4.81 che il report descrive come pari al miglior valore di confronto.

Un'asimmetria nelle evidenze merita di essere menzionata. Le cifre di Ant Group sono punteggi di benchmark con set di test denominati — riproducibili in linea di principio, da chiunque sia disposto a scaricare i pesi ed eseguire la suite. Il numero di punta di Meta è una misurazione della latenza sullo stack di serving di Meta, che nessuno al di fuori di Meta può riprodurre perché nessuno al di fuori di Meta possiede il sistema. Il rilascio aperto, in altre parole, è anche quello più verificabile.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

Perché entrambi questi sono un problema di routing mascherato

Nessuno dei due sistemi è un agente completo, e ciò vale allo stesso modo per entrambi. Muse Realtime Avatar è un livello di rendering imbullonato su Muse Realtime Voice, che è il livello conversazionale di un agente il cui ragionamento gira su Muse Spark. Realtime-Venus delega tutto ciò che supera ciò che può fare inline — recupero, chiamate di strumenti, ragionamento complesso — a un'infrastruttura che esegue il lavoro in background su un'istantanea della conversazione. In entrambi i progetti, la cosa con cui l'utente parla è un front end, e il pensiero avviene in un modello di testo separato.

Quel modello di testo separato è la parte che puoi instradare. Su OrcaRouter è un unico endpoint per 196 modelli su 15 provider, al prezzo di listino del provider passato senza alcun ricarico, con failover automatico quando un modello dà errore o va in timeout — cosa che conta più del solito quando ciò che sta dall'altra parte è un checkpoint self-hosted che nessuno ha valutato in modo indipendente. Non ospitiamo Realtime-Venus: è un download, e non lo serviamo. Non ospitiamo nemmeno Muse Realtime Avatar, perché nessuno lo fa. Ciò che forniamo è il livello a cui entrambe le architetture affidano il proprio lavoro più duro, così un componente non collaudato su uno dei due lati della conversazione è una riga di configurazione anziché una scommessa di produzione.

Quale di questi è in realtà più avanti?

L'istinto è dire quello di Meta, perché Meta ha il prodotto e il video dimostrativo. Le prove dicono qualcosa di più interessante. Il sistema di Meta ha un'ingegneria di produzione migliore — 12 sessioni simultanee su un GB200 sono un risultato di serving, e i test di preferenza divulgati rispetto ai prodotti avatar in commercio sono gli unici numeri di confronto diretto che entrambi i sistemi hanno. Il sistema di Ant Group ha una verificabilità migliore: benchmark con nome, pesi pubblicati, una licenza Apache-2.0 e un report che chiunque può tentare di riprodurre.

Ciò che manca a entrambi è un modo per pagarlo. E quello che è più vicino a essere utilizzabile non è quello con l'app per i consumatori — è quello che puoi scaricare stasera e scoprire da te, sul tuo hardware, con i tuoi dati e senza bisogno di alcun annuncio.

Se stai scegliendo, la domanda non è quale modello sia migliore. È se vuoi un volto che non puoi chiamare o una telecamera che puoi azionare.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.