Card del titolo principale per 'Realtime-Venus vs Qwen-Audio-3.0-TTS', con sottotitolo 'Un renderer e un ascoltatore non sono lo stesso acquisto', con tre card che recitano 'Qwen-Audio-3.0-TTS-Plus: Elo 1.259, secondo nella Provider Voice Arena di Artificial Analysis', 'Realtime-Venus: non esiste alcun punteggio di qualità vocale' e 'L'input è tutta la differenza: solo testo, contro audio, video e testo', sopra una striscia a piè di pagina che recita 'I dati di Qwen secondo Artificial Analysis; i dati di Realtime-Venus dal suo rapporto tecnico, non riprodotti.' Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Realtime-Venus vs Qwen-Audio-3.0-TTS: uno legge il tuo copione, l'altro deve sentirti

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il confronto allettante tra Realtime-Venus e Qwen-Audio-3.0-TTS è il prezzo per ora di audio, e produce una risposta netta che è del tutto sbagliata. Qwen-Audio-3.0-TTS-Plus sintetizza il parlato a circa 27,6 dollari per milione di caratteri, che equivale a quasi 1,66 dollari per un'ora di audio finito. Realtime-Venus, il sistema full-duplex da 9B che il Venus Team di Ant Group ha costruito con l'Università Tsinghua, non ha alcun prezzo perché non ha un servizio hosted — ma in self-hosting ti costerebbe un nodo GPU in esecuzione continua, che è almeno un ordine di grandezza in più all'ora. Il renderer vince sull'aritmetica. L'aritmetica sta misurando due prodotti diversi: Qwen-Audio-3.0-TTS prende testo e restituisce audio, mentre Realtime-Venus prende audio e video e restituisce una conversazione. La domanda che li separa davvero non è ciò che restituiscono. È se qualcosa debba replicare.

L'input fa tutta la differenza

Qwen-Audio-3.0-TTS, rilasciato dal Tongyi Lab di Alibaba Cloud il 20 luglio 2026, è un modello text-to-speech esposto come API ospitata, senza pesi aperti. Il testo entra attraverso un endpoint HTTP e l'audio esce. Non esiste alcun percorso di input audio, nessun turno da prendere, nessuna trascrizione da restituire e nessun concetto di essere interrotto — il modello non ha mai sentito nulla. Il suo intero modello di costo è una macchina da stampa: caratteri in ingresso, audio in uscita.

Realtime-Venus, al contrario, è permanentemente in ascolto. Il checkpoint audio-visivo contiene un encoder visivo SigLIP2 per i frame in streaming e un encoder audio Whisper-Medium che alimenta un backbone Qwen3-8B, ed entrambi i checkpoint eseguono un ciclo di interazione di un secondo che aggiorna continuamente lo stato conversazionale e decide se parlare o restare in silenzio. Produce parlato tramite token S3 discreti e un decoder streaming flow-matching anziché una fase di sintesi separata, e può restituire testo insieme alla forma d'onda.

Non è una differenza di funzionalità. È la differenza tra un componente e un sistema. Mettili uno accanto all'altro e uno dei due può essere inserito in una pipeline che ha già davanti a sé un riconoscitore vocale e un modello linguistico. L'altro li sostituisce tutti e tre.

Un caso svolto lo rende concreto

Prendi una linea di supporto. Un cliente chiama, descrive male un problema, si interrompe a metà frase per trovare un numero di account, viene interrotto da un annuncio in sottofondo e poi fa una domanda di follow-up prima che l’operatore abbia finito di rispondere.

Un sistema basato su Qwen-Audio-3.0-TTS gestisce tutto questo come tre fornitori e tre fatture: un riconoscitore converte il parlato del chiamante in testo, un modello linguistico decide cosa dire e Qwen-Audio-3.0-TTS lo pronuncia. Ogni passaggio aggiunge latenza, e ogni confine è il punto in cui la prosodia muore. Il guasto critico è strutturale — il ramo TTS non può sentire la pausa nel mezzo di una frase che sta già pronunciando, quindi l'interruzione (barge-in) deve essere gestita da qualcosa che sta davanti.

Realtime-Venus gestisce la stessa chiamata come un unico modello, senza rilevatore esterno di attività vocale, senza passaggio di consegne. Le sue cifre di Full-Duplex-Bench v1.5 — 75% di risposta alle interruzioni e tassi di continuazione del 97% in presenza di backchannel, dell'88% con parlato rivolto ad altri e dell'86% con parlato di sottofondo — sono esattamente le metriche che descrivono questo scenario. Sono anche auto-riportate, dal rapporto tecnico del modello stesso, senza riproduzione esterna. Leggile come un'affermazione di progettazione, non come una misurazione.

Qualità vocale: uno ha un Elo, l'altro non ha nulla

Questa è la parte più sbilanciata del confronto, e favorisce Alibaba con un ampio margine.

• Punteggio indipendente — Qwen-Audio-3.0-TTS-Plus si colloca al secondo posto nella Provider Voice Arena di Artificial Analysis con un Elo di 1.259 su 1.544 campioni al 18 settembre 2026, dietro a Cartesia Sonic 3.6 a 1.277 e davanti a Inworld Realtime TTS-2 a 1.247 e Speechify Simba 3.2 a 1.241.

• Da dove è iniziato — la colonna delle uscite della stessa arena elenca questo modello come voce di settembre 2026, che è il tier così come attualmente valutato, piuttosto che la data di lancio del 20 luglio 2026. Ogni volta che si è spostato, ha mantenuto le prime due posizioni per tutto il tempo.

• Realtime-Venus — nessuna presenza nell'arena, nessuna valutazione vocale di terze parti, niente. Il suo unico dato relativo alla voce è un punteggio VoiceBench AlpacaEval autodichiarato di 4,81 che il rapporto descrive come pari al miglior dato di confronto.

• Che cosa significa: nessuno al di fuori degli autori ha giudicato se Realtime-Venus suoni bene. Non è un demerito; è semplicemente sconosciuto, e sconosciuto è diverso da scadente. Ma se la qualità della voce è il risultato da consegnare, comprare un modello con valutazione Elo è meglio che prendere sulla fiducia uno non valutato.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

Lingua, voci e controllo espressivo

Il modello di Alibaba è progettato per l'ampiezza della resa. Offre più di mille voci, copre sedici lingue incluse venti regioni dialettali cinesi ed espone 86 tag inline per emozione e resa — una superficie di controllo che si scrive nel testo stesso, oltre a istruzioni di resa in linguaggio naturale. L'output arriva fino a 48 kHz, in aumento rispetto ai 24 kHz della generazione precedente, e una singola sintesi può durare fino a tre minuti. Il livello Flash punta a circa 300 millisecondi al primo pacchetto per la riproduzione in tempo reale; il livello Plus è il livello di qualità e genera a circa sedici caratteri al secondo, abbastanza lento da avere un peso in un prodotto live e invisibile nel rendering in batch.

Realtime-Venus documenta l'inglese e il cinese, include una voce di riferimento insieme ai pesi e fornisce un decoder da token a forma d'onda anziché una libreria di voci. L'espressività nel senso di Qwen — tag, istruzioni, mille preset — qui non ha equivalente. Quello che ha invece è la capacità di cambiare la propria resa in risposta a ciò che sta ascoltando, che è un tipo diverso di controllo espressivo e molto più difficile da mettere su una scheda tecnica.

Il costo di ogni percorso, a essere onesti

C'è un avvertimento concreto sul dato di Alibaba prima di usarlo per fare un budget. Il valore di 27,6 $ per milione di caratteri, citato ovunque, non coincide con la pagina dei prezzi di Alibaba in ogni rilevazione, e i livelli hanno prezzi separati. Verifica la cifra a livello di account invece di fidarti di una tabella comparativa, compresa questa.

Realtime-Venus non ha un prezzo di listino perché non c'è nulla da acquistare. Il costo è di due checkpoint 9B in BF16 — circa diciotto gigabyte di pesi ciascuno prima della memoria di attivazione — più un ciclo di streaming continuo, il che significa un nodo GPU fatturato mensilmente che qualcuno chiami o meno. A volume costante è più economico per conversazione di un'API vocale a consumo. A volume intermittente è molto peggio, e il punto di crossover è l'unica questione finanziaria che conti.

Esiste una terza via su cui molti team finiranno per atterrare, e vale la pena nominarla perché cambia la forma della decisione. Se mantieni una cascata, l'unico segmento che deve essere un modello ospitato è quello centrale — il reasoning. OrcaRouter non offre né Qwen-Audio-3.0-TTS né Realtime-Venus; entrambi i livelli vocali sono al di fuori di ciò che serviamo, e preferiamo dirlo piuttosto che lasciarlo intendere. Il segmento del reasoning è quello che invece copriamo: quasi 200 modelli testuali dietro un'unica chiave al prezzo di listino del provider, senza alcun ricarico, failover automatico tra gli upstream, così un pomeriggio storto presso un provider non fa cadere una chiamata in corso, un DSL di routing che compone più modelli in un'unica chiamata, e la fusione di modelli quando una decisione merita più di un parere. In una cascata è il segmento che più vorresti poter sostituire senza rinegoziare un contratto, e quello in cui un taglio di prezzo del fornitore arriva lo stesso giorno invece che al rinnovo.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

La clonazione è un'arma a doppio taglio

Qwen-Audio-3.0-TTS può clonare una voce da un breve campione di riferimento, in modo trasversale rispetto alle lingue, ed è documentato come robusto a input rumorosi o riverberanti. Questa è la capacità singolarmente più utile dal punto di vista commerciale nel confronto e la superficie di conformità più ampia. Un prodotto in grado di riprodurre qualsiasi locutore da dieci secondi di audio ha una risposta molto più lunga a "di chi è quella voce e chi ha acconsentito al suo utilizzo" rispetto a uno che parla sempre e solo con le preimpostazioni di un fornitore.

Realtime-Venus include una voce di riferimento insieme ai pesi. Puoi clonare con essa se hai l'audio e l'esecuzione di addestramento, ma nulla nella release è pensato per rendere tutto ciò semplice — il che, per un deployment self-hosted all'interno di un confine di conformità, è probabilmente la scelta predefinita più sicura.

Quale stai acquistando davvero

Acquista Qwen-Audio-3.0-TTS quando l'audio è l'output. Narrazione, localizzazione, accessibilità, doppiaggio, qualsiasi flusso di lavoro in cui il testo esiste prima che esista il suono e la metrica è la qualità per ora renderizzata. Inizia con Flash se la riproduzione è live, passa a Plus quando la voce stessa è il prodotto, e imposta il prezzo del flusso di lavoro di clonazione separatamente da quello della libreria di preset.

Rivolgiti a Realtime-Venus quando l'input è una persona e il sistema deve comportarsi come un ascoltatore. Assistenza consapevole della telecamera, interazione a mani libere, qualsiasi cosa in cui un essere umano interromperà a metà frase e si aspetterà che il sistema la gestisca. Il compromesso è netto: rinunci a una voce con valutazione Elo, a mille preset e a qualsiasi opzione ospitata, e in cambio ottieni l'unico dei due che può sentirti.

La maggior parte dei prodotti li vuole entrambi, in contesti diversi. Ciò che non dovrebbero condividere è un modello di costo — il prezzo per ora di audio è la metrica giusta per esattamente uno di questi due modelli, e non è quello che sostiene la conversazione.