Una card hero con titolo generata per StepAudio 3 TTS vs Qwen-Audio-3.0-TTS con l'occhiello "OrcaRouter · radar dei modelli — testa a testa", il titolo "StepAudio 3 TTS vs Qwen-Audio-3.0-TTS" e il sottotitolo "Uno ha un punteggio nell'arena di ascolto in cieco. L'altro è stato rilasciato sette settimane dopo l'ultimo voto", sopra due card arrotondate dei modelli poste ai due lati di un simbolo versus.
Guides & Insights

StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: uno di questi ha un punteggio Arena, e non è quello nuovo

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ecco l'intera comparazione in una riga. Qwen-Audio-3.0-TTS si trova nella Text-to-Speech Arena con un Elo di 1.234 per il suo livello Plus — un punteggio ottenuto con 2.502 voti di ascolto cieco. StepAudio 3 TTS, pubblicato da StepFun il 15 settembre 2026, non compare affatto in quella classifica. Il suo predecessore invece sì: StepAudio 2.5 TTS detiene un Elo di 1.209 con 1.306 voti.

Quindi la domanda onesta non è "quale suona meglio". È se un divario di 25 punti Elo, misurato sulla generazione precedente, sopravvive a un rilascio che StepFun dice abbia migliorato la prosodia e tagliato il prezzo di oltre la metà. Nessuno ha ancora eseguito quel voto, e tutto ciò che segue è organizzato attorno a quella lacuna nelle prove invece di fingere che non esista.

Il tabellone, come effettivamente recita oggi

Vale la pena vedere le classifiche reali, perché diversi articoli in circolazione ne citano una versione obsoleta. L'arena di ascolto cieco classifica i modelli di sintesi in base a quale campione i votanti hanno preferito. Leggi lungo la parte superiore del tabellone vocale dei fornitori:

• Cartesia Sonic 3.6 — Elo 1.277, agosto 2026, $49,0 per milione di caratteri

• Inworld Realtime TTS-2 — Elo 1.243, agosto 2026, 20,8 $ per milione di caratteri

• SpeechifyAI Simba 3.2 — Elo 1.238, luglio 2026, 6,6 $ per milione di caratteri

Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1.234, luglio 2026, 27,6 $ per milione di caratteri, 8 voci dell'arena

• VUI Labs Luna TTS — Elo 1.229, giugno 2026, 80,0 $ per milione di caratteri

• Inworld Realtime TTS-2 Flash — Elo 1.213, agosto 2026, 10,4 $ per milione di caratteri

• StepFun StepAudio 2.5 TTS — Elo 1.209, agosto 2026, 85,0 $ per milione di caratteri, 8 voci arena

Google Gemini 3.1 Flash TTS — Elo 1.204, aprile 2026, 18,3 $ per milione di caratteri

Screenshot of the Artificial Analysis Provider Voice Arena text-to-speech leaderboard, showing Cartesia Sonic 3.6 first at Elo 1,277, Alibaba Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,234 over 2,502 samples at $27.6 per million characters, and StepFun StepAudio 2.5 TTS seventh at Elo 1,209 over 1,306 samples at $85.0 per million characters, with confidence intervals of -14/+14 and -16/+16 respectively.

Due cose emergono subito da quell’elenco. La prima è che il livello Plus di Qwen non è il leader — è quarto, dietro Cartesia, Inworld e Speechify, e il valore 1.234 che viene citato come una corona è un punteggio di metà classifica su una tabella che da allora si è mossa. La seconda è che StepAudio 2.5 TTS è stato rieseguito nell’agosto 2026 e si è classificato settimo, 25 Elo dietro Qwen, a più del triplo del prezzo.

E una terza cosa che conta più di tutte le altre: guarda gli intervalli di confidenza. Il tier Plus di Qwen è indicato a −14/+14 su 2.502 campioni. StepAudio 2.5 TTS è indicato a −16/+16 su 1.306. Questi intervalli si sovrappongono. Un divario di 25 punti tra due modelli le cui barre d'errore coprono 14 e 16 punti in entrambe le direzioni non è una differenza di qualità dimostrata — sono due modelli che l'arena al momento non riesce a separare, classificati in un ordine che qualche centinaio di voti in più potrebbe invertire.

A generated scoreboard titled 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS — the scoreboard'. The StepAudio column reads Arena Elo 'not scored yet', Samples 'none', Price '2.5 yuan / 10,000 chars', Voices 'not published', Languages 'Chinese-first', Request size 'not published'. The Qwen column reads Arena Elo '1,234, Plus tier', Samples '2,502', Price '$27.6 / 1M chars', Voices 'over 1,000', Languages '16 + 20 dialects', Request size '20,000 chars'. Footer: 'Qwen figures per the Artificial Analysis text-to-speech arena; StepAudio 3 TTS has no arena score yet.'

Quanto ti costa il punto dati mancante

StepAudio 3 TTS è il modello con cui StepFun ha sostituito StepAudio 2.5 TTS, e il lancio rivendica il controllo su timbro, intonazione, ritmo e pause respiratorie, oltre a comportamenti paralinguistici — risate, esitazione, balbuzie, ripetizione, autocorrezione — forniti tramite un'architettura in streaming in cui generazione e riproduzione si sovrappongono.

È esattamente l'insieme di qualità che l'arena misura. È anche esattamente il motivo per cui l'assenza di un punteggio è frustrante anziché fatale: il benchmark che risponderebbe alla domanda esiste, viene eseguito pubblicamente e semplicemente non è stato rieseguito da quando è stato rilasciato il nuovo modello. Chiunque ti dica che StepAudio 3 TTS suona meglio di Qwen-Audio-3.0-TTS sta estrapolando da un predecessore che ha perso con un margine che rientra nelle sue stesse barre di errore.

Il prezzo è la parte che è pienamente documentata, e si è mosso molto

StepAudio 3 TTS viene fatturato a 2,5 yuan per 10.000 caratteri sulla piattaforma di StepFun stessa. StepAudio 2.5 TTS veniva fatturato a 5,8. Nella colonna dei prezzi basata sui caratteri dell'arena stessa, il modello più vecchio era a 85,00 $ per milione di caratteri; 2,5 yuan per 10.000 caratteri equivalgono a circa 35 $ per milione ai tassi di cambio recenti — una conversione nostra, non una cifra pubblicata, e che vale la pena rifare in base alla tua regione e al tuo cambio. Si tratta di un taglio di quasi il 60% sulla stessa voce.

È ancora al di sopra di Qwen. Qwen-Audio-3.0-TTS-Plus è indicato a $27,6 per milione di caratteri, e il livello Flash è ancora più economico, con Alibaba Cloud Model Studio che fattura la sintesi in base ai caratteri di input anziché all'audio prodotto — l'output non viene fatturato separatamente. Le piattaforme di terze parti che elencano il livello Flash propongono tariffe nella fascia alta tra i dieci e i venti per milione, anche se la variazione regionale rende inaffidabile qualsiasi singolo numero di riferimento.

Quindi il quadro è questo: StepFun ha circa dimezzato il costo di sintesi, ha colmato gran parte del divario con Qwen, ma non l’ha superato. Se il prezzo per carattere è il tuo vincolo determinante, l’argomentazione si restringe, ma la risposta non cambia. Se non lo è, il prezzo ha smesso di essere il motivo per scegliere l’uno o l’altro modello.

L'inventario vocale e la copertura linguistica sono lontani

È qui che il confronto smette di essere una questione di giudizio e diventa una questione di specifica.

• Inventario vocale — Qwen-Audio-3.0-TTS: oltre 1.000 voci tra i suoi livelli vs StepAudio 3 TTS: nessun conteggio pubblicato comparabile

• Lingue — Qwen-Audio-3.0-TTS 16 lingue più 20 dialetti cinesi, con il tier Flash ottimizzato per le lingue a basse risorse e per l'autenticità dei dialetti, rispetto a StepAudio 3 TTS incentrato sul cinese, senza alcuna dichiarazione di copertura equivalente

• Dimensione della richiesta — Qwen-Audio-3.0-TTS 20.000 caratteri per richiesta vs StepAudio 3 TTS non pubblicato

• Latenza — Qwen-Audio-3.0-TTS Flash punta a una latenza del primo pacchetto entro 200 ms secondo la documentazione ufficiale di Alibaba, rispetto a StepAudio 3 TTS streaming, per cui non è pubblicato alcun dato

• Suddivisione in livelli — Qwen-Audio-3.0-TTS Plus per l'espressività e Flash per il tempo reale, sei voci di punta vincolate a un livello o all'altro rispetto a StepAudio 3 TTS con un unico livello

• Superficie di controllo — direzione di resa in linguaggio naturale di Qwen-Audio-3.0-TTS più tag di espressione inline come [excited], [laughing], [whispers] incorporati nel testo di input vs prosodia inferita dal contesto dal modello StepAudio 3 TTS

• Clonazione vocale — StepAudio 3 TTS a un prezzo fisso di 9,9 yuan per voce clonata su tutti i suoi livelli TTS rispetto alla clonazione di Qwen-Audio-3.0-TTS tramite Alibaba Cloud Model Studio

• Uscita — Frequenza di campionamento predefinita: 24 kHz per Qwen-Audio-3.0-TTS; non pubblicata per StepAudio 3 TTS

Quella riga della superficie di controllo è la vera differenza progettuale, e non è una questione di qualità. I tag di espressione di Qwen sono espliciti e sincroni: scrivi l'emozione nel testo e il modello la rende, il che li rende verificabili e adatti ai test di regressione. La descrizione di StepFun riguarda un modello che inferisce dal contesto l'esitazione o la risata appropriate, il che suona meglio quando è giusto ed è molto più difficile da circoscrivere quando è sbagliato. Scegli in base a se preferisci plasmare tu la performance o delegarla.

Screenshot of Alibaba Cloud Model Studio documentation for qwen-audio-3.0-tts-flash, showing the model capabilities table with text input and audio output, function calling and fine-tuning unsupported, and a note that the Flash version controls first-packet latency within 200 ms.

Come decidere senza la misurazione

Non puoi arrivare a una risposta ragionando sui numeri pubblicati, perché quello decisivo non esiste. Restano i test, e testare questi due ha una forma specifica che vale la pena pianificare.

Entrambe sono API commerciali disponibili solo in hosting — Qwen-Audio-3.0-TTS tramite Alibaba Cloud Model Studio, StepAudio 3 TTS tramite la piattaforma aperta di StepFun. Nessuna delle due è open weights, quindi non esiste un percorso self-hosted da valutare. Per essere precisi su ciò che OrcaRouter copre in questo caso: i modelli text-to-speech presenti oggi nel nostro catalogo sono la famiglia OpenAI tts-1, gpt-4o-mini-tts e le anteprime Gemini TTS di Google. Nessuno dei modelli di cui parla questo articolo è presente, e nemmeno Qwen-Audio-3.0-TTS lo è — nulla di quanto scritto qui va interpretato come un'affermazione che li serviamo.

La parte che invece risiede su OrcaRouter è la metà testuale della pipeline. Gli script che il tuo livello di sintesi legge sono generati da un modello linguistico, ed è il componente che cambia più spesso, che costa di più da ricontrattare e che è più facile lasciare senza una versione fissata — quasi 200 modelli testuali dietro un'unica API, failover automatico, un DSL di routing che ne compone diversi in un'unica chiamata e la fusione di modelli dove il giudizio di un solo modello non basta, con il prezzo di listino del provider passato senza markup. Se esegui una valutazione in cieco tra questi due modelli di sintesi, genera il corpus attraverso un unico endpoint in modo che entrambi i candidati leggano input identici, e mantieni il livello di sintesi dietro un'interfaccia che puoi sostituire.

Dove questo lascia la decisione

Scegli oggi Qwen-Audio-3.0-TTS se ti serve ampiezza — oltre mille voci, 16 lingue e 20 dialetti, un limite documentato di 20.000 caratteri per richiesta, un livello di latenza e un livello di espressività, un obiettivo di 200 ms per il primo pacchetto e una tariffa inferiore a quella di StepFun. È il modello con una misurazione alle spalle e la copertura più ampia, e il suo Elo al quarto posto è un risultato reale anche se non è la corona che gli viene attribuita.

Scegli StepAudio 3 TTS se stai sviluppando con il cinese come priorità, se vuoi un unico tier invece di dover decidere quale tier scegliere, se vuoi il cloning a una tariffa fissa pubblicata e se sei disposto a essere tra i primi a usare un modello che non è stato testato in cieco. Stai pagando circa il 27% in più per carattere rispetto al tier Plus di Qwen in cambio di un miglioramento dichiarato della prosodia di una generazione rispetto a un modello che era indietro di 25 punti Elo con barre di errore sovrapposte.

Ciò che risolverebbe la questione è una nuova esecuzione dell'arena con StepAudio 3 TTS nel pool. Finché quel voto non avrà luogo, questo è un modello misurato contro uno non misurato, e i 25 punti che separano i loro predecessori rientrano nel rumore — il che non è una classifica, e non dovrebbe essere venduto come tale.