Breeze TTS 2 — Il nuovo leader TTS Open Weights con 1.215 Elo. Illustrazione rigenerata.
Guides & Insights

Breeze TTS 2: il nuovo leader TTS a pesi aperti con un Elo di 1.215

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Breeze TTS 2 è ora il modello text-to-speech a pesi aperti con il punteggio più alto nella Provider Voices Speech Arena di Artificial Analysis, con 1.215 Elo — 90 punti di vantaggio sul precedente leader tra i modelli a pesi aperti, Fish Audio S2 Pro, e al 6° posto assoluto su più di 100 sistemi valutati. Questa classifica è la prima conferma indipendente di ciò che BreezeBlue sostiene da quando ha presentato il modello a metà agosto 2026: che un modello vocale di appena due settimane, proveniente da una startup di circa 15 persone, possa stare al passo con la frontiera commerciale del text-to-speech. I pesi aperti sono stati pubblicati su Hugging Face il 25 agosto 2026; il risultato dell'arena è arrivato entro un giorno. Qualunque altra cosa Breeze TTS 2 si rivelerà essere, non è più una promessa del fornitore — ha un Elo che lo dice.

Cosa è realmente successo, in ordine.

La tempistica è importante qui, perché spiega perché un post su una "open weights leaderboard" provenga da un'azienda di cui la maggior parte delle persone non aveva sentito parlare fino a tre settimane fa. BreezeBlue è stata fondata da Yang Bin, ex co-fondatore tecnico di uno dei principali laboratori di intelligenza artificiale cinesi, con un round di finanziamento seed da 6 milioni di dollari guidato da Yuanjing Capital e Redpoint China. Il modello ha attraversato tre tappe visibili:

• 7 agosto 2026 — BreezeBlue ha pubblicato la propria suite di benchmark text-to-speech per la progettazione vocale, la direzione vocale e la valutazione della latenza su Hugging Face.

• 16–17 agosto 2026 — l'azienda ha annunciato formalmente Breeze TTS 2 come modello vocale di punta in tempo reale per i media interattivi, e ha aperto un'API ospitata a $34 per 1 milione di caratteri.

• 25 agosto 2026 — i pesi e il codice di inferenza PyTorch sono stati resi open-source su Hugging Face come BreezeBlue/Breeze-TTS-2, un modello da 3B parametri con licenza di ricerca e non commerciale.

La classifica Artificial Analysis Provider Voices è stata attiva entro pochi giorni dal rilascio dei pesi aperti. Poiché l'arena valuta i modelli tramite ascolto comparativo alla cieca, gli 1.215 Elo non sono un benchmark che BreezeBlue ha eseguito su sé stessa — sono il giudizio accumulato degli ascoltatori che confrontano campioni reali, che è esattamente ciò che manca di più a un modello così giovane.

Il tabellone

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• Posizione in Arena — #6 complessivo su Provider Voices; #1 tra tutti i modelli open-weights, davanti a Fish Audio S2 Pro (1.125 Elo).

• Elo — 1.215, con un IC al 95% di circa ±17 (Artificial Analysis, a fine agosto 2026).

• Lingue — 50, per BreezeBlue; la scheda del modello è etichettata inglese e cinese.

• Prezzo — $34 per 1 milione di caratteri sull'endpoint ospitato da BreezeBlue; i pesi aperti sono scaricabili gratuitamente, ma hanno una licenza non commerciale.

• Velocità — circa 45 caratteri al secondo secondo le misurazioni di Artificial Analysis — più lento di diversi rivali, il che conta per lavori di lunga durata.

• Latenza — latenza di streaming inferiore a 40 ms, secondo BreezeBlue (dichiarata dal fornitore, non misurata in modo indipendente).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Cosa fa effettivamente di diverso Breeze TTS 2

Il punteggio Elo finisce in prima pagina, ma la promessa del prodotto è più interessante del punteggio. Breeze TTS 2 è costruito attorno a due idee che la maggior parte dei modelli di text-to-speech tratta come pensieri secondari: progettazione vocale e direzione vocale. La progettazione vocale è zero-shot e senza riferimenti: descrivi una voce in linguaggio naturale ("un narratore caldo sui 45 anni, con un lieve accento strascicato del Sud e un'ironia asciutta") e il modello genera quella voce senza una registrazione in studio o una clip di riferimento. La direzione vocale disaccoppia il timbro del parlante dall'intento espressivo, così puoi far sì che una battuta suoni sarcastica, sommessa o frettolosa senza che il modello scivoli in un personaggio diverso. BreezeBlue afferma che la stessa identità del parlante sopravvive al cambiamento, e il suo benchmark di direzione vocale riporta una similarità del parlante di 0.67 SPK_SIM (dato dichiarato dal fornitore).

Quelle due capacità indicano il mercato di destinazione di Breeze TTS 2. I materiali per la stampa sono espliciti: personaggi dei videogiochi, compagni digitali, narrazione di storie, drammi radiotelevisivi e streamer virtuali — audio di lunga durata, basato sui ruoli e multi-personaggio, non solo un'altra API di narrazione. L'azienda distribuisce una libreria di voci complementare chiamata Voice Galaxy con oltre 15.000 voci di personaggi create dalla community e dagli studi, e il demo reel di BreezeBlue è un radiodramma di fan multi-personaggio che dura oltre dieci minuti. Nei benchmark rilasciati dall'azienda stessa (dichiarati dal fornitore, non replicati), Breeze TTS 2 rivendica il primo posto nel benchmark di sintesi vocale Voice Design con un punteggio Role Fit di 78,02 contro 72,78 per MiMo-V2.5-TTS e un punteggio composito Voice Direction di 4,25.

L'asterisco della licenza

Prima che la frase "open weights" faccia troppo lavoro di marketing, leggi la scheda del modello. Breeze TTS 2 ha 3 miliardi di parametri, safetensors, F32/BF16, e il codice sorgente è Apache 2.0 — ma i pesi, i modelli derivati e gli output auto-ospitati sono concessi in licenza solo per ricerca e uso non commerciale, secondo la breezeblue-research-and-non-commercial-license. Ciò significa che "open weights" qui non significa "gratuito per il tuo prodotto". Il self-hosting commerciale non è consentito dalla licenza così com'è scritta; la via commerciale è l'API ospitata a $34 per 1 milione di caratteri. Questa è la stessa forma di molte altre release open del 2026 — ispezionabili e auto-ospitabili per la ricerca, ma con l'uso che genera ricavi riservato all'endpoint del fornitore.

Perché un router è importante per un modello così giovane.

Il rischio onesto con Breeze TTS 2 in questo momento non è la qualità — è l'età. Il modello è in produzione da dieci giorni, i pesi da due. Nessun team di produzione dovrebbe scommettere una pipeline vocale su un modello così giovane senza un modo per farne a meno, ed è esattamente la modalità di guasto che un layer di routing esiste per assorbire. Se valuti Breeze TTS 2 attraverso un gateway che tratta l'endpoint del fornitore come una rotta tra molte, ottieni oggi il leader Elo, failover automatico verso un provider di riserva quando l'API è degradata, e una modifica di una riga se un modello vecchio di una settimana mostra una regressione. È la stessa disciplina che il DSL di routing applica a qualsiasi modello: componilo con alternative, mantieni stabile l'interfaccia, e lascia che il modello dimostri il suo valore prima di renderlo portante. Nessuno dei modelli di questa serie è ancora instradato su OrcaRouter stesso, quindi il consiglio onesto è di collegare Breeze TTS 2 a qualsiasi gateway tu già utilizzi — e mantenere il tuo attuale provider attivo al suo fianco mentre l'Elo invecchia e diventa più affidabile.

Cosa guardare dopo

La posizione #1-open-weights di Provider Voices è la storia di oggi, ma è l'arena più debole delle due per questo modello. Nell'arena Controlled Voice di Artificial Analysis, dove tutti i modelli vengono confrontati sulle stesse voci di riferimento fisse, Breeze TTS 2 si posiziona #3 tra i modelli open-weights con 1.002 Elo, dietro a Voxtral di Mistral a 1.010 — e #16 in assoluto su 39. Quel divario tra il punteggio provider-voice (1.215, #1 open) e il punteggio controlled-voice (1.002, #3 open) merita attenzione: suggerisce che il vantaggio di Breeze TTS 2 è concentrato nelle voci che progetta per sé, che è esattamente l'affermazione del prodotto, ed è anche esattamente l'affermazione su cui un benchmark indipendente dovrebbe tenere alta la pressione. Osservate se l'Elo controlled-voice si avvicina al numero provider-voice, se la licenza commerciale si restringe o si allenta e — soprattutto — se qualcuno riproduce i benchmark di voice-design e voice-direction al di fuori della suite di BreezeBlue.

Per un modello che non esisteva un mese fa, Breeze TTS 2 ha già ottenuto la cosa più utile che un modello di sintesi vocale possa ottenere: un punteggio indipendente che concorda con il marketing. Che diventi una voce predefinita per i prodotti interattivi dipende meno dal prossimo aggiornamento Elo che da come si evolveranno la licenza e la vicenda del self-hosting — ma a partire da questa settimana, la sintesi vocale a pesi aperti ha un nuovo leader, e ha due settimane.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.