
Breeze TTS 2: il nuovo leader TTS a pesi aperti con un Elo di 1.215
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 523 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Breeze TTS 2 è ora il modello text-to-speech a pesi aperti con il punteggio più alto nella Provider Voices Speech Arena di Artificial Analysis, con 1.215 Elo — 90 punti di vantaggio sul precedente leader tra i modelli a pesi aperti, Fish Audio S2 Pro, e al 6° posto assoluto su più di 100 sistemi valutati. Questa classifica è la prima conferma indipendente di ciò che BreezeBlue sostiene da quando ha presentato il modello a metà agosto 2026: che un modello vocale di appena due settimane, proveniente da una startup di circa 15 persone, possa stare al passo con la frontiera commerciale del text-to-speech. I pesi aperti sono stati pubblicati su Hugging Face il 25 agosto 2026; il risultato dell'arena è arrivato entro un giorno. Qualunque altra cosa Breeze TTS 2 si rivelerà essere, non è più una promessa del fornitore — ha un Elo che lo dice.
Cosa è realmente successo, in ordine.
La tempistica è importante qui, perché spiega perché un post su una "open weights leaderboard" provenga da un'azienda di cui la maggior parte delle persone non aveva sentito parlare fino a tre settimane fa. BreezeBlue è stata fondata da Yang Bin, ex co-fondatore tecnico di uno dei principali laboratori di intelligenza artificiale cinesi, con un round di finanziamento seed da 6 milioni di dollari guidato da Yuanjing Capital e Redpoint China. Il modello ha attraversato tre tappe visibili:
• 7 agosto 2026 — BreezeBlue ha pubblicato la propria suite di benchmark text-to-speech per la progettazione vocale, la direzione vocale e la valutazione della latenza su Hugging Face.
• 16–17 agosto 2026 — l'azienda ha annunciato formalmente Breeze TTS 2 come modello vocale di punta in tempo reale per i media interattivi, e ha aperto un'API ospitata a $34 per 1 milione di caratteri.
• 25 agosto 2026 — i pesi e il codice di inferenza PyTorch sono stati resi open-source su Hugging Face come BreezeBlue/Breeze-TTS-2, un modello da 3B parametri con licenza di ricerca e non commerciale.
La classifica Artificial Analysis Provider Voices è stata attiva entro pochi giorni dal rilascio dei pesi aperti. Poiché l'arena valuta i modelli tramite ascolto comparativo alla cieca, gli 1.215 Elo non sono un benchmark che BreezeBlue ha eseguito su sé stessa — sono il giudizio accumulato degli ascoltatori che confrontano campioni reali, che è esattamente ciò che manca di più a un modello così giovane.
Il tabellone

• Posizione in Arena — #6 complessivo su Provider Voices; #1 tra tutti i modelli open-weights, davanti a Fish Audio S2 Pro (1.125 Elo).
• Elo — 1.215, con un IC al 95% di circa ±17 (Artificial Analysis, a fine agosto 2026).
• Lingue — 50, per BreezeBlue; la scheda del modello è etichettata inglese e cinese.
• Prezzo — $34 per 1 milione di caratteri sull'endpoint ospitato da BreezeBlue; i pesi aperti sono scaricabili gratuitamente, ma hanno una licenza non commerciale.
• Velocità — circa 45 caratteri al secondo secondo le misurazioni di Artificial Analysis — più lento di diversi rivali, il che conta per lavori di lunga durata.
• Latenza — latenza di streaming inferiore a 40 ms, secondo BreezeBlue (dichiarata dal fornitore, non misurata in modo indipendente).

Cosa fa effettivamente di diverso Breeze TTS 2
Il punteggio Elo finisce in prima pagina, ma la promessa del prodotto è più interessante del punteggio. Breeze TTS 2 è costruito attorno a due idee che la maggior parte dei modelli di text-to-speech tratta come pensieri secondari: progettazione vocale e direzione vocale. La progettazione vocale è zero-shot e senza riferimenti: descrivi una voce in linguaggio naturale ("un narratore caldo sui 45 anni, con un lieve accento strascicato del Sud e un'ironia asciutta") e il modello genera quella voce senza una registrazione in studio o una clip di riferimento. La direzione vocale disaccoppia il timbro del parlante dall'intento espressivo, così puoi far sì che una battuta suoni sarcastica, sommessa o frettolosa senza che il modello scivoli in un personaggio diverso. BreezeBlue afferma che la stessa identità del parlante sopravvive al cambiamento, e il suo benchmark di direzione vocale riporta una similarità del parlante di 0.67 SPK_SIM (dato dichiarato dal fornitore).
Quelle due capacità indicano il mercato di destinazione di Breeze TTS 2. I materiali per la stampa sono espliciti: personaggi dei videogiochi, compagni digitali, narrazione di storie, drammi radiotelevisivi e streamer virtuali — audio di lunga durata, basato sui ruoli e multi-personaggio, non solo un'altra API di narrazione. L'azienda distribuisce una libreria di voci complementare chiamata Voice Galaxy con oltre 15.000 voci di personaggi create dalla community e dagli studi, e il demo reel di BreezeBlue è un radiodramma di fan multi-personaggio che dura oltre dieci minuti. Nei benchmark rilasciati dall'azienda stessa (dichiarati dal fornitore, non replicati), Breeze TTS 2 rivendica il primo posto nel benchmark di sintesi vocale Voice Design con un punteggio Role Fit di 78,02 contro 72,78 per MiMo-V2.5-TTS e un punteggio composito Voice Direction di 4,25.
L'asterisco della licenza
Prima che la frase "open weights" faccia troppo lavoro di marketing, leggi la scheda del modello. Breeze TTS 2 ha 3 miliardi di parametri, safetensors, F32/BF16, e il codice sorgente è Apache 2.0 — ma i pesi, i modelli derivati e gli output auto-ospitati sono concessi in licenza solo per ricerca e uso non commerciale, secondo la breezeblue-research-and-non-commercial-license. Ciò significa che "open weights" qui non significa "gratuito per il tuo prodotto". Il self-hosting commerciale non è consentito dalla licenza così com'è scritta; la via commerciale è l'API ospitata a $34 per 1 milione di caratteri. Questa è la stessa forma di molte altre release open del 2026 — ispezionabili e auto-ospitabili per la ricerca, ma con l'uso che genera ricavi riservato all'endpoint del fornitore.
Perché un router è importante per un modello così giovane.
Il rischio onesto con Breeze TTS 2 in questo momento non è la qualità — è l'età. Il modello è in produzione da dieci giorni, i pesi da due. Nessun team di produzione dovrebbe scommettere una pipeline vocale su un modello così giovane senza un modo per farne a meno, ed è esattamente la modalità di guasto che un layer di routing esiste per assorbire. Se valuti Breeze TTS 2 attraverso un gateway che tratta l'endpoint del fornitore come una rotta tra molte, ottieni oggi il leader Elo, failover automatico verso un provider di riserva quando l'API è degradata, e una modifica di una riga se un modello vecchio di una settimana mostra una regressione. È la stessa disciplina che il DSL di routing applica a qualsiasi modello: componilo con alternative, mantieni stabile l'interfaccia, e lascia che il modello dimostri il suo valore prima di renderlo portante. Nessuno dei modelli di questa serie è ancora instradato su OrcaRouter stesso, quindi il consiglio onesto è di collegare Breeze TTS 2 a qualsiasi gateway tu già utilizzi — e mantenere il tuo attuale provider attivo al suo fianco mentre l'Elo invecchia e diventa più affidabile.
Cosa guardare dopo
La posizione #1-open-weights di Provider Voices è la storia di oggi, ma è l'arena più debole delle due per questo modello. Nell'arena Controlled Voice di Artificial Analysis, dove tutti i modelli vengono confrontati sulle stesse voci di riferimento fisse, Breeze TTS 2 si posiziona #3 tra i modelli open-weights con 1.002 Elo, dietro a Voxtral di Mistral a 1.010 — e #16 in assoluto su 39. Quel divario tra il punteggio provider-voice (1.215, #1 open) e il punteggio controlled-voice (1.002, #3 open) merita attenzione: suggerisce che il vantaggio di Breeze TTS 2 è concentrato nelle voci che progetta per sé, che è esattamente l'affermazione del prodotto, ed è anche esattamente l'affermazione su cui un benchmark indipendente dovrebbe tenere alta la pressione. Osservate se l'Elo controlled-voice si avvicina al numero provider-voice, se la licenza commerciale si restringe o si allenta e — soprattutto — se qualcuno riproduce i benchmark di voice-design e voice-direction al di fuori della suite di BreezeBlue.
Per un modello che non esisteva un mese fa, Breeze TTS 2 ha già ottenuto la cosa più utile che un modello di sintesi vocale possa ottenere: un punteggio indipendente che concorda con il marketing. Che diventi una voce predefinita per i prodotti interattivi dipende meno dal prossimo aggiornamento Elo che da come si evolveranno la licenza e la vicenda del self-hosting — ma a partire da questa settimana, la sintesi vocale a pesi aperti ha un nuovo leader, e ha due settimane.

