
GPT-Live-1 vs Breeze TTS 2: il leader vocale a pesi aperti che non puoi distribuire
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Breeze TTS 2 è il modello text-to-speech open-weights con il punteggio più alto su Provider Voices Speech Arena di Artificial Analysis, con 1.205 Elo e al settimo posto assoluto tra più di cento sistemi valutati — davanti a ogni motore con licenza commerciale che pubblica i pesi. I suoi pesi sono scaricabili dal 25 agosto 2026. Ed è anche, secondo la licenza con cui quei pesi vengono distribuiti, inutilizzabile in un prodotto. GPT-Live-1 è il compromesso opposto in ogni dimensione: chiuso, ospitato, fatturato a 0,05 $ al minuto di voce da quando è arrivato nell'API per sviluppatori di OpenAI il 10 settembre 2026, e l'unico dei due in grado di sentire un chiamante che lo interrompe.
Metti quelle due frasi una accanto all'altra e il confronto si risolve più in fretta di quanto faccia la maggior parte delle sfide tra modelli. Non è una lotta su quale sintetizzi meglio il parlato. È una lotta su se stai comprando una voce o una conversazione, e se "open" significhi quello che hai dato per scontato che significasse.
Non sono lo stesso tipo di cosa, ed è proprio questo il punto.
Breeze TTS 2, di una startup di circa quindici persone chiamata BreezeBlue, è un modello text-to-speech da 3 miliardi di parametri. Il testo entra, l'audio esce. Non sente nulla. Non ha alcuna opinione su quando dovrebbe terminare un turno, perché non ha alcun concetto di turno. Trasmesso in streaming su un WebSocket, inizia a produrre audio prima che il testo abbia finito di essere generato, il che è davvero utile per mantenere serrato il ritmo di un agente vocale — ma la decisione su quando parlare è stata presa da qualunque cosa abbia scritto il testo.
GPT-Live-1 è un modello speech-to-speech full-duplex. Audio e testo entrano; audio e testo escono; e il modello decide molte volte al secondo se continuare ad ascoltare, fare una pausa, prendere il turno o cederlo. I numeri della Full Duplex Bench v1.5 di OpenAI, pubblicati con il rilascio e non riprodotti al di fuori dell'azienda, collocano la sua interattività all'80,1% contro il 45,4% di GPT-Realtime-2.1, con una latenza di turn-taking di 0,798 secondi contro 1,41.
Quell'asimmetria non è una critica a Breeze TTS 2. È un avvertimento su dove ciascuno debba stare in uno stack. Se stai costruendo una cascata — il riconoscimento vocale che alimenta un modello linguistico che alimenta un sintetizzatore — Breeze TTS 2 è un candidato per l'ultimo terzo di essa. Se stai acquistando GPT-Live-1, stai acquistando l'intero ciclo e cedendo insieme ad esso la logica di alternanza dei turni.
Dimensione per dimensione
• Modello di interazione — GPT-Live-1: duplex completo, barge-in nativo, ascolta mentre parla vs Breeze TTS 2: sintesi vocale in streaming, nessun input audio
• Pesi — GPT-Live-1: closed, solo hosted, un unico ID modello e nessuno snapshot datato vs Breeze TTS 2: 3 miliardi di parametri su Hugging Face dal 25 agosto 2026, codice di inferenza PyTorch Apache-2.0
• Licenza — GPT-Live-1: termini commerciali tramite l'API di OpenAI, nulla da rivedere vs Breeze TTS 2: una licenza di ricerca e non commerciale che copre i pesi, i fine-tuning, le LoRA, le fusioni, le quantizzazioni e gli output self-hosted
• Unità di prezzo — GPT-Live-1: $0,05 per minuto vocale, con fatturazione al secondo, backend di ragionamento conteggiato separatamente; Breeze TTS 2: $34 per milione di caratteri sull'endpoint ospitato, con scaglioni decrescenti fino a $28 nel piano pubblicato più alto
• Prove di qualità — GPT-Live-1: 70,3% sull'Artificial Analysis Speech to Speech Index, sesto a pari merito su quattordici modelli valutati, contro Breeze TTS 2: 1.205 Elo nell'arena Provider Voices, settimo in classifica generale e primo tra i modelli open-weights, secondo Artificial Analysis
• Lingue — GPT-Live-1: la copertura del lancio segnala costantemente una fluidità disomogenea al di fuori delle lingue principali rispetto a Breeze TTS 2: 50 dichiarate dal fornitore, con la model card etichettata per inglese e cinese
• Controllo vocale — GPT-Live-1: dodici voci API, tono e ritmo guidati dal prompt, nessuna clonazione vs Breeze TTS 2: clonazione da audio di riferimento, progettazione vocale senza riferimento, direzione vocale ed eventi vocali inline
• Throughput — GPT-Live-1: calcolato in base alle sessioni simultanee, con un tetto di 25 sul livello 1 e 500 sul livello 5, senza un livello gratuito rispetto a Breeze TTS 2: circa 45 caratteri al secondo secondo la misurazione di Artificial Analysis, una velocità più bassa di quella di diversi concorrenti commerciali e importante per i lavori di lunga durata

La licenza sta facendo più lavoro della classifica
La scheda modello di BreezeBlue è insolitamente schietta su questo punto, il che fa onore all'azienda. Il codice di inferenza è Apache-2.0. I pesi e qualsiasi output tu generi ospitandoli autonomamente sono per uso di ricerca, e la messa in produzione commerciale richiede un abbonamento a pagamento al servizio ospitato oppure un'autorizzazione scritta. Tale restrizione si estende esplicitamente ai modelli derivati, ai LoRA, ai merge e alle quantizzazioni — il che chiude la scappatoia a cui di norma si ricorre.
Quindi l'etichetta di "leader degli open-weights" ha bisogno di un qualificatore che i titoli raramente riportano. Breeze TTS 2 è aperto nel senso che puoi scaricarlo, esaminarlo, sottoporlo a benchmark ed eseguirlo sul tuo hardware per valutarlo. Non è aperto nel senso che permette a una startup di costruirci sopra un prodotto senza né pagare BreezeBlue né acquistare una revisione legale. Due delle tre cose che si intendono con open weights — verificabilità e costo — le ottieni. La terza — la libertà di rilasciare — non l'ottieni.
Questa è una vera differenza rispetto a un modello come GPT-Live-1, in cui la questione della licenza non è «posso?» ma «quanto?». Entrambi finiscono con una fattura. Solo uno dei due finisce prima con il parere di un avvocato.

Le due unità di prezzo non sono confrontabili, quindi ecco il calcolo.
$0,05 al minuto e $34 per milione di caratteri sembrano appartenere a universi diversi, perché è proprio così. Per confrontarli devi convertire. Il parlato scorre a circa 150 parole al minuto, e l’inglese ha in media circa cinque caratteri e mezzo per parola una volta contati gli spazi, quindi un minuto di output parlato corrisponde all’incirca a 800-900 caratteri. Ai $34 per milione di Breeze TTS 2, sono circa tre centesimi di sintesi al minuto — meno dei cinque di GPT-Live-1, sul parlato grezzo.
Il confronto crolla subito dopo, perché i cinque centesimi di GPT-Live-1 includono l'ascolto. Sta anche trascrivendo il chiamante, decidendo quando il turno termina e gestendo l'interruzione — un lavoro che una cascata deve comprare altrove: un modello di riconoscimento vocale, un modello di rilevamento del turno e un modello linguistico per produrre il testo che Breeze TTS 2 leggerà. Aggiungi questi e i tre centesimi di sintesi della cascata finiscono sotto una bolletta che di solito è più salata di quella del modello end-to-end.
Il riassunto onesto è questo: la voce più economica è Breeze TTS 2 e la conversazione più economica è GPT-Live-1, e la differenza tra queste due affermazioni è tutto ciò che un agente vocale costa davvero.

Dove si incontrerebbero effettivamente
Un team che oggi costruisce un agente telefonico e non vuole impegnarsi nello stack end-to-end di un unico fornitore assemblerebbe esattamente questa cascata: Breeze TTS 2 o un motore comparabile per la bocca, qualcos'altro per le orecchie e un modello linguistico instradato per il pensiero. L'ultimo dei tre è il componente che cambia più spesso — è dove la qualità migliora più rapidamente, dove il costo varia di più e dove il modello che vince questo trimestre raramente è quello che vincerà il prossimo.
Quel livello è una normale chiamata API, ed è l'unica parte di questo stack che vale la pena mantenere portabile. Più o meno 190 modelli da undici provider upstream stanno dietro a un'unica chiave OrcaRouter al prezzo di listino del provider, senza alcun ricarico, quindi cambiare il modello di ragionamento dietro un agente vocale è una modifica di configurazione anziché un progetto di integrazione, e il failover automatico impedisce che un backend che va in timeout faccia cadere la chiamata. Né l'endpoint Live Sessions di GPT-Live-1 né l'API ospitata di Breeze TTS 2 sono raggiungibili in quel modo — i livelli vocali in questo confronto restano fuori dalla portata di un livello di routing, e vale la pena essere chiari su questo invece di lasciar intendere il contrario.
Quale scegliere?
Scegli GPT-Live-1 se la conversazione è il prodotto e puoi accettare un front-end ospitato e chiuso. Linee di prenotazione, supporto di primo livello, qualsiasi contesto in cui un chiamante che parla sopra l'agente è un evento normale anziché un'eccezione. Stai acquistando la gestione delle interruzioni e la stai acquistando a una tariffa al minuto che resta prevedibile, mentre il ragionamento che ne sta alla base è la parte che metti a punto.
Scegli Breeze TTS 2 se hai bisogno di una voce che puoi ispezionare, se stai costruendo un prodotto in cui la sintesi è una componente tra molte, o se hai bisogno di clonazione e progettazione vocale che GPT-Live-1 non offre affatto. Sappi in partenza che i pesi sono per la ricerca, che l'affermazione sulle 50 lingue è un'affermazione del fornitore rispetto a una scheda contrassegnata per due lingue, e che i dati sulla latenza sono misurazioni di BreezeBlue stesso su un percorso rapido riscaldato, piuttosto che un audit indipendente.
L'istinto di trattare questa cosa come una gara di qualità è l'istinto sbagliato. Breeze TTS 2 è vicino alla vetta della classifica in cui compete, e GPT-Live-1 compete in una classifica del tutto diversa. La decisione che costa davvero denaro è quella che sta alla base di entrambe: quale modello pensa, e se puoi cambiare idea al riguardo in un pomeriggio.
