Card del titolo hero per «GPT-Live-1 vs Breeze TTS 2», con sottotitolo «Una conversazione o una voce — e solo una delle due è una bolletta», con tre card che recitano «GPT-Live-1: 0,05 $ al minuto di voce, nessun peso, ascolta mentre parla», «Breeze TTS 2: 3B di pesi aperti, 1.205 Elo, solo licenza di ricerca», «È la licenza, non l'Elo, a decidere in questo caso», sopra una striscia di piè di pagina che recita «I dati dell'arena di Breeze TTS 2 secondo Artificial Analysis; i dati di GPT-Live-1 dichiarati da OpenAI». Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

GPT-Live-1 vs Breeze TTS 2: il leader vocale a pesi aperti che non puoi distribuire

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Breeze TTS 2 è il modello text-to-speech open-weights con il punteggio più alto su Provider Voices Speech Arena di Artificial Analysis, con 1.205 Elo e al settimo posto assoluto tra più di cento sistemi valutati — davanti a ogni motore con licenza commerciale che pubblica i pesi. I suoi pesi sono scaricabili dal 25 agosto 2026. Ed è anche, secondo la licenza con cui quei pesi vengono distribuiti, inutilizzabile in un prodotto. GPT-Live-1 è il compromesso opposto in ogni dimensione: chiuso, ospitato, fatturato a 0,05 $ al minuto di voce da quando è arrivato nell'API per sviluppatori di Open​AI il 10 settembre 2026, e l'unico dei due in grado di sentire un chiamante che lo interrompe.

Metti quelle due frasi una accanto all'altra e il confronto si risolve più in fretta di quanto faccia la maggior parte delle sfide tra modelli. Non è una lotta su quale sintetizzi meglio il parlato. È una lotta su se stai comprando una voce o una conversazione, e se "open" significhi quello che hai dato per scontato che significasse.

Non sono lo stesso tipo di cosa, ed è proprio questo il punto.

Breeze TTS 2, di una startup di circa quindici persone chiamata BreezeBlue, è un modello text-to-speech da 3 miliardi di parametri. Il testo entra, l'audio esce. Non sente nulla. Non ha alcuna opinione su quando dovrebbe terminare un turno, perché non ha alcun concetto di turno. Trasmesso in streaming su un WebSocket, inizia a produrre audio prima che il testo abbia finito di essere generato, il che è davvero utile per mantenere serrato il ritmo di un agente vocale — ma la decisione su quando parlare è stata presa da qualunque cosa abbia scritto il testo.

GPT-Live-1 è un modello speech-to-speech full-duplex. Audio e testo entrano; audio e testo escono; e il modello decide molte volte al secondo se continuare ad ascoltare, fare una pausa, prendere il turno o cederlo. I numeri della Full Duplex Bench v1.5 di OpenAI, pubblicati con il rilascio e non riprodotti al di fuori dell'azienda, collocano la sua interattività all'80,1% contro il 45,4% di GPT-Realtime-2.1, con una latenza di turn-taking di 0,798 secondi contro 1,41.

Quell'asimmetria non è una critica a Breeze TTS 2. È un avvertimento su dove ciascuno debba stare in uno stack. Se stai costruendo una cascata — il riconoscimento vocale che alimenta un modello linguistico che alimenta un sintetizzatore — Breeze TTS 2 è un candidato per l'ultimo terzo di essa. Se stai acquistando GPT-Live-1, stai acquistando l'intero ciclo e cedendo insieme ad esso la logica di alternanza dei turni.

Dimensione per dimensione

• Modello di interazione — GPT-Live-1: duplex completo, barge-in nativo, ascolta mentre parla vs Breeze TTS 2: sintesi vocale in streaming, nessun input audio

• Pesi — GPT-Live-1: closed, solo hosted, un unico ID modello e nessuno snapshot datato vs Breeze TTS 2: 3 miliardi di parametri su Hugging Face dal 25 agosto 2026, codice di inferenza PyTorch Apache-2.0

• Licenza — GPT-Live-1: termini commerciali tramite l'API di Open​AI, nulla da rivedere vs Breeze TTS 2: una licenza di ricerca e non commerciale che copre i pesi, i fine-tuning, le LoRA, le fusioni, le quantizzazioni e gli output self-hosted

• Unità di prezzo — GPT-Live-1: $0,05 per minuto vocale, con fatturazione al secondo, backend di ragionamento conteggiato separatamente; Breeze TTS 2: $34 per milione di caratteri sull'endpoint ospitato, con scaglioni decrescenti fino a $28 nel piano pubblicato più alto

• Prove di qualità — GPT-Live-1: 70,3% sull'Artificial Analysis Speech to Speech Index, sesto a pari merito su quattordici modelli valutati, contro Breeze TTS 2: 1.205 Elo nell'arena Provider Voices, settimo in classifica generale e primo tra i modelli open-weights, secondo Artificial Analysis

• Lingue — GPT-Live-1: la copertura del lancio segnala costantemente una fluidità disomogenea al di fuori delle lingue principali rispetto a Breeze TTS 2: 50 dichiarate dal fornitore, con la model card etichettata per inglese e cinese

• Controllo vocale — GPT-Live-1: dodici voci API, tono e ritmo guidati dal prompt, nessuna clonazione vs Breeze TTS 2: clonazione da audio di riferimento, progettazione vocale senza riferimento, direzione vocale ed eventi vocali inline

• Throughput — GPT-Live-1: calcolato in base alle sessioni simultanee, con un tetto di 25 sul livello 1 e 500 sul livello 5, senza un livello gratuito rispetto a Breeze TTS 2: circa 45 caratteri al secondo secondo la misurazione di Artificial Analysis, una velocità più bassa di quella di diversi concorrenti commerciali e importante per i lavori di lunga durata

A two-column comparison scoreboard titled 'GPT-Live-1 vs Breeze TTS 2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Weights: closed, hosted only', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning'. The right column, labelled Breeze TTS 2, reads 'Kind: streaming text-to-speech', 'Price: $34 per 1M characters hosted', 'Weights: 3B on Hugging Face, research licence', 'Independent score: 1,205 Elo, 7th of 100+ on the AA Provider Voices arena', 'Latency: p50 133.6 ms time to first audio (vendor)', 'Voices: cloning, voice design, inline events'. The footer reads 'GPT-Live-1 interactivity OpenAI-reported and unreproduced; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

La licenza sta facendo più lavoro della classifica

La scheda modello di BreezeBlue è insolitamente schietta su questo punto, il che fa onore all'azienda. Il codice di inferenza è Apache-2.0. I pesi e qualsiasi output tu generi ospitandoli autonomamente sono per uso di ricerca, e la messa in produzione commerciale richiede un abbonamento a pagamento al servizio ospitato oppure un'autorizzazione scritta. Tale restrizione si estende esplicitamente ai modelli derivati, ai LoRA, ai merge e alle quantizzazioni — il che chiude la scappatoia a cui di norma si ricorre.

Quindi l'etichetta di "leader degli open-weights" ha bisogno di un qualificatore che i titoli raramente riportano. Breeze TTS 2 è aperto nel senso che puoi scaricarlo, esaminarlo, sottoporlo a benchmark ed eseguirlo sul tuo hardware per valutarlo. Non è aperto nel senso che permette a una startup di costruirci sopra un prodotto senza né pagare BreezeBlue né acquistare una revisione legale. Due delle tre cose che si intendono con open weights — verificabilità e costo — le ottieni. La terza — la libertà di rilasciare — non l'ottieni.

Questa è una vera differenza rispetto a un modello come GPT-Live-1, in cui la questione della licenza non è «posso?» ma «quanto?». Entrambi finiscono con una fattura. Solo uno dei due finisce prima con il parere di un avvocato.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2, showing the tags 'Text-to-Speech', Transformers, Safetensors, PyTorch, English and Chinese, the licence label 'breezeblue-research-and-non-commercial-license', the notice 'Source code is licensed under Apache 2.0. Breeze TTS 2 model weights, derivative models, and self-hosted outputs are for research and non-commercial use only', a news entry dated 2026.08.25 reading 'We release Breeze TTS 2 model weights and the PyTorch inference code', the claim that it 'ranks #1 among open-weight models on the Artificial Analysis TTS leaderboard', a model size of 3B params with F32 and BF16 tensor types, and the note 'This model isn't deployed by any inference provider'.

Le due unità di prezzo non sono confrontabili, quindi ecco il calcolo.

$0,05 al minuto e $34 per milione di caratteri sembrano appartenere a universi diversi, perché è proprio così. Per confrontarli devi convertire. Il parlato scorre a circa 150 parole al minuto, e l’inglese ha in media circa cinque caratteri e mezzo per parola una volta contati gli spazi, quindi un minuto di output parlato corrisponde all’incirca a 800-900 caratteri. Ai $34 per milione di Breeze TTS 2, sono circa tre centesimi di sintesi al minuto — meno dei cinque di GPT-Live-1, sul parlato grezzo.

Il confronto crolla subito dopo, perché i cinque centesimi di GPT-Live-1 includono l'ascolto. Sta anche trascrivendo il chiamante, decidendo quando il turno termina e gestendo l'interruzione — un lavoro che una cascata deve comprare altrove: un modello di riconoscimento vocale, un modello di rilevamento del turno e un modello linguistico per produrre il testo che Breeze TTS 2 leggerà. Aggiungi questi e i tre centesimi di sintesi della cascata finiscono sotto una bolletta che di solito è più salata di quella del modello end-to-end.

Il riassunto onesto è questo: la voce più economica è Breeze TTS 2 e la conversazione più economica è GPT-Live-1, e la differenza tra queste due affermazioni è tutto ciò che un agente vocale costa davvero.

A screenshot of the Artificial Analysis Provider Voices speech arena leaderboard, ranking text-to-speech models by blind-listener Elo. The table runs Cartesia Sonic 3.6 first on 1,275 Elo from 1,755 samples and $49.0 per million characters, then Inworld Realtime TTS-2 at 1,244, Speechify Simba 3.2 at 1,233 and Qwen-Audio-3.0-TTS-Plus at 1,232, down to BreezeBlue Breeze TTS 2 at 1,205 Elo from 1,227 samples, seventh overall, carrying the only Open Weights badge in the top ten at $34.0 per million characters with an August 2026 release date.

Dove si incontrerebbero effettivamente

Un team che oggi costruisce un agente telefonico e non vuole impegnarsi nello stack end-to-end di un unico fornitore assemblerebbe esattamente questa cascata: Breeze TTS 2 o un motore comparabile per la bocca, qualcos'altro per le orecchie e un modello linguistico instradato per il pensiero. L'ultimo dei tre è il componente che cambia più spesso — è dove la qualità migliora più rapidamente, dove il costo varia di più e dove il modello che vince questo trimestre raramente è quello che vincerà il prossimo.

Quel livello è una normale chiamata API, ed è l'unica parte di questo stack che vale la pena mantenere portabile. Più o meno 190 modelli da undici provider upstream stanno dietro a un'unica chiave OrcaRouter al prezzo di listino del provider, senza alcun ricarico, quindi cambiare il modello di ragionamento dietro un agente vocale è una modifica di configurazione anziché un progetto di integrazione, e il failover automatico impedisce che un backend che va in timeout faccia cadere la chiamata. Né l'endpoint Live Sessions di GPT-Live-1 né l'API ospitata di Breeze TTS 2 sono raggiungibili in quel modo — i livelli vocali in questo confronto restano fuori dalla portata di un livello di routing, e vale la pena essere chiari su questo invece di lasciar intendere il contrario.

Quale scegliere?

Scegli GPT-Live-1 se la conversazione è il prodotto e puoi accettare un front-end ospitato e chiuso. Linee di prenotazione, supporto di primo livello, qualsiasi contesto in cui un chiamante che parla sopra l'agente è un evento normale anziché un'eccezione. Stai acquistando la gestione delle interruzioni e la stai acquistando a una tariffa al minuto che resta prevedibile, mentre il ragionamento che ne sta alla base è la parte che metti a punto.

Scegli Breeze TTS 2 se hai bisogno di una voce che puoi ispezionare, se stai costruendo un prodotto in cui la sintesi è una componente tra molte, o se hai bisogno di clonazione e progettazione vocale che GPT-Live-1 non offre affatto. Sappi in partenza che i pesi sono per la ricerca, che l'affermazione sulle 50 lingue è un'affermazione del fornitore rispetto a una scheda contrassegnata per due lingue, e che i dati sulla latenza sono misurazioni di BreezeBlue stesso su un percorso rapido riscaldato, piuttosto che un audit indipendente.

L'istinto di trattare questa cosa come una gara di qualità è l'istinto sbagliato. Breeze TTS 2 è vicino alla vetta della classifica in cui compete, e GPT-Live-1 compete in una classifica del tutto diversa. La decisione che costa davvero denaro è quella che sta alla base di entrambe: quale modello pensa, e se puoi cambiare idea al riguardo in un pomeriggio.