
GPT-Live-1 vs Breeze TTS 2: de open-weights stemleider die je niet kunt uitbrengen
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Breeze TTS 2 is het hoogst gewaardeerde open-weights tekst-naar-spraakmodel op Artificial Analysis' Provider Voices Speech Arena, met 1.205 Elo en een zevende plaats overall onder meer dan honderd beoordeelde systemen — vóór elke commercieel gelicentieerde engine die gewichten publiceert. De gewichten ervan zijn sinds 25 augustus 2026 downloadbaar. Het is ook, onder de licentie die met die gewichten meekomt, onbruikbaar in een product. GPT-Live-1 is in elk opzicht de tegenovergestelde afweging: gesloten, gehost, met een tarief van $0,05 per minuut spraak sinds het op 10 september 2026 de developer-API van OpenAI bereikte, en de enige van de twee die kan horen dat een beller hem onderbreekt.
Zet die twee zinnen naast elkaar en de vergelijking wordt sneller beslecht dan bij de meeste modelvergelijkingen gebeurt. Dit is geen strijd over welke betere spraak synthetiseert. Het is een strijd over of je een stem of een gesprek koopt, en of "open" betekent wat je dacht dat het betekende.
Het zijn niet hetzelfde soort dingen, en dat is precies het punt.
Breeze TTS 2, van een startup met ongeveer vijftien mensen genaamd BreezeBlue, is een text-to-speechmodel met 3 miljard parameters. Tekst gaat erin, audio komt eruit. Het hoort niets. Het heeft geen mening over wanneer een beurt zou moeten eindigen, omdat het geen concept van een beurt heeft. Via een WebSocket gestreamd, begint het audio te produceren voordat je tekst klaar is met genereren, wat echt nuttig is om het tempo van een voice-agent strak te houden — maar de beslissing over wanneer er gesproken moest worden, werd genomen door wat de tekst ook maar had geschreven.
GPT-Live-1 is een full-duplex spraak-naar-spraakmodel. Audio en tekst gaan erin; audio en tekst komen eruit; en het model beslist vele malen per seconde of het blijft luisteren, pauzeert, de beurt neemt of afstaat. OpenAI's eigen Full Duplex Bench v1.5-cijfers, gepubliceerd bij de release en niet buiten het bedrijf gereproduceerd, stellen de interactiviteit op 80,1% tegenover 45,4% voor GPT-Realtime-2.1, met een beurtwisselingslatentie van 0,798 seconden tegenover 1,41.
Die asymmetrie is geen kritiek op Breeze TTS 2. Het is een waarschuwing over waar elk van beide thuishoort in een stack. Als je een cascade bouwt — spraakherkenning die een taalmodel voedt, dat op zijn beurt een synthesizer voedt — dan is Breeze TTS 2 een kandidaat voor het laatste derde deel ervan. Als je GPT-Live-1 koopt, koop je de hele lus en geef je de beurtwisselingslogica er meteen mee uit handen.
Dimensie voor dimensie
• Interactiemodel — GPT-Live-1: volledig duplex, native barge-in, luistert terwijl het spreekt vs Breeze TTS 2: streaming tekst-naar-spraak, helemaal geen audio-invoer
• Gewichten — GPT-Live-1: gesloten, alleen gehost, één model-ID en geen gedateerde snapshots vs. Breeze TTS 2: 3B parameters op Hugging Face sinds 25 augustus 2026, PyTorch-inferentiecode Apache-2.0
• Licentie — GPT-Live-1: commerciële voorwaarden via OpenAI's API, niets te beoordelen, tegenover Breeze TTS 2: een onderzoeks- en niet-commerciële licentie die de gewichten, fine-tunes, LoRA's, merges, kwantisaties en zelfgehoste outputs dekt
• Prijseenheid — GPT-Live-1: $0,05 per spraakminuut, per seconde gefactureerd, reasoning-backend apart gemeten vs. Breeze TTS 2: $34 per miljoen tekens op het gehoste endpoint, met een staffel die daalt tot $28 bij het hoogste gepubliceerde abonnement
• Kwaliteitsbewijs — GPT-Live-1: 70,3% op de Artificial Analysis Speech to Speech Index, gedeelde zesde plaats van veertien gescoorde modellen, tegenover Breeze TTS 2: 1.205 Elo in de Provider Voices arena, zevende overall en eerste onder open-weightmodellen, volgens Artificial Analysis
• Talen — GPT-Live-1: berichtgeving rond de lancering wijst consistent op ongelijke vloeiendheid buiten de grote talen vs. Breeze TTS 2: 50 geclaimd door de leverancier, met de modelkaart getagd voor Engels en Chinees
• Spraakbesturing — GPT-Live-1: twaalf API-stemmen, toon en tempo gestuurd via prompt, helemaal geen klonen vs. Breeze TTS 2: klonen met referentieaudio, stemontwerp zonder referentie, stemregie en inline vocale events
• Doorvoer — GPT-Live-1: gemeten op basis van gelijktijdige sessies, met een maximum van 25 op tier 1 en 500 op tier 5, zonder gratis tier, tegenover Breeze TTS 2: ongeveer 45 tekens per seconde volgens de meting van Artificial Analysis, wat langzamer is dan verschillende commerciële concurrenten en van belang is voor werk met lange teksten

De licentie doet meer werk dan de ranglijst
De eigen modelkaart van BreezeBlue is ongewoon bot hierover, wat het bedrijf siert. De inferentiecode is Apache-2.0. De gewichten en alle outputs die je genereert door ze zelf te hosten, zijn voor onderzoeksgebruik, en commerciële inzet vereist ofwel een betaald gehost abonnement ofwel schriftelijke autorisatie. Die beperking strekt zich expliciet uit tot afgeleide modellen, LoRA's, merges en kwantisaties — wat de maas in de wet dicht waar mensen gewoonlijk naar grijpen.
Dus de framing 'open-weights-leider' heeft een voorbehoud nodig dat koppen zelden bevatten. Breeze TTS 2 is open in de zin dat je het kunt downloaden, inspecteren, benchmarken en op je eigen hardware kunt draaien voor evaluatie. Het is niet open in de zin die een startup in staat stelt er een product op te bouwen zonder hetzij BreezeBlue te betalen, hetzij een juridische toetsing in te kopen. Twee van de drie dingen die mensen met open weights bedoelen — verifieerbaarheid en kosten — krijg je. Het derde — de vrijheid om uit te brengen — krijg je niet.
Dat is een wezenlijk verschil met een model als GPT-Live-1, waar de licentie vraag niet luidt "mag ik", maar "hoeveel". Beide eindigen met een rekening. Alleen één van beide eindigt eerst met een advocatenadvies.

De twee prijseenheden zijn niet vergelijkbaar, dus hier is de berekening
$0,05 per minuut en $34 per miljoen tekens lijken uit verschillende universums te komen, en dat is ook zo. Om ze te vergelijken moet je omrekenen. Spraak gaat met ongeveer 150 woorden per minuut, en het Engels telt gemiddeld zo'n vijf en een half tekens per woord als je spaties meetelt, dus een minuut gesproken output is ruwweg 800 tot 900 tekens. Bij de $34 per miljoen van Breeze TTS 2 is dat ongeveer drie cent synthese per minuut — goedkoper dan de vijf van GPT-Live-1, puur op de spraak zelf.
De vergelijking valt meteen daarna in duigen, want de vijf cent van GPT-Live-1 omvat het luisteren. Het transcribeert ook de beller, bepaalt wanneer de beurt eindigt en beheert de onderbreking — werk dat een cascade ergens anders moet inkopen: een spraakherkenningsmodel, een beurtdetectiemodel en een taalmodel om de tekst te produceren die Breeze TTS 2 zal voorlezen. Tel die erbij op, en de drie cent aan synthese van de cascade valt onder een rekening die doorgaans hoger is dan die van het end-to-endmodel.
De eerlijke samenvatting is dat de goedkopere stem Breeze TTS 2 is en het goedkopere gesprek GPT-Live-1, en het verschil tussen die twee beweringen is alles wat een voice-agent werkelijk kost.

Waar ze elkaar daadwerkelijk zouden ontmoeten
Een team dat vandaag een telefoonagent bouwt en zich niet wil vastleggen op de end-to-endstack van één leverancier, zou precies deze cascade samenstellen: Breeze TTS 2 of een vergelijkbare engine voor de mond, iets anders voor de oren, en een gerouteerd taalmodel voor het denkwerk. Dat laatste van die drie is het onderdeel dat het vaakst verandert — het is waar de kwaliteit het snelst verbetert, waar de kosten het meest variëren, en waar het model dat dit kwartaal wint zelden het model is dat volgend kwartaal wint.
Die laag is een normale API-aanroep, en het is het enige onderdeel van deze stack dat het waard is om overdraagbaar te houden. Ongeveer 190 modellen van elf upstream-providers zitten achter één enkele OrcaRouter-sleutel tegen de lijstprijs van de provider zonder markup, dus het verwisselen van het redeneermodel achter een spraakagent is een configuratiewijziging in plaats van een integratieproject, en automatische failover zorgt ervoor dat een backend die een time-out krijgt de oproep niet laat vallen. Noch de Live Sessions-endpoint van GPT-Live-1, noch de gehoste API van Breeze TTS 2 is op die manier bereikbaar — de spraaklagen in deze vergelijking vallen buiten het bereik van een routeringslaag, en het is de moeite waard om dat duidelijk te zeggen in plaats van iets anders te suggereren.
Welke moet je kiezen?
Kies GPT-Live-1 als het gesprek het product is en je een gehoste, gesloten front-end kunt accepteren. Reserveringslijnen, eerstelijnsondersteuning, alles waarbij een beller die door de agent heen praat een normale gebeurtenis is in plaats van een uitzondering. Je koopt de onderbrekingsafhandeling, en je koopt die tegen een tarief per minuut dat voorspelbaar blijft, terwijl de redenering erachter het deel is dat je afstelt.
Kies Breeze TTS 2 als je een stem nodig hebt die je kunt inspecteren, als je een product bouwt waarin de synthese één van vele componenten is, of als je stemklonen en stemontwerp nodig hebt die GPT-Live-1 helemaal niet biedt. Ga er met de wetenschap in dat de gewichten voor onderzoek zijn, dat de claim van 50 talen een leveranciersclaim is tegenover een modelkaart die voor twee talen is getagd, en dat de latentiecijfers de eigen metingen van BreezeBlue op een opgewarmd snel pad zijn in plaats van een onafhankelijke audit.
Het instinct om dit als een kwaliteitswedstrijd te behandelen, is het verkeerde instinct. Breeze TTS 2 staat dicht bij de top van de ranglijst waarop het concurreert, en GPT-Live-1 concurreert op een heel andere ranglijst. De beslissing die echt geld kost, is de beslissing die onder beide ligt: welk model het denkwerk doet, en of je daar in een middag van gedachten over kunt veranderen.
