Hero-titelkaart voor 'GPT-Live-1 vs Breeze TTS 2', met als ondertitel 'Een gesprek of een stem — en slechts één van beide is een rekening', met drie kaarten met de tekst 'GPT-Live-1: $0,05 per stemminuut, geen gewichten, hoort terwijl het spreekt', 'Breeze TTS 2: 3B open gewichten, 1.205 Elo, alleen onderzoekslicentie', 'De licentie, niet de Elo, beslist deze', boven een voetbalk met de tekst 'Arena-cijfers van Breeze TTS 2 volgens Artificial Analysis; cijfers van GPT-Live-1 door OpenAI gerapporteerd.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

GPT-Live-1 vs Breeze TTS 2: de open-weights stemleider die je niet kunt uitbrengen

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Breeze TTS 2 is het hoogst gewaardeerde open-weights tekst-naar-spraakmodel op Artificial Analysis' Provider Voices Speech Arena, met 1.205 Elo en een zevende plaats overall onder meer dan honderd beoordeelde systemen — vóór elke commercieel gelicentieerde engine die gewichten publiceert. De gewichten ervan zijn sinds 25 augustus 2026 downloadbaar. Het is ook, onder de licentie die met die gewichten meekomt, onbruikbaar in een product. GPT-Live-1 is in elk opzicht de tegenovergestelde afweging: gesloten, gehost, met een tarief van $0,05 per minuut spraak sinds het op 10 september 2026 de developer-API van OpenAI bereikte, en de enige van de twee die kan horen dat een beller hem onderbreekt.

Zet die twee zinnen naast elkaar en de vergelijking wordt sneller beslecht dan bij de meeste modelvergelijkingen gebeurt. Dit is geen strijd over welke betere spraak synthetiseert. Het is een strijd over of je een stem of een gesprek koopt, en of "open" betekent wat je dacht dat het betekende.

Het zijn niet hetzelfde soort dingen, en dat is precies het punt.

Breeze TTS 2, van een startup met ongeveer vijftien mensen genaamd BreezeBlue, is een text-to-speechmodel met 3 miljard parameters. Tekst gaat erin, audio komt eruit. Het hoort niets. Het heeft geen mening over wanneer een beurt zou moeten eindigen, omdat het geen concept van een beurt heeft. Via een WebSocket gestreamd, begint het audio te produceren voordat je tekst klaar is met genereren, wat echt nuttig is om het tempo van een voice-agent strak te houden — maar de beslissing over wanneer er gesproken moest worden, werd genomen door wat de tekst ook maar had geschreven.

GPT-Live-1 is een full-duplex spraak-naar-spraakmodel. Audio en tekst gaan erin; audio en tekst komen eruit; en het model beslist vele malen per seconde of het blijft luisteren, pauzeert, de beurt neemt of afstaat. OpenAI's eigen Full Duplex Bench v1.5-cijfers, gepubliceerd bij de release en niet buiten het bedrijf gereproduceerd, stellen de interactiviteit op 80,1% tegenover 45,4% voor GPT-Realtime-2.1, met een beurtwisselingslatentie van 0,798 seconden tegenover 1,41.

Die asymmetrie is geen kritiek op Breeze TTS 2. Het is een waarschuwing over waar elk van beide thuishoort in een stack. Als je een cascade bouwt — spraakherkenning die een taalmodel voedt, dat op zijn beurt een synthesizer voedt — dan is Breeze TTS 2 een kandidaat voor het laatste derde deel ervan. Als je GPT-Live-1 koopt, koop je de hele lus en geef je de beurtwisselingslogica er meteen mee uit handen.

Dimensie voor dimensie

• Interactiemodel — GPT-Live-1: volledig duplex, native barge-in, luistert terwijl het spreekt vs Breeze TTS 2: streaming tekst-naar-spraak, helemaal geen audio-invoer

• Gewichten — GPT-Live-1: gesloten, alleen gehost, één model-ID en geen gedateerde snapshots vs. Breeze TTS 2: 3B parameters op Hugging Face sinds 25 augustus 2026, PyTorch-inferentiecode Apache-2.0

• Licentie — GPT-Live-1: commerciële voorwaarden via OpenAI's API, niets te beoordelen, tegenover Breeze TTS 2: een onderzoeks- en niet-commerciële licentie die de gewichten, fine-tunes, LoRA's, merges, kwantisaties en zelfgehoste outputs dekt

• Prijseenheid — GPT-Live-1: $0,05 per spraakminuut, per seconde gefactureerd, reasoning-backend apart gemeten vs. Breeze TTS 2: $34 per miljoen tekens op het gehoste endpoint, met een staffel die daalt tot $28 bij het hoogste gepubliceerde abonnement

• Kwaliteitsbewijs — GPT-Live-1: 70,3% op de Artificial Analysis Speech to Speech Index, gedeelde zesde plaats van veertien gescoorde modellen, tegenover Breeze TTS 2: 1.205 Elo in de Provider Voices arena, zevende overall en eerste onder open-weightmodellen, volgens Artificial Analysis

• Talen — GPT-Live-1: berichtgeving rond de lancering wijst consistent op ongelijke vloeiendheid buiten de grote talen vs. Breeze TTS 2: 50 geclaimd door de leverancier, met de modelkaart getagd voor Engels en Chinees

• Spraakbesturing — GPT-Live-1: twaalf API-stemmen, toon en tempo gestuurd via prompt, helemaal geen klonen vs. Breeze TTS 2: klonen met referentieaudio, stemontwerp zonder referentie, stemregie en inline vocale events

• Doorvoer — GPT-Live-1: gemeten op basis van gelijktijdige sessies, met een maximum van 25 op tier 1 en 500 op tier 5, zonder gratis tier, tegenover Breeze TTS 2: ongeveer 45 tekens per seconde volgens de meting van Artificial Analysis, wat langzamer is dan verschillende commerciële concurrenten en van belang is voor werk met lange teksten

A two-column comparison scoreboard titled 'GPT-Live-1 vs Breeze TTS 2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Weights: closed, hosted only', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning'. The right column, labelled Breeze TTS 2, reads 'Kind: streaming text-to-speech', 'Price: $34 per 1M characters hosted', 'Weights: 3B on Hugging Face, research licence', 'Independent score: 1,205 Elo, 7th of 100+ on the AA Provider Voices arena', 'Latency: p50 133.6 ms time to first audio (vendor)', 'Voices: cloning, voice design, inline events'. The footer reads 'GPT-Live-1 interactivity OpenAI-reported and unreproduced; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

De licentie doet meer werk dan de ranglijst

De eigen modelkaart van BreezeBlue is ongewoon bot hierover, wat het bedrijf siert. De inferentiecode is Apache-2.0. De gewichten en alle outputs die je genereert door ze zelf te hosten, zijn voor onderzoeksgebruik, en commerciële inzet vereist ofwel een betaald gehost abonnement ofwel schriftelijke autorisatie. Die beperking strekt zich expliciet uit tot afgeleide modellen, LoRA's, merges en kwantisaties — wat de maas in de wet dicht waar mensen gewoonlijk naar grijpen.

Dus de framing 'open-weights-leider' heeft een voorbehoud nodig dat koppen zelden bevatten. Breeze TTS 2 is open in de zin dat je het kunt downloaden, inspecteren, benchmarken en op je eigen hardware kunt draaien voor evaluatie. Het is niet open in de zin die een startup in staat stelt er een product op te bouwen zonder hetzij BreezeBlue te betalen, hetzij een juridische toetsing in te kopen. Twee van de drie dingen die mensen met open weights bedoelen — verifieerbaarheid en kosten — krijg je. Het derde — de vrijheid om uit te brengen — krijg je niet.

Dat is een wezenlijk verschil met een model als GPT-Live-1, waar de licentie vraag niet luidt "mag ik", maar "hoeveel". Beide eindigen met een rekening. Alleen één van beide eindigt eerst met een advocatenadvies.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2, showing the tags 'Text-to-Speech', Transformers, Safetensors, PyTorch, English and Chinese, the licence label 'breezeblue-research-and-non-commercial-license', the notice 'Source code is licensed under Apache 2.0. Breeze TTS 2 model weights, derivative models, and self-hosted outputs are for research and non-commercial use only', a news entry dated 2026.08.25 reading 'We release Breeze TTS 2 model weights and the PyTorch inference code', the claim that it 'ranks #1 among open-weight models on the Artificial Analysis TTS leaderboard', a model size of 3B params with F32 and BF16 tensor types, and the note 'This model isn't deployed by any inference provider'.

De twee prijseenheden zijn niet vergelijkbaar, dus hier is de berekening

$0,05 per minuut en $34 per miljoen tekens lijken uit verschillende universums te komen, en dat is ook zo. Om ze te vergelijken moet je omrekenen. Spraak gaat met ongeveer 150 woorden per minuut, en het Engels telt gemiddeld zo'n vijf en een half tekens per woord als je spaties meetelt, dus een minuut gesproken output is ruwweg 800 tot 900 tekens. Bij de $34 per miljoen van Breeze TTS 2 is dat ongeveer drie cent synthese per minuut — goedkoper dan de vijf van GPT-Live-1, puur op de spraak zelf.

De vergelijking valt meteen daarna in duigen, want de vijf cent van GPT-Live-1 omvat het luisteren. Het transcribeert ook de beller, bepaalt wanneer de beurt eindigt en beheert de onderbreking — werk dat een cascade ergens anders moet inkopen: een spraakherkenningsmodel, een beurtdetectiemodel en een taalmodel om de tekst te produceren die Breeze TTS 2 zal voorlezen. Tel die erbij op, en de drie cent aan synthese van de cascade valt onder een rekening die doorgaans hoger is dan die van het end-to-endmodel.

De eerlijke samenvatting is dat de goedkopere stem Breeze TTS 2 is en het goedkopere gesprek GPT-Live-1, en het verschil tussen die twee beweringen is alles wat een voice-agent werkelijk kost.

A screenshot of the Artificial Analysis Provider Voices speech arena leaderboard, ranking text-to-speech models by blind-listener Elo. The table runs Cartesia Sonic 3.6 first on 1,275 Elo from 1,755 samples and $49.0 per million characters, then Inworld Realtime TTS-2 at 1,244, Speechify Simba 3.2 at 1,233 and Qwen-Audio-3.0-TTS-Plus at 1,232, down to BreezeBlue Breeze TTS 2 at 1,205 Elo from 1,227 samples, seventh overall, carrying the only Open Weights badge in the top ten at $34.0 per million characters with an August 2026 release date.

Waar ze elkaar daadwerkelijk zouden ontmoeten

Een team dat vandaag een telefoonagent bouwt en zich niet wil vastleggen op de end-to-endstack van één leverancier, zou precies deze cascade samenstellen: Breeze TTS 2 of een vergelijkbare engine voor de mond, iets anders voor de oren, en een gerouteerd taalmodel voor het denkwerk. Dat laatste van die drie is het onderdeel dat het vaakst verandert — het is waar de kwaliteit het snelst verbetert, waar de kosten het meest variëren, en waar het model dat dit kwartaal wint zelden het model is dat volgend kwartaal wint.

Die laag is een normale API-aanroep, en het is het enige onderdeel van deze stack dat het waard is om overdraagbaar te houden. Ongeveer 190 modellen van elf upstream-providers zitten achter één enkele OrcaRouter-sleutel tegen de lijstprijs van de provider zonder markup, dus het verwisselen van het redeneermodel achter een spraakagent is een configuratiewijziging in plaats van een integratieproject, en automatische failover zorgt ervoor dat een backend die een time-out krijgt de oproep niet laat vallen. Noch de Live Sessions-endpoint van GPT-Live-1, noch de gehoste API van Breeze TTS 2 is op die manier bereikbaar — de spraaklagen in deze vergelijking vallen buiten het bereik van een routeringslaag, en het is de moeite waard om dat duidelijk te zeggen in plaats van iets anders te suggereren.

Welke moet je kiezen?

Kies GPT-Live-1 als het gesprek het product is en je een gehoste, gesloten front-end kunt accepteren. Reserveringslijnen, eerstelijnsondersteuning, alles waarbij een beller die door de agent heen praat een normale gebeurtenis is in plaats van een uitzondering. Je koopt de onderbrekingsafhandeling, en je koopt die tegen een tarief per minuut dat voorspelbaar blijft, terwijl de redenering erachter het deel is dat je afstelt.

Kies Breeze TTS 2 als je een stem nodig hebt die je kunt inspecteren, als je een product bouwt waarin de synthese één van vele componenten is, of als je stemklonen en stemontwerp nodig hebt die GPT-Live-1 helemaal niet biedt. Ga er met de wetenschap in dat de gewichten voor onderzoek zijn, dat de claim van 50 talen een leveranciersclaim is tegenover een modelkaart die voor twee talen is getagd, en dat de latentiecijfers de eigen metingen van BreezeBlue op een opgewarmd snel pad zijn in plaats van een onafhankelijke audit.

Het instinct om dit als een kwaliteitswedstrijd te behandelen, is het verkeerde instinct. Breeze TTS 2 staat dicht bij de top van de ranglijst waarop het concurreert, en GPT-Live-1 concurreert op een heel andere ranglijst. De beslissing die echt geld kost, is de beslissing die onder beide ligt: welk model het denkwerk doet, en of je daar in een middag van gedachten over kunt veranderen.