Breeze TTS 2 — De nieuwe open-gewichten TTS-leider op 1.215 Elo Geregenereerde illustratie.
Guides & Insights

Breeze TTS 2: de nieuwe open-gewichten TTS-leider op 1.215 Elo

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Breeze TTS 2 is nu het hoogst gerangschikte open-weights tekst-naar-spraakmodel op de Provider Voices Speech Arena van Artificial Analysis, met 1215 Elo — 90 punten boven de vorige open-weights leider, Fish Audio S2 Pro, en gerangschikt op #6 overall van meer dan 100 beoordeelde systemen. De notering is de eerste onafhankelijke bevestiging van wat BreezeBlue beweert sinds het model medio augustus 2026 werd onthuld: dat een twee weken oud stemmodel van een startup met ongeveer 15 medewerkers kan meekomen met de commerciële tekst-naar-spraakvoorhoede. De open gewichten verschenen op 25 augustus 2026 op Hugging Face; het arena-resultaat volgde binnen een dag. Wat Breeze TTS 2 verder ook blijkt te zijn, het is niet langer een leveranciersbelofte — het heeft een Elo die dat zegt.

Wat er eigenlijk is gebeurd, in volgorde

De tijdlijn is hier van belang, omdat het verklaart waarom een "open weights leaderboard"-bericht afkomstig is van een bedrijf waar de meeste mensen drie weken geleden nog nooit van hadden gehoord. BreezeBlue is opgericht door Yang Bin, een voormalig technisch medeoprichter van een van China's toonaangevende AI-labs, met een seed-ronde van $6 miljoen onder leiding van Yuanjing Capital en Redpoint China. Het model doorliep drie zichtbare mijlpalen:

• 7 augustus 2026 — BreezeBlue heeft zijn eigen text-to-speech-benchmarksuite voor voice design, voice direction en latency-evaluatie gepubliceerd op Hugging Face.

• 16–17 augustus 2026 — het bedrijf kondigde formeel Breeze TTS 2 aan als een realtime vlaggenschip-spraakmodel voor interactieve media, en opende een gehoste API voor $34 per 1M tekens.

• 25 augustus 2026 — de gewichten en PyTorch-inferentiecode werden open-source gemaakt op Hugging Face als BreezeBlue/Breeze-TTS-2, een model met 3B-parameters onder een onderzoeks- en niet-commerciële licentie.

De Artificial Analysis Provider Voices-ranglijst stond binnen enkele dagen na de open-weights-release live. Omdat de arena modellen beoordeelt via blind side-by-side luisteren, is de 1.215 Elo geen benchmark die BreezeBlue op zichzelf heeft uitgevoerd — het is het verzamelde oordeel van luisteraars die echte samples vergelijken, en dat is precies wat een model dat zo jong is het meest mist.

Het scorebord

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• Arena-rank — #6 overall op Provider Voices; #1 onder alle open-weights-modellen, vóór Fish Audio S2 Pro (1.125 Elo).

• Elo — 1.215, met een 95%-BI van ongeveer ±17 (Artificial Analysis, eind augustus 2026).

• Talen — 50, volgens BreezeBlue; het modelkaartje is getagd als Engels en Chinees.

• Prijs — $34 per 1M karakters op het gehoste eindpunt van BreezeBlue; open weights zijn gratis te downloaden, maar vallen onder een niet-commerciële licentie.

• Snelheid — ~45 tekens per seconde volgens de metingen van Artificial Analysis — langzamer dan verschillende concurrenten, wat belangrijk is voor langere taken.

• Latentie — sub-40ms streaminglatentie, volgens BreezeBlue (door leverancier opgegeven, niet onafhankelijk gemeten).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Wat Breeze TTS 2 eigenlijk anders doet

De Elo haalt de krantenkop, maar de productclaim is interessanter dan de score. Breeze TTS 2 is gebouwd rond twee ideeën die de meeste tekst-naar-spraakmodellen als bijzaak beschouwen: stemontwerp en stemregie. Stemontwerp is zero-shot en referentievrij — je beschrijft een stem in natuurlijke taal ("een warme verteller van midden veertig met een licht zuidelijk accent en een droge humor") en het model genereert die stem zonder studio-opname of referentieclip. Stemregie ontkoppelt het timbre van de spreker van de spreekintentie, zodat je een zin sarcastisch, gedempt of gehaast kunt laten klinken zonder dat het model naar een ander personage afdrijft. BreezeBlue zegt dat dezelfde sprekeridentiteit de verschuiving overleeft, en zijn eigen stemregie-benchmark rapporteert een sprekersimilariteit van 0.67 SPK_SIM (door de leverancier gerapporteerd).

Die twee mogelijkheden wijzen op de beoogde markt van Breeze TTS 2. Het persmateriaal is expliciet: videogamepersonages, digitale metgezellen, verhalende storytelling, uitzenddrama en virtuele streamers — langlopende, rollengedreven audio met meerdere personages, niet zomaar weer een vertel-API. Het bedrijf levert een bijbehorende stemmenbibliotheek genaamd Voice Galaxy met meer dan 15.000 karakterstemmen van community's en studio's, en de demo-reel van BreezeBlue is een fan-hoorspel met meerdere personages dat ruim tien minuten duurt. In de eigen gepubliceerde benchmarks (door de leverancier gerapporteerd, niet onafhankelijk gereproduceerd) claimt Breeze TTS 2 de eerste plaats op de Voice Design-benchmark voor tekst-naar-spraak, met een Role Fit-score van 78,02 tegenover 72,78 voor MiMo-V2.5-TTS en een samengestelde Voice Direction-score van 4,25.

De asterisk van de licentie

Voordat de term 'open weights' te veel marketingwerk doet, lees de modelkaart. Breeze TTS 2 heeft 3B parameters, safetensors, F32/BF16, en de broncode is Apache 2.0 — maar de gewichten, afgeleide modellen en zelf-gehoste outputs zijn uitsluitend gelicentieerd voor onderzoek en niet-commercieel gebruik, onder de breezeblue-research-and-non-commercial-license. Dat betekent dat 'open weights' hier niet 'gratis voor je product' is. Commercieel self-hosten is niet toegestaan volgens de licentie zoals geschreven; de commerciële weg is de gehoste API voor $34 per 1M tekens. Dit is dezelfde vorm als verschillende andere open releases uit 2026 — inspecteerbaar en zelf-hostbaar voor onderzoek, maar met het inkomsten genererende gebruik voorbehouden aan het eigen endpoint van de leverancier.

Waarom een router belangrijk is voor een model dat zo jong is.

Het eerlijke risico met Breeze TTS 2 op dit moment is niet de kwaliteit — het is de leeftijd. Het model is tien dagen live, de gewichten twee dagen. Geen productieteam zou een spraakpijplijn moeten inzetten op zo'n jong model zonder een manier om ervan af te stappen, en dat is precies de faalmodus waarvoor een routeringslaag bestaat om op te vangen. Als je Breeze TTS 2 evalueert via een gateway die het leveranciers-eindpunt behandelt als één route naast vele andere, krijg je vandaag de Elo-leider, automatische failover naar een fallback-provider wanneer de API verminderd presteert, en een wijziging van één regel als een week oud model een regressie vertoont. Dat is dezelfde discipline die de routerings-DSL op elk model toepast: combineer het met alternatieven, houd de interface stabiel en laat het model zichzelf bewijzen voordat je het dragend laat worden. Geen van de modellen in deze serie wordt nog via OrcaRouter zelf gerouteerd, dus het eerlijke advies is om Breeze TTS 2 aan te sluiten op welke gateway je ook al draait — en je huidige provider ernaast actief te houden terwijl de Elo ouder en betrouwbaarder wordt.

Wat nu te kijken

De {{1}}Provider Voices #1-open-weights{{/1}}-plek is vandaag het nieuws, maar het is de zwakkere van de twee arena's voor dit model. Op de {{2}}Controlled Voice-arena van Artificial Analysis{{/2}}, waar alle modellen worden vergeleken op dezelfde vaste referentiestemmen, staat {{3}}Breeze TTS 2{{/3}} op #3 onder de open-weights-modellen met {{4}}1.002 Elo{{/4}}, achter {{5}}Voxtral van Mistral{{/5}} op 1.010 — en #16 overall van de 39. Die kloof tussen de provider-voice-score (1.215, #1 open) en de controlled-voice-score (1.002, #3 open) is het waard om in de gaten te houden: het suggereert dat het voordeel van {{6}}Breeze TTS 2{{/6}} geconcentreerd zit in de stemmen die het voor zichzelf ontwerpt, wat precies de productclaim is, en het is ook precies de claim waar een onafhankelijke benchmark druk op moet blijven uitoefenen. Let op of de controlled-voice-Elo de provider-voice-score nadert, of de commerciële licentie strenger of ruimer wordt, en — vooral — of iemand de voice-design- en voice-direction-benchmarks buiten de eigen suite van {{7}}BreezeBlue{{/7}} reproduceert.

Voor een model dat een maand geleden nog niet bestond, heeft Breeze TTS 2 al het nuttigste verdiend dat een tekst-naar-spraakmodel kan verdienen: een onafhankelijke score die overeenkomt met de marketing. Of het een standaardstem wordt voor interactieve producten hangt minder af van de volgende Elo-update dan van hoe de licentie en het self-hosting-verhaal zich ontwikkelen — maar vanaf deze week heeft open-weights tekst-naar-spraak een nieuwe leider, en die is twee weken oud.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.