
Breeze TTS 2: Den nya ledaren inom TTS med öppna vikter på 1 215 Elo
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 523 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 187 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Breeze TTS 2 är nu den högst rankade text-till-tal-modellen med öppna vikter på Artificial Analysis:s Provider Voices Speech Arena, med 1 215 Elo — 90 poäng klart före den tidigare ledaren bland öppna vikter, Fish Audio S2 Pro, och rankad #6 totalt av fler än 100 betygsatta system. Listningen är den första oberoende bekräftelsen av vad BreezeBlue har hävdat sedan de presenterade modellen i mitten av augusti 2026: att en två veckor gammal röstmodell från en startup på ungefär 15 personer kan mäta sig med den kommersiella text-till-tal-fronten. De öppna vikterna publicerades på Hugging Face den 25 augusti 2026; arenarezultatet kom inom en dag. Vad Breeze TTS 2 än annars visar sig vara, är det inte längre ett löfte från leverantören — det har en Elo som säger det.
Vad som faktiskt hände, i ordning.
Tidslinjen är viktig här, eftersom den förklarar varför ett inlägg om en "open weights-topplista" kommer från ett företag som de flesta inte hade hört talas om för tre veckor sedan. BreezeBlue grundades av Yang Bin, en tidigare teknisk medgrundare av ett av Kinas ledande AI-labb, med en såddrunda på 6 miljoner dollar ledd av Yuanjing Capital och Redpoint China. Modellen gick igenom tre synliga milstolpar:
• 7 augusti 2026 — BreezeBlue publicerade sitt eget text-till-tal benchmark-paket för röstdesign, röstregi och latensutvärdering på Hugging Face.
• 16–17 augusti 2026 — företaget tillkännagav formellt Breeze TTS 2 som en realtidsbaserad flaggskeppsröstmodell för interaktiva medier, och öppnade ett värdbaserat API för 34 USD per 1M tecken.
• 25 augusti 2026 — vikterna och PyTorch-inferenskoden publicerades som öppen källkod på Hugging Face som BreezeBlue/Breeze-TTS-2, en 3B-parametermodell under en forsknings- och icke-kommersiell licens.
Artificial Analysis Provider Voices-rankingen var live inom några dagar efter släppet av de öppna vikterna. Eftersom arenan betygsätter modeller genom blinda lyssningstester sida vid sida, är 1 215 i Elo inte ett riktmärke som BreezeBlue körde på sig själv — det är lyssnarnas samlade omdöme när de jämför riktiga prover, vilket är precis vad en så här ung modell saknar mest.
Resultattavlan

• Arenarank — #6 totalt på Provider Voices; #1 bland alla open-weights-modeller, före Fish Audio S2 Pro (1 125 Elo).
• Elo — 1 215, med ett 95 % KI på ungefär ±17 (Artificial Analysis, per slutet av augusti 2026).
• Språk — 50, enligt BreezeBlue; modellkortet är märkt med engelska och kinesiska.
• Pris — $34 per 1M tecken på BreezeBlues värdbaserade slutpunkt; öppna vikter är gratis att ladda ner men har en icke-kommersiell licens.
• Hastighet — ~45 tecken per sekund enligt Artificial Analysis' mätningar — långsammare än flera konkurrenter, vilket spelar roll för längre arbeten.
• Latens — strömningslatens under 40 ms, enligt BreezeBlue (tillverkaruppgift, inte oberoende uppmätt).

Vad Breeze TTS 2 faktiskt gör annorlunda
Elo får rubriken, men produktpåståendet är mer intressant än poängen. Breeze TTS 2 är byggt kring två idéer som de flesta text-till-tal-modeller behandlar som bisaker: röstdesign och röstregi. Röstdesign är zero-shot och referensfri — du beskriver en röst på naturligt språk (”en varm berättarröst i 40-årsåldern med en lätt sydstatsbrytning och torr humor”) och modellen genererar den rösten utan en studioinspelning eller ett referensklipp. Röstregi frikopplar talarens klangfärg från framförandeavsikten, så att du kan få en replik att låta sarkastisk, dämpad eller forcerad utan att modellen glider över i en annan karaktär. BreezeBlue uppger att samma talaridentitet överlever förändringen, och dess eget riktmärke för röstregi rapporterar en talarlikhet på 0,67 SPK_SIM (enligt leverantören).
Dessa två förmågor pekar på Breeze TTS 2:s avsedda marknad. Pressmaterialet är tydligt: TV-spelskaraktärer, digitala följeslagare, narrativt berättande, radiodrama och virtuella streamers – långformat, rollstyrt flerkaraktärsljud, inte bara ännu ett uppläsnings-API. Företaget levererar ett medföljande röstbibliotek som heter Voice Galaxy med fler än 15 000 community- och studiogjorda karaktärsröster, och BreezeBlues demoreel är ett flerkaraktärsradiodrama skapat av fans som pågår i över tio minuter. I sina egna publicerade benchmarks (leverantörsrapporterade, ej oberoende verifierade) gör Breeze TTS 2 anspråk på förstaplatsen i text-till-tal-benchmarken Voice Design med ett Role Fit-resultat på 78,02 jämfört med 72,78 för MiMo-V2.5-TTS, och ett sammansatt Voice Direction-resultat på 4,25.
Licensasterisken
Innan frasen "open weights" gör för mycket marknadsföringsarbete, läs modellkortet. Breeze TTS 2 är 3B parametrar, safetensors, F32/BF16, och källkoden är Apache 2.0 — men vikterna, derivatmodellerna och självhostade utdata är licensierade endast för forskning och icke-kommersiellt bruk, under breezeblue-research-and-non-commercial-license. Det betyder att "open weights" här inte är "gratis för din produkt." Kommersiell självhostning är inte tillåten enligt licensen som den är skriven; den kommersiella vägen är den hostade API:n till 34 USD per 1M tecken. Detta har samma form som flera andra öppna releaser från 2026 — inspekterbara och självhostningsbara för forskning, men med den intäktsgenererande användningen reserverad för leverantörens egen slutpunkt.
Varför en router är viktig för en så ung modell
Den ärliga risken med Breeze TTS 2 just nu är inte kvalitet — det är ålder. Modellen har varit live i tio dagar, vikterna i två dagar. Inget produktteam bör satsa en röstpipeline på en så ung modell utan en väg att komma bort från den, och det är precis den typen av fel som ett routinglager finns till för att fånga upp. Om du utvärderar Breeze TTS 2 genom en gateway som behandlar leverantörens slutpunkt som en rutt bland många, får du Elo-ledaren idag, automatisk failover till en reservleverantör när API:et är försämrat, och en enradsändring om en veckogammal modell visar en regression. Det är samma disciplin som routing-DSL:n tillämpar på alla modeller: kombinera den med alternativ, håll gränssnittet stabilt, och låt modellen bevisa sig själv innan du låter den bli bärande. Ingen av modellerna i den här serien är ännu routad genom själva OrcaRouter, så det ärliga rådet är att koppla in Breeze TTS 2 i vilken gateway du redan kör — och håll din nuvarande leverantör igång parallellt medan Elo-rankningen blir äldre och mer tillförlitlig.
Vad du ska titta på härnäst
Provider Voices #1-open-weights-platsen är dagens story, men det är den svagare av de två arenorna för den här modellen. På Artificial Analysis:s Controlled Voice-arena, där alla modeller jämförs med samma fasta referensröster, rankas Breeze TTS 2 som #3 bland open-weights-modellerna med 1 002 Elo, bakom Mistrals Voxtral på 1 010 – och #16 totalt av 39. Gapet mellan dess provider-voice-poäng (1 215, #1 open) och dess controlled-voice-poäng (1 002, #3 open) är värt att bevaka: det tyder på att Breeze TTS 2:s fördel är koncentrerad till de röster den designar åt sig själv, vilket är exakt produkternas anspråk, och det är också exakt det anspråk som en oberoende benchmark bör fortsätta sätta press på. Håll koll på om controlled-voice-Elo närmar sig provider-voice-siffran, om den kommersiella licensen stramas åt eller lossnar, och – viktigast av allt – om någon reproducerar voice-design- och voice-direction-benchmarks utanför BreezeBlues egen svit.
För en modell som inte fanns för en månad sedan har Breeze TTS 2 redan fått det mest användbara en text-till-tal-modell kan få: ett oberoende betyg som stämmer med marknadsföringen. Huruvida den blir en standardröst för interaktiva produkter beror mindre på nästa Elo-uppdatering än på hur licensen och self-hosting-berättelsen utvecklas — men från och med denna vecka har open-weights text-till-tal en ny ledare, och den är två veckor gammal.

