
Gemini 3.8 TTS vs Breeze TTS 2: Licensen, inte topplistan, avgör det här
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Femtioosex Elo-poäng skiljer Gemini 3.8 Flash TTS och Breeze TTS 2 på Artificial Analysis Provider Voice Arena, och de ligger inte inom varandras felmarginaler: Leverantörens modell ligger på plats 2 med ett Elo på 1 260 över 1 999 sampel och 8 arena-röster, släppt den 23 september 2026; Breeze TTS 2 ligger på plats 9 med 1 204 över 1 390 sampel, släppt i augusti 2026. Prisbilden vänder ordningen tvärt — Breeze listas till 34,00 $ per miljon tecken normaliserat mot 16,50 $ för Flash TTS, så modellen som vinner på tavlan förlorar på räkningen med ungefär det dubbla.
Om det var hela jämförelsen skulle det bli en kort text och du skulle välja utifrån hur mycket du litar på ett gap på 56 poäng. Men de två modellerna är inte samma typ av objekt. Breeze TTS 2 är en modell med öppna vikter och 3 miljarder parametrar som du kan ladda ner, granska och köra själv, med en licens som visar sig betyda mer än dess placering på en topplista. Gemini 3.8 Flash TTS är en API-slutpunkt med röstdesign och dialog mellan två talare och inga vikter alls. Att välja mellan dem är en licens- och driftsättningsfråga i benchmarkkläder.

Vad var och en faktiskt är
Få klart för dig hur varje modell ser ut innan du jämför siffror, för de skiljer sig åt på nästan varje axel som inte är Elo.
• Distribution – Breeze TTS 2 är nedladdningsbar: vikterna publiceras på Hugging Face som BreezeBlue/Breeze-TTS-2 tillsammans med PyTorch-kod. Gemini 3.8 Flash TTS är endast tillgänglig via API, nåbar genom Gemini API och de Google-ytor som nämns i tillkännagivandet den 23 september.
• Storlek — Breeze TTS 2 är en 3B-parametermodell, vilket är anledningen till att den över huvud taget kan självhostas. Google har inte publicerat något parameterantal för någon av Gemini 3.8 TTS-modellerna.
• Röstskapande — Gemini 3.8 Flash TTS utför röstdesign utifrån en skriven beskrivning och röstreplikering från ett 30-sekundersprov. Breeze TTS 2 levereras med ett röstbibliotek som leverantören räknar i tusental och en egen väg för röstdesign; de leverantörsrapporterade poängen för rollmatchning och regi för den vägen är BreezeBlues egna och har ingen oberoende motsvarighet.
• Dialog — Gemini 3.8 Flash TTS genererar dialog mellan två talare i ett enda anrop, med stil på repliknivå. Breeze TTS 2 är en modell med en enda röst; en konversation är två körningar som fogats samman.
• Språk — Breeze TTS 2 täcker 50 språk enligt leverantörens siffror. I Googles tillkännagivande anges 130 för Flash-modellen, men de två siffrorna mäter inte samma sak och bör inte tolkas som 130 mot 50.
• Latens — BreezeBlue uppger en strömningslatens på under 40 ms; Google publicerar ingen motsvarande siffra för Flash TTS. Ingen av siffrorna är oberoende verifierad, och bara en av dem existerar.
Licensen är det verkliga vägskälet
Det här är den delen som topplistan inte kan visa dig, och det är anledningen till att de två modellerna inte är utbytbara ens där deras kvalitet överlappar.
Breeze TTS 2:s vikter levereras under BreezeBlue-licensen för forskning och icke-kommersiellt bruk. Källkoden i samma repository är Apache 2.0. Dessa två fakta står bredvid varandra på modellkortet och klumpas ihop till "öppen källkod" i de flesta reportage, vilket är fel åt det håll som kostar pengar: att koden är Apache 2.0 gör inte vikterna till Apache 2.0, och kommersiell användning av modellen går via det hostade API:et i stället för via en självhostad checkpoint.

Googles sida har ingen licensfråga alls, eftersom det inte finns något att licensiera. Du köper inferens. Det du ger upp är det som öppna vikter vanligtvis köps för – möjligheten att köra modellen där data finns, att låsa en version och behålla den, och att sluta betala per tecken.
Så den ärliga inramningen är inte öppen kontra sluten. Den är:
• Om din driftsättning måste hålla ljudet inom din egen infrastruktur är Breeze TTS 2 den enda av de två som erbjuder en väg, och vägen är en forskningslicens. Rådgör med juridiskt ombud innan du bygger en produkt på den.
• Om din driftsättning kan anropa ett API försvinner licensfrågan och jämförelsen återgår till kvalitet, pris och funktioner – där Flash TTS ligger före på två av de tre.
• Om du vill ha öppna vikter som du kan kommersialisera utan en konversation, är ingen av dessa den modellen, och arenan har andra rader.
När Elo-gapet har betydelse och när det inte har det
En skillnad på 56 punkter ligger utanför de ±16 och ±16 konfidensintervall som tavlan rapporterar för dessa två rader, så rangordningen är inte brus på samma sätt som till exempel Flash TTS mot Gemini 3.8 Flash-Lite TTS är brus. Men ett arena-Elo mäter en sak: vilket av två klipp en lyssnare föredrog i en blind jämförelse. Det är en preferenssignal, aggregerad.
Det den inte mäter är allt som en produktionspipeline bryr sig om. Den berättar inte hur någon av modellerna hanterar ett 40-minutersmanus utan identitetsdrift, hur den uttalar din produkts namn, hur den beter sig när indata innehåller ett telefonnummer, eller hur dess felbeteende ser ut när den ombeds om något utanför sin träning. Breeze TTS 2:s 1 390 prover och Flash TTS:s 1 999 är båda tillräckligt stora för att aggregatet ska vara stabilt, och båda är tillräckligt små för att ingen enskild del av ditt användningsfall ska representeras i dem.
Gapet är också mindre än det verkar när man tar hänsyn till vad varje modell ombeds göra. Flash TTS hanterar två talare i ett och samma anrop, vilket är en svårare uppgift än den Breeze TTS 2 bedöms på. Huruvida det gör de 56 poängen till en underdrift eller överdrift beror på ditt användningsfall, och ingen av leverantörerna har publicerat den ablation som skulle avgöra saken.

Vad en timme av varje kostar
De två prissiffrorna är inte direkt jämförbara, och att låtsas att så inte är fallet är det vanligaste misstaget i texter om den här matchningen.
Google fakturerar i tokens: 0,50 USD per miljon texttokens in och 9,00 USD per miljon ljudtokens ut fram till den 31 december 2026, därefter 18,00 USD. Batch och Flex kostar 0,25 USD och 4,50 USD; Priority kostar 0,90 USD och 16,00 USD. Flash-Lite TTS, syskonmodellen, kostar 0,50 USD och 6,00 USD, därefter 12,00 USD.
BreezeBlue fakturerar i tecken: $34.00 per miljon tecken via det hostade API:et.
Artificial Analysis normaliserar båda till en bas per miljon tecken så att de kan dela en resultattavla, och det är där $16.50 mot $34.00 kommer ifrån. Normaliseringen är resultattavlans, inte någon av leverantörernas — Google publicerar ingen taxa per tecken för Flash TTS, och att behandla $16.50 som en offert i stället för en omvandling är hur folk blir överraskade av en faktura.
Två konsekvenser värda att planera för:
• Flash TTS-priset fördubblas den 1 januari 2027. Med kampanjpriset i budgeten minskar gapet till Breeze TTS 2 kraftigt; med 18,00 USD i budgeten sluts det nästan.
• Att självhosta Breeze TTS 2 gör det inte gratis, det gör det till en kapitalkostnad. En 3B-modell är tillräckligt liten för att kunna köras på anspråkslös hårdvara, men kalkylen går bara ihop vid stora volymer, och bara för ett användningsfall som forskningslicensen tillåter.
Att välja, utan att låtsas att det finns ett enda svar
Beslutsträdet är kort.
Välj Gemini 3.8 Flash TTS om du behöver dialog med två talare, om du vill ha en röst som utformas från en beskrivning och behålls som ett ID, om din pipeline kan anropa ett API, och om prisändringen den 31 december är något du kan planera för. Det är den bättre modellen på den oberoende topplistan och den billigare på fakturan, och att den är sluten är inte ett problem för ett användningsfall som alltid skulle komma att bli ett API-anrop.
Välj Breeze TTS 2 om datahemvist eller inferens på plats är ett absolut krav, om du behöver en 3B-modell som du faktiskt kan ladda ner, eller om du bedriver forskning snarare än att leverera en produkt – vilket är precis det fall som dess licens är skriven för. Välj inte den enbart för etiketten öppna vikter; läs licensen först.
Och om du utvärderar båda är det billiga sättet att göra det att hålla valet reversibelt. OrcaRouter hostar ingen av dessa modeller – platsen för att anropa Gemini 3.8 Flash TTS är Googles eget API och de ytor som Google har namngivit, och platsen för att anropa Breeze TTS 2 är BreezeBlues hostade slutpunkt. Vad en router är bra för här är resten av stacken: över 200 modeller bakom en nyckel till leverantörens listpris utan påslag, så en ändring av leverantörspriset som januariprisjusteringen slår igenom samma dag i stället för vid nästa faktureringscykel, automatisk redundansväxling så en väg under utvärdering behöver inte vara en väg i produktion, och en routing-DSL som komponerar modeller till ett enda anrop när en röst inte räcker.
Enradsversionen: topplistan säger Google, licensen säger att det beror på, och priset säger: kolla kalendern innan du bestämmer dig för någotdera.
