Hero-titelkort för 'GPT-Live-1 vs Breeze TTS 2', med underrubriken 'Ett samtal eller en röst — och bara en av dem är en räkning', med tre kort som lyder 'GPT-Live-1: $0.05 per röstminut, inga vikter, hör medan den talar', 'Breeze TTS 2: 3B öppna vikter, 1 205 Elo, endast forskningslicens', 'Licensen, inte Elo, avgör den här', ovanför en sidfotsremsa med texten 'Arenasiffror för Breeze TTS 2 enligt Artificial Analysis; GPT-Live-1-siffror rapporterade av OpenAI.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

GPT-Live-1 vs Breeze TTS 2: Den ledande rösten med öppna vikter som du inte kan leverera

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Breeze TTS 2 är den högst rankade text-till-tal-modellen med öppna vikter på Provider Voices Speech Arena från Artificial Analysis, med 1 205 Elo och på sjunde plats totalt bland fler än hundra rankade system – före varje kommersiellt licensierad motor som publicerar vikter. Dess vikter har varit nedladdningsbara sedan den 25 augusti 2026. Den är dessutom, enligt den licens som dessa vikter levereras med, oanvändbar i en produkt. GPT-Live-1 är den motsatta avvägningen i varje avseende: sluten, hostad, debiterad med 0,05 dollar per röstminut sedan den nådde OpenAI:s utvecklar-API den 10 september 2026, och den enda av de två som kan höra en uppringare avbryta den.

Ställ de två meningarna bredvid varandra, så avgörs jämförelsen snabbare än de flesta modellmatcher gör. Det här är inte en kamp om vilken som syntetiserar bättre tal. Det är en kamp om huruvida du köper en röst eller ett samtal, och huruvida "öppen" betyder vad du antog att det betydde.

De är inte samma typ av sak, och det är själva poängen.

Breeze TTS 2, från en startup med omkring femton anställda som heter BreezeBlue, är en text-till-tal-modell med 3 miljarder parametrar. Text går in, ljud kommer ut. Den hör ingenting. Den har ingen uppfattning om när en tur ska avslutas, eftersom den inte har något begrepp om en tur. Strömmad över en WebSocket börjar den producera ljud innan din text har genererats klart, vilket är genuint användbart för att hålla en röstagents tempo tajt – men beslutet om när den ska tala fattades av det som skrev texten.

GPT-Live-1 är en full-duplex tal-till-tal-modell. Ljud och text går in; ljud och text kommer ut; och modellen bestämmer många gånger per sekund om den ska fortsätta lyssna, pausa, ta turen eller lämna den. Open​AI:s egna siffror från Full Duplex Bench v1.5, publicerade i samband med lanseringen och inte reproducerade utanför företaget, visar att dess interaktivitet ligger på 80,1 % mot 45,4 % för GPT-Realtime-2.1, med en turtagningslatens på 0,798 sekunder mot 1,41.

Den asymmetrin är inte en känga mot Breeze TTS 2. Det är en varning om var och en hör hemma i en stack. Om du bygger en kaskad – taligenkänning som matar en språkmodell som matar en talsyntes – är Breeze TTS 2 en kandidat för den sista tredjedelen av den. Om du köper GPT-Live-1 köper du hela loopen och lämnar över turtagningslogiken med den.

Dimension för dimension

• Interaktionsmodell — GPT-Live-1: full duplex, inbyggd barge-in, lyssnar medan den talar vs Breeze TTS 2: strömmande text-till-tal, ingen ljudinmatning alls

• Vikter — GPT-Live-1: stängd, endast hostad, ett modell-ID och inga daterade snapshots vs Breeze TTS 2: 3B parametrar på Hugging Face sedan 25 augusti 2026, PyTorch-inferenskod Apache-2.0

• Licens — GPT-Live-1: kommersiella villkor via OpenAI:s API, inget att granska jämfört med Breeze TTS 2: en forsknings- och icke-kommersiell licens som omfattar vikterna, finjusteringar, LoRA:er, sammanslagningar, kvantiseringar och självhostade utdata

• Prisenhet — GPT-Live-1: 0,05 USD per röstminut, debiteras per sekund, resonemangsbackend mäts separat jämfört med Breeze TTS 2: 34 USD per miljon tecken på den hostade slutpunkten, med nedtrappning till 28 USD vid den högsta publicerade planen

• Kvalitetsbevis — GPT-Live-1: 70,3 % på Artificial Analysis Speech to Speech Index, delad sjätteplats av fjorton poängsatta modeller mot Breeze TTS 2: 1 205 Elo på Provider Voices-arenan, sjunde totalt och först bland öppenviktsmodeller, enligt Artificial Analysis

• Språk — GPT-Live-1: lanseringsbevakningen påpekar genomgående ojämn språkflyt utanför de stora språken jämfört med Breeze TTS 2: 50 som leverantören uppger, med modellkortet taggat för engelska och kinesiska

• Röststyrning — GPT-Live-1: tolv API-röster, ton och tempo styrs av prompt, ingen kloning alls vs Breeze TTS 2: referensljudkloning, referensfri röstdesign, röstregi och inline-rösthändelser

• Genomströmning – GPT-Live-1: mäts i samtidiga sessioner, med ett tak på 25 i nivå 1 och 500 i nivå 5, utan gratisnivå, jämfört med Breeze TTS 2: ungefär 45 tecken per sekund enligt mätning från Artificial Analysis, vilket är långsammare än flera kommersiella konkurrenter och har betydelse för långformat arbete

A two-column comparison scoreboard titled 'GPT-Live-1 vs Breeze TTS 2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Weights: closed, hosted only', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning'. The right column, labelled Breeze TTS 2, reads 'Kind: streaming text-to-speech', 'Price: $34 per 1M characters hosted', 'Weights: 3B on Hugging Face, research licence', 'Independent score: 1,205 Elo, 7th of 100+ on the AA Provider Voices arena', 'Latency: p50 133.6 ms time to first audio (vendor)', 'Voices: cloning, voice design, inline events'. The footer reads 'GPT-Live-1 interactivity OpenAI-reported and unreproduced; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Licensen gör mer arbete än topplistan.

BreezeBlues eget modellkort är ovanligt rakt på sak om detta, vilket hedrar företaget. Inferenskoden är Apache-2.0. Vikterna och alla utdata du genererar genom att själv hosta dem är för forskningsbruk, och kommersiell driftsättning kräver antingen en betald hostad prenumeration eller skriftligt tillstånd. Den begränsningen omfattar uttryckligen derivatmodeller, LoRA:er, sammanslagningar och kvantiseringar – vilket stänger kryphålet som folk vanligtvis tar till.

Så formuleringen "ledare inom öppna vikter" behöver en nyansering som rubriker sällan har. Breeze TTS 2 är öppen i den meningen att du kan ladda ner den, granska den, benchmarka den och köra den på din egen hårdvara för utvärdering. Den är inte öppen i den mening som tillåter en startup att bygga en produkt på den utan att antingen betala BreezeBlue eller bekosta juridisk granskning. Två av de tre saker folk menar med öppna vikter — verifierbarhet och kostnad — får du. Den tredje — friheten att släppa — får du inte.

Det är en verklig skillnad från en modell som GPT-Live-1, där licensfrågan inte är "får jag" utan "hur mycket". Båda slutar med en räkning. Bara en av dem slutar med ett juridiskt utlåtande först.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2, showing the tags 'Text-to-Speech', Transformers, Safetensors, PyTorch, English and Chinese, the licence label 'breezeblue-research-and-non-commercial-license', the notice 'Source code is licensed under Apache 2.0. Breeze TTS 2 model weights, derivative models, and self-hosted outputs are for research and non-commercial use only', a news entry dated 2026.08.25 reading 'We release Breeze TTS 2 model weights and the PyTorch inference code', the claim that it 'ranks #1 among open-weight models on the Artificial Analysis TTS leaderboard', a model size of 3B params with F32 and BF16 tensor types, and the note 'This model isn't deployed by any inference provider'.

De två prisenheterna är inte jämförbara, så här är uträkningen.

0,05 dollar i minuten och 34 dollar per miljon tecken ser ut som om de lever i olika universum, för det gör de. För att jämföra dem måste man konvertera. Tal ligger på ungefär 150 ord i minuten, och engelska har i genomsnitt omkring fem och ett halvt tecken per ord när man räknar med mellanslag, så en minut talad utdata är ungefär 800 till 900 tecken. Med Breeze TTS 2:s 34 dollar per miljon blir det ungefär tre cent syntes per minut – billigare än GPT-Live-1:s fem, räknat på själva talet.

Jämförelsen faller samman omedelbart efteråt, eftersom GPT-Live-1:s fem cent inkluderar lyssnandet. Den transkriberar också den som ringer, avgör när turen är slut och hanterar avbrottet — arbete som en kaskad måste köpa in från annat håll: en taligenkänningsmodell, en turdetekteringsmodell och en språkmodell för att producera texten som Breeze TTS 2 ska läsa. Lägger man till dem hamnar kaskadens tre cent för syntesen under en nota som vanligtvis är större än end-to-end-modellens.

Den ärliga sammanfattningen är att den billigare rösten är Breeze TTS 2 och det billigare samtalet är GPT-Live-1, och skillnaden mellan dessa två påståenden är allt som en röstagent faktiskt kostar.

A screenshot of the Artificial Analysis Provider Voices speech arena leaderboard, ranking text-to-speech models by blind-listener Elo. The table runs Cartesia Sonic 3.6 first on 1,275 Elo from 1,755 samples and $49.0 per million characters, then Inworld Realtime TTS-2 at 1,244, Speechify Simba 3.2 at 1,233 and Qwen-Audio-3.0-TTS-Plus at 1,232, down to BreezeBlue Breeze TTS 2 at 1,205 Elo from 1,227 samples, seventh overall, carrying the only Open Weights badge in the top ten at $34.0 per million characters with an August 2026 release date.

Där de faktiskt skulle mötas

Ett team som bygger en telefonagent i dag och inte vill binda sig till en enda leverantörs end-to-end-stack skulle sätta ihop exakt den här kaskaden: Breeze TTS 2 eller en jämförbar motor för munnen, något annat för öronen och en routad språkmodell för tänkandet. Den sista av de tre är delen som ändras oftast – det är där kvaliteten förbättras snabbast, där kostnaden varierar mest och där modellen som vinner det här kvartalet sällan är den som vinner nästa.

Det lagret är ett vanligt API-anrop, och det är den enda delen av den här stacken som är värd att hålla portabel. Ungefär 190 modeller från elva uppströmsleverantörerligger bakom en enda OrcaRouter-nyckel till leverantörens listpris utan påslag, så att byta ut resonemangsmodellen bakom en röstagent är en konfigurationsändring snarare än ett integrationsprojekt, och automatisk redundansväxling hindrar en backend som får timeout från att tappa samtalet. Varken GPT-Live-1:s Live Sessions-endpoint eller Breeze TTS 2:s hostade API går att nå på det sättet – röstlagren i den här jämförelsen ligger utanför ett routningslagers räckvidd, och det är värt att vara tydlig med det i stället för att antyda något annat.

Vilken ska man välja?

Välj GPT-Live-1 om samtalet är produkten och du kan acceptera en hostad, sluten front end. Bokningslinjer, förstalinjesupport, allt där en uppringare som pratar över agenten är en normal företeelse snarare än ett undantag. Du köper avbrottshanteringen, och du köper den till en minuttaxa som förblir förutsägbar medan resonemanget bakom är den del du justerar.

Välj Breeze TTS 2 om du behöver en röst du kan granska, om du bygger en produkt där syntesen är en komponent bland många, eller om du behöver kloning och röstdesign som GPT-Live-1 inte erbjuder alls. Gå in i det med vetskapen att vikterna är för forskning, att påståendet om 50 språk är ett leverantörspåstående mot ett kort som är taggat för två språk, och att latenssiffrorna är BreezeBlues egna mätningar på en uppvärmd snabbväg snarare än en oberoende granskning.

Instinkten att behandla detta som en kvalitetstävling är fel instinkt. Breeze TTS 2 ligger nära toppen av den topplista den tävlar på, och GPT-Live-1 tävlar på en helt annan topplista. Beslutet som faktiskt kostar pengar är det som ligger under båda: vilken modell som står för tänkandet, och huruvida du kan ändra dig om det under en eftermiddag.