Główna karta tytułowa dla „GPT-Live-1 vs Breeze TTS 2", z podtytułem „Rozmowa albo głos — a tylko jedno z nich to rachunek", zawierająca trzy karty o treści „GPT-Live-1: 0,05 USD za minutę głosu, brak wag, słyszy, kiedy mówi", „Breeze TTS 2: 3 mld otwartych wag, 1 205 Elo, tylko licencja badawcza", „Licencja, a nie Elo, rozstrzyga w tym przypadku", nad paskiem stopki o treści „Wyniki areny Breeze TTS 2 według Artificial Analysis; dane GPT-Live-1 raportowane przez OpenAI". Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

GPT-Live-1 kontra Breeze TTS 2: Lider głosu open-weights, którego nie możesz wdrożyć

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Breeze TTS 2 to najwyżej oceniany model zamiany tekstu na mowę z otwartymi wagami w Provider Voices Speech Arena firmy Artificial Analysis, z wynikiem 1205 Elo i siódmym miejscem w ogólnym zestawieniu wśród ponad stu ocenianych systemów — przed każdym komercyjnie licencjonowanym silnikiem, który publikuje wagi. Jego wagi można pobierać od 25 sierpnia 2026 r. Nie da się go również — na licencji, z którą te wagi są dostarczane — użyć w produkcie. GPT-Live-1 to pod każdym względem przeciwny kompromis: zamknięty, hostowany, rozliczany po 0,05 USD za minutę głosu od czasu, gdy 10 września 2026 r. trafił do API dla deweloperów OpenAI, i jedyny z tych dwóch, który potrafi usłyszeć, że dzwoniący mu przerywa.

Postaw te dwa zdania obok siebie, a porównanie rozstrzygnie się szybciej niż w przypadku większości starć modeli. To nie jest walka o to, który lepiej syntetyzuje mowę. To walka o to, czy kupujesz głos, czy rozmowę, oraz czy „open” znaczy to, co zakładałeś, że znaczy.

Nie są tym samym rodzajem rzeczy i o to właśnie chodzi.

Breeze TTS 2, od około piętnastoosobowego startupu o nazwie BreezeBlue, to model tekst-na-mowę o 3 miliardach parametrów. Tekst na wejściu, dźwięk na wyjściu. Nic nie słyszy. Nie ma zdania na temat tego, kiedy powinna zakończyć się tura, ponieważ nie ma pojęcia tury. Przesyłany strumieniowo przez WebSocket zacznie generować dźwięk, zanim Twój tekst zostanie w pełni wygenerowany, co jest naprawdę przydatne do utrzymania równego tempa agenta głosowego — ale decyzja o tym, kiedy mówić, została podjęta przez to, co napisało tekst.

GPT-Live-1 to pełnodupleksowy model mowa-mowa. Na wejściu jest audio i tekst; na wyjściu jest audio i tekst; a model wiele razy na sekundę decyduje, czy dalej słuchać, zrobić pauzę, przejąć turę czy ją oddać. Własne wyniki OpenAI z Full Duplex Bench v1.5, opublikowane wraz z wydaniem i nieodtwarzane poza firmą, wskazują, że jego interaktywność wynosi 80,1% wobec 45,4% dla GPT-Realtime-2.1, przy opóźnieniu przejmowania tury wynoszącym 0,798 sekundy wobec 1,41.

Ta asymetria nie jest przytykiem do Breeze TTS 2. To ostrzeżenie o tym, gdzie każde z nich należy w stosie. Jeśli budujesz kaskadę — rozpoznawanie mowy zasilające model językowy, który zasila syntezator — Breeze TTS 2 jest kandydatem na ostatnią jedną trzecią. Jeśli kupujesz GPT-Live-1, kupujesz całą pętlę i oddajesz wraz z nią logikę przejmowania tur.

Dimension by dimension

• Model interakcji — GPT-Live-1: pełny dupleks, natywne przerywanie, słucha podczas mówienia vs Breeze TTS 2: strumieniowa synteza mowy, brak jakiegokolwiek wejścia audio

• Wagi — GPT-Live-1: zamknięty, dostępny wyłącznie jako usługa hostowana, jeden identyfikator modelu i brak datowanych snapshotów vs Breeze TTS 2: 3 mld parametrów na Hugging Face od 25 sierpnia 2026 r., kod wnioskowania PyTorch na licencji Apache-2.0

• Licencja — GPT-Live-1: warunki komercyjne za pośrednictwem API OpenAI, nic do przeanalizowania w porównaniu z Breeze TTS 2: licencja badawczo-niekomercyjna obejmująca wagi, dostrojone modele, LoRA-y, scalenia, kwantyzacje i wyniki hostowane samodzielnie

• Jednostka ceny — GPT-Live-1: 0,05 USD za minutę głosową, rozliczane za sekundę, backend rozumowania rozliczany osobno w porównaniu z Breeze TTS 2: 34 USD za milion znaków na hostowanym punkcie końcowym, z obniżką do 28 USD w najwyższym opublikowanym planie

• Dowody jakości — GPT-Live-1: 70,3% w Artificial Analysis Speech to Speech Index, ex aequo szóste miejsce wśród czternastu ocenianych modeli w porównaniu z Breeze TTS 2: 1 205 Elo na arenie Provider Voices, siódme miejsce ogółem i pierwsze wśród modeli z otwartymi wagami, według Artificial Analysis

• Języki — GPT-Live-1: relacje z premiery konsekwentnie zwracają uwagę na nierówną płynność poza głównymi językami w porównaniu z Breeze TTS 2: 50 deklarowanych przez dostawcę, z kartą modelu oznaczoną dla języka angielskiego i chińskiego

• Kontrola głosu — GPT-Live-1: dwanaście głosów API, ton i tempo sterowane promptem, całkowity brak klonowania vs Breeze TTS 2: klonowanie na podstawie audio referencyjnego, projektowanie głosu bez referencji, reżyseria głosu i wbudowane zdarzenia wokalne

• Przepustowość — GPT-Live-1: rozliczana na podstawie liczby równoczesnych sesji, z limitem 25 w warstwie 1 i 500 w warstwie 5, bez darmowej warstwy, w porównaniu z Breeze TTS 2: około 45 znaków na sekundę według pomiaru Artificial Analysis, co jest wolniejsze niż u kilku komercyjnych konkurentów i ma znaczenie w pracy z długimi tekstami

A two-column comparison scoreboard titled 'GPT-Live-1 vs Breeze TTS 2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Weights: closed, hosted only', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning'. The right column, labelled Breeze TTS 2, reads 'Kind: streaming text-to-speech', 'Price: $34 per 1M characters hosted', 'Weights: 3B on Hugging Face, research licence', 'Independent score: 1,205 Elo, 7th of 100+ on the AA Provider Voices arena', 'Latency: p50 133.6 ms time to first audio (vendor)', 'Voices: cloning, voice design, inline events'. The footer reads 'GPT-Live-1 interactivity OpenAI-reported and unreproduced; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Licencja robi więcej roboty niż tabela wyników

Karta modelu samego BreezeBlue jest w tej kwestii niezwykle bezpośrednia, co świadczy na korzyść firmy. Kod wnioskowania jest objęty licencją Apache-2.0. Wagi oraz wszelkie wyniki, które generujesz, hostując je samodzielnie, są przeznaczone do użytku badawczego, a wdrożenie komercyjne wymaga albo opłaconej subskrypcji usługi hostowanej, albo pisemnej zgody. To ograniczenie wyraźnie obejmuje modele pochodne, LoRA, scalenia i kwantyzacje — co zamyka lukę, po którą ludzie zwykle sięgają.

Zatem określenie „lider otwartych wag” wymaga zastrzeżenia, którego nagłówki rzadko zawierają. Breeze TTS 2 jest otwarty w tym sensie, że można go pobrać, sprawdzić, poddać benchmarkom i uruchomić na własnym sprzęcie w celach ewaluacyjnych. Nie jest otwarty w tym sensie, który pozwala startupowi zbudować na nim produkt bez płacenia BreezeBlue albo wykupienia przeglądu prawnego. Dwie z trzech rzeczy, które ludzie mają na myśli, mówiąc o otwartych wagach — weryfikowalność i koszt — dostajesz. Trzeciej — swobody wypuszczania produktu — nie.

To prawdziwa różnica w porównaniu z modelem takim jak GPT-Live-1, gdzie pytanie o licencję nie brzmi „czy mogę”, lecz „ile”. Oba kończą się rachunkiem. Tylko jeden z nich kończy się najpierw opinią prawnika.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2, showing the tags 'Text-to-Speech', Transformers, Safetensors, PyTorch, English and Chinese, the licence label 'breezeblue-research-and-non-commercial-license', the notice 'Source code is licensed under Apache 2.0. Breeze TTS 2 model weights, derivative models, and self-hosted outputs are for research and non-commercial use only', a news entry dated 2026.08.25 reading 'We release Breeze TTS 2 model weights and the PyTorch inference code', the claim that it 'ranks #1 among open-weight models on the Artificial Analysis TTS leaderboard', a model size of 3B params with F32 and BF16 tensor types, and the note 'This model isn't deployed by any inference provider'.

Te dwie jednostki cenowe nie są porównywalne, więc oto arytmetyka

0,05 USD za minutę i 34 USD za milion znaków wyglądają, jakby pochodziły z różnych wszechświatów, bo rzeczywiście tak jest. Aby je porównać, trzeba przeliczyć. Mowa płynie w tempie około 150 słów na minutę, a angielski ma średnio około pięciu i pół znaku na słowo, gdy wliczyć spacje, więc minuta wypowiedzi mówionej to około 800 do 900 znaków. Przy stawce 34 USD za milion w Breeze TTS 2 daje to około trzech centów syntezy na minutę — taniej niż pięć centów w GPT-Live-1, licząc samą mowę.

To porównanie zaraz potem się rozsypuje, ponieważ pięć centów GPT-Live-1 obejmuje słuchanie. Model ten także transkrybuje dzwoniącego, decyduje, kiedy kończy się tura, i zarządza przerwaniem — praca, którą kaskada musi kupić skądinąd: model rozpoznawania mowy, model wykrywania tur oraz model językowy do wygenerowania tekstu, który odczyta Breeze TTS 2. Dolicz je, a trzy centy kaskady za syntezę okażą się częścią rachunku, który zwykle jest wyższy niż w modelu end-to-end.

Uczciwe podsumowanie jest takie, że tańszy głos to Breeze TTS 2, a tańsza rozmowa to GPT-Live-1, a różnica między tymi dwoma twierdzeniami to wszystko, co tak naprawdę kosztuje agent głosowy.

A screenshot of the Artificial Analysis Provider Voices speech arena leaderboard, ranking text-to-speech models by blind-listener Elo. The table runs Cartesia Sonic 3.6 first on 1,275 Elo from 1,755 samples and $49.0 per million characters, then Inworld Realtime TTS-2 at 1,244, Speechify Simba 3.2 at 1,233 and Qwen-Audio-3.0-TTS-Plus at 1,232, down to BreezeBlue Breeze TTS 2 at 1,205 Elo from 1,227 samples, seventh overall, carrying the only Open Weights badge in the top ten at $34.0 per million characters with an August 2026 release date.

Gdzie faktycznie by się spotkali

Zespół, który dziś buduje agenta telefonicznego i nie chce zobowiązać się do kompleksowego stosu jednego dostawcy, złożyłby dokładnie taką kaskadę: Breeze TTS 2 lub porównywalny silnik do ust, coś innego do uszu i routowany model językowy do myślenia. Ostatni z tych trzech jest elementem, który zmienia się najczęściej — to tam jakość poprawia się najszybciej, koszt waha się najbardziej, a model, który wygrywa w tym kwartale, rzadko jest tym, który wygra w następnym.

Ta warstwa to zwykłe wywołanie API i to jedyna część tego stosu, którą warto utrzymać w formie przenośnej. Mniej więcej 190 modeli od jedenastu dostawców zewnętrznychstoi za jednym kluczem OrcaRouter w cenie katalogowej dostawcy, bez żadnej marży, więc podmiana modelu rozumującego stojącego za agentem głosowym to zmiana konfiguracji, a nie projekt integracyjny, a automatyczne przełączanie awaryjne nie pozwala, by backend, który przekroczy limit czasu, zerwał połączenie. Ani endpointu Live Sessions w GPT-Live-1, ani hostowanego API Breeze TTS 2 nie da się osiągnąć w ten sposób — warstwy głosowe w tym porównaniu znajdują się poza zasięgiem warstwy routingu i warto powiedzieć to wprost, zamiast sugerować coś przeciwnego.

Który wybrać

Wybierz GPT-Live-1, jeśli rozmowa jest produktem, a Ty możesz zaakceptować hostowany, zamknięty frontend. Linie rezerwacyjne, wsparcie pierwszego poziomu, cokolwiek, gdzie rozmówca mówiący jednocześnie z agentem to normalne zdarzenie, a nie wyjątek. Kupujesz obsługę przerwań i kupujesz ją w przewidywalnej stawce za minutę, podczas gdy to, co dostrajasz, to logika, która się za tym kryje.

Wybierz Breeze TTS 2, jeśli potrzebujesz głosu, który możesz poddać inspekcji, jeśli budujesz produkt, w którym synteza jest jednym z wielu komponentów, albo jeśli potrzebujesz klonowania i projektowania głosu, których GPT-Live-1 w ogóle nie oferuje. Zabierając się za to, miej świadomość, że wagi są przeznaczone do badań, że twierdzenie o 50 językach to twierdzenie dostawcy w zestawieniu z kartą oznaczoną dla dwóch języków, a dane dotyczące opóźnień to własne pomiary BreezeBlue na rozgrzanej szybkiej ścieżce, a nie niezależny audyt.

Odruch, by traktować to jako konkurs jakości, jest błędnym odruchem. Breeze TTS 2 jest blisko czołówki rankingu, w którym rywalizuje, a GPT-Live-1 rywalizuje w zupełnie innym rankingu. Decyzja, która naprawdę kosztuje pieniądze, to ta leżąca u podstaw obu: który model myśli i czy możesz zmienić zdanie w tej sprawie w ciągu jednego popołudnia.