
Breeze TTS 2: Nowy lider TTS z otwartymi wagami na poziomie 1 215 Elo
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 523 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Breeze TTS 2 jest obecnie najwyżej ocenianym modelem zamiany tekstu na mowę z otwartymi wagami na Artificial Analysis's Provider Voices Speech Arena, z wynikiem 1215 Elo — 90 punktów przewagi nad poprzednim liderem wśród modeli z otwartymi wagami, Fish Audio S2 Pro, i zajmuje 6. miejsce w klasyfikacji ogólnej spośród ponad 100 ocenianych systemów. Ta klasyfikacja jest pierwszą niezależną potwierdzeniem tego, co BreezeBlue twierdzi od czasu zaprezentowania modelu w połowie sierpnia 2026 roku: że dwutygodniowy model głosowy z startupu liczącego około 15 osób może dorównać komercyjnym rozwiązaniom z czołówki zamiany tekstu na mowę. Otwarte wagi trafiły na Hugging Face 25 sierpnia 2026 roku; wynik na arenie pojawił się w ciągu jednego dnia. Czymkolwiek jeszcze okaże się Breeze TTS 2, nie jest już tylko obietnicą producenta — ma Elo, które to potwierdza.
Co tak naprawdę się stało, po kolei
Chronologia ma tu znaczenie, ponieważ wyjaśnia, dlaczego wpis o „rankingu modeli o otwartych wagach” pochodzi od firmy, o której większość ludzi nie słyszała trzy tygodnie temu. BreezeBlue został założony przez Yang Bina, byłego technicznego współzałożyciela jednego z czołowych chińskich laboratoriów AI, dzięki rundzie seed o wartości 6 milionów dolarów, której liderami byli Yuanjing Capital i Redpoint China. Model przeszedł przez trzy widoczne kamienie milowe:
• 7 sierpnia 2026 — BreezeBlue opublikowało na Hugging Face własny zestaw testów porównawczych syntezy mowy do projektowania głosu, reżyserii głosu i oceny opóźnień.
• 16–17 sierpnia 2026 r. — firma oficjalnie ogłosiła Breeze TTS 2 jako flagowy model głosowy czasu rzeczywistego dla mediów interaktywnych i udostępniła API hostowane w cenie 34 USD za 1 mln znaków.
• 25 sierpnia 2026 r. — wagi i kod wnioskowania PyTorch zostały udostępnione jako open-source na Hugging Face jako BreezeBlue/Breeze-TTS-2, model o parametrach 3B, na licencji badawczej i niekomercyjnej.
Ranking Artificial Analysis Provider Voices był dostępny w ciągu kilku dni od wydania otwartych wag. Ponieważ arena ocenia modele w ślepym porównaniu odsłuchowym, wynik 1215 Elo nie jest benchmarkiem, który BreezeBlue uruchomił na samym sobie — to skumulowany osąd słuchaczy porównujących prawdziwe próbki, czego właśnie najbardziej brakuje tak młodemu modelowi.
Tablica wyników

• Ranking Arena — #6 w klasyfikacji ogólnej Provider Voices; #1 wśród wszystkich modeli z otwartymi wagami, przed Fish Audio S2 Pro (1,125 Elo).
• Elo — 1,215, z 95% przedziałem ufności wynoszącym około ±17 (Artificial Analysis, stan na koniec sierpnia 2026 r.).
• Języki — 50, według BreezeBlue; karta modelu ma tagi angielski i chiński.
• Cena — 34 USD za 1 mln znaków w hostowanym punkcie końcowym BreezeBlue; otwarte wagi można pobrać za darmo, ale są objęte licencją niekomercyjną.
• Prędkość — ~45 znaków na sekundę według pomiarów Artificial Analysis — wolniej niż u kilku rywali, co ma znaczenie przy długich zadaniach.
• Opóźnienie — opóźnienie strumieniowania poniżej 40 ms, według BreezeBlue (deklaracja producenta, nie mierzone niezależnie).

Co właściwie robi inaczej Breeze TTS 2
Elo trafia na nagłówki, ale deklaracja produktowa jest ciekawsza niż wynik. Breeze TTS 2 opiera się na dwóch koncepcjach, które większość modeli zamiany tekstu na mowę traktuje jako coś pobocznego: projektowanie głosu i kierowanie głosem. Projektowanie głosu działa w trybie zero-shot i bez referencji — opisujesz głos w naturalnym języku („ciepły, około czterdziestoletni lektor z lekkim południowym akcentem i suchym dowcipem”), a model generuje taki głos bez nagrania studyjnego czy klipu referencyjnego. Kierowanie głosem rozdziela barwę głosu od intencji przekazu, więc możesz sprawić, by dana kwestia brzmiała sarkastycznie, szeptem lub pospiesznie, bez ryzyka, że model wpadnie w inną postać. BreezeBlue twierdzi, że ta sama tożsamość mówcy przetrwa taką zmianę, a własny benchmark kierowania głosem podaje podobieństwo mówcy na poziomie 0,67 SPK_SIM (dane producenta).
Te dwie możliwości wskazują na docelowy rynek Breeze TTS 2. Materiały prasowe są jednoznaczne: postacie z gier wideo, cyfrowi towarzysze, narracyjne opowiadanie historii, słuchowiska i wirtualni streamerzy — długie, oparte na rolach nagrania z wieloma postaciami, a nie tylko kolejne API do narracji. Firma dostarcza towarzyszącą bibliotekę głosów o nazwie Voice Galaxy, zawierającą ponad 15 000 głosów postaci stworzonych przez społeczność i studio, a demo BreezeBlue to wielopostaciowe fanowskie słuchowisko radiowe trwające ponad dziesięć minut. We własnych opublikowanych testach porównawczych (raportowanych przez producenta, niezweryfikowanych) Breeze TTS 2 twierdzi, że zajmuje pierwsze miejsce w benchmarku Voice Design dla zamiany tekstu na mowę, z wynikiem Role Fit 78.02 wobec 72.78 dla MiMo-V2.5-TTS oraz złożonym wynikiem Voice Direction 4.25.
Gwiazdka licencji
Zanim fraza „open weights" wykona zbyt dużo pracy marketingowej, przeczytaj kartę modelu. Breeze TTS 2 ma 3B parametrów, safetensors, F32/BF16, a kod źródłowy jest na licencji Apache 2.0 — ale wagi, modele pochodne i samodzielnie hostowane wyniki są licencjonowane wyłącznie do celów badawczych i niekomercyjnych, zgodnie z licencją breezeblue-research-and-non-commercial-license. Oznacza to, że „open weights" w tym przypadku nie znaczy „darmowe dla twojego produktu". Komercyjne hostowanie na własnych serwerach nie jest dozwolone zgodnie z treścią licencji; ścieżka komercyjna to hostowane API w cenie 34 USD za 1 milion znaków. To ten sam wzorzec, co w przypadku kilku innych otwartych wydań z 2026 roku — można je przeglądać i hostować samodzielnie w celach badawczych, ale zastosowania przynoszące dochód są zarezerwowane dla własnego endpointu dostawcy.
Dlaczego router ma znaczenie dla tak młodego modelu
Szczere ryzyko związane z Breeze TTS 2 w tej chwili to nie jakość — to wiek. Model jest dostępny od dziesięciu dni, a wagi od dwóch dni. Żaden zespół produkcyjny nie powinien stawiać pipeline'u głosowego na tak młodym modelu bez możliwości zejścia z niego — i właśnie ten scenariusz awarii ma przejmować warstwa routingu. Jeśli oceniasz Breeze TTS 2 przez bramę, która traktuje endpoint dostawcy jako jedną z wielu tras, dostajesz dzisiejszego lidera Elo, automatyczne przełączenie awaryjne na dostawcę zapasowego, gdy API jest zdegradowane, oraz jednowierszową zmianę, jeśli tygodniowy model wykaże regresję. To ta sama dyscyplina, którą DSL routingu stosuje do każdego modelu: zestawiaj go z alternatywami, utrzymuj stabilny interfejs i pozwól modelowi się sprawdzić, zanim pozwolisz, by stał się elementem nośnym. Żaden z modeli w tej serii nie jest jeszcze routowany przez samego OrcaRouter, więc szczera rada jest taka: podłącz Breeze TTS 2 do bramy, którą już obsługujesz — i utrzymuj obecnego dostawcę w stanie aktywnym równolegle, dopóki Elo nie stanie się starsze i bardziej godne zaufania.
Co obejrzeć dalej
Dzisiejszą historią jest slot #1 open-weights w Provider Voices, ale to słabsza z dwóch aren dla tego modelu. Na arenie Controlled Voice serwisu Artificial Analysis, gdzie wszystkie modele porównywane są na tych samych ustalonych głosach referencyjnych, Breeze TTS 2 zajmuje #3 wśród modeli open-weights z wynikiem 1,002 Elo, za Voxtral od Mistral (1,010) — oraz #16 w ogólnej klasyfikacji na 39 modeli. Ta rozbieżność między wynikiem dla głosów dostawcy (1,215, #1 open) a wynikiem dla głosów kontrolowanych (1,002, #3 open) jest warta uwagi: sugeruje, że przewaga Breeze TTS 2 koncentruje się w głosach, które sam projektuje — i to jest dokładnie twierdzenie produktu, a zarazem twierdzenie, na które niezależny benchmark powinien wywierać ciągłą presję. Obserwujmy, czy Elo dla głosów kontrolowanych zbliży się do wyniku dla głosów dostawcy, czy licencja komercyjna się zaostrzy lub złagodnieje, a przede wszystkim — czy ktokolwiek odtworzy benchmarki projektowania głosu i kierowania głosem poza własnym zestawem BreezeBlue.
Model, który nie istniał miesiąc temu, Breeze TTS 2, zdobył już najbardziej użyteczną rzecz, jaką może zdobyć model zamiany tekstu na mowę: niezależną ocenę, która potwierdza marketing. To, czy stanie się domyślnym głosem w produktach interaktywnych, zależy mniej od kolejnej aktualizacji Elo, a bardziej od tego, jak potoczy się historia licencji i samodzielnego hostingu — ale od tego tygodnia synteza mowy z otwartymi wagami ma nowego lidera — i to dwutygodniowego.

