Breeze TTS 2 — Nowy lider TTS z otwartymi wagami z wynikiem 1,215 Elo. Ponownie wygenerowana ilustracja.
Guides & Insights

Breeze TTS 2: Nowy lider TTS z otwartymi wagami na poziomie 1 215 Elo

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Breeze TTS 2 jest obecnie najwyżej ocenianym modelem zamiany tekstu na mowę z otwartymi wagami na Artificial Analysis's Provider Voices Speech Arena, z wynikiem 1215 Elo — 90 punktów przewagi nad poprzednim liderem wśród modeli z otwartymi wagami, Fish Audio S2 Pro, i zajmuje 6. miejsce w klasyfikacji ogólnej spośród ponad 100 ocenianych systemów. Ta klasyfikacja jest pierwszą niezależną potwierdzeniem tego, co BreezeBlue twierdzi od czasu zaprezentowania modelu w połowie sierpnia 2026 roku: że dwutygodniowy model głosowy z startupu liczącego około 15 osób może dorównać komercyjnym rozwiązaniom z czołówki zamiany tekstu na mowę. Otwarte wagi trafiły na Hugging Face 25 sierpnia 2026 roku; wynik na arenie pojawił się w ciągu jednego dnia. Czymkolwiek jeszcze okaże się Breeze TTS 2, nie jest już tylko obietnicą producenta — ma Elo, które to potwierdza.

Co tak naprawdę się stało, po kolei

Chronologia ma tu znaczenie, ponieważ wyjaśnia, dlaczego wpis o „rankingu modeli o otwartych wagach” pochodzi od firmy, o której większość ludzi nie słyszała trzy tygodnie temu. BreezeBlue został założony przez Yang Bina, byłego technicznego współzałożyciela jednego z czołowych chińskich laboratoriów AI, dzięki rundzie seed o wartości 6 milionów dolarów, której liderami byli Yuanjing Capital i Redpoint China. Model przeszedł przez trzy widoczne kamienie milowe:

• 7 sierpnia 2026 — BreezeBlue opublikowało na Hugging Face własny zestaw testów porównawczych syntezy mowy do projektowania głosu, reżyserii głosu i oceny opóźnień.

• 16–17 sierpnia 2026 r. — firma oficjalnie ogłosiła Breeze TTS 2 jako flagowy model głosowy czasu rzeczywistego dla mediów interaktywnych i udostępniła API hostowane w cenie 34 USD za 1 mln znaków.

• 25 sierpnia 2026 r. — wagi i kod wnioskowania PyTorch zostały udostępnione jako open-source na Hugging Face jako BreezeBlue/Breeze-TTS-2, model o parametrach 3B, na licencji badawczej i niekomercyjnej.

Ranking Artificial Analysis Provider Voices był dostępny w ciągu kilku dni od wydania otwartych wag. Ponieważ arena ocenia modele w ślepym porównaniu odsłuchowym, wynik 1215 Elo nie jest benchmarkiem, który BreezeBlue uruchomił na samym sobie — to skumulowany osąd słuchaczy porównujących prawdziwe próbki, czego właśnie najbardziej brakuje tak młodemu modelowi.

Tablica wyników

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• Ranking Arena — #6 w klasyfikacji ogólnej Provider Voices; #1 wśród wszystkich modeli z otwartymi wagami, przed Fish Audio S2 Pro (1,125 Elo).

• Elo — 1,215, z 95% przedziałem ufności wynoszącym około ±17 (Artificial Analysis, stan na koniec sierpnia 2026 r.).

• Języki — 50, według BreezeBlue; karta modelu ma tagi angielski i chiński.

• Cena — 34 USD za 1 mln znaków w hostowanym punkcie końcowym BreezeBlue; otwarte wagi można pobrać za darmo, ale są objęte licencją niekomercyjną.

• Prędkość — ~45 znaków na sekundę według pomiarów Artificial Analysis — wolniej niż u kilku rywali, co ma znaczenie przy długich zadaniach.

• Opóźnienie — opóźnienie strumieniowania poniżej 40 ms, według BreezeBlue (deklaracja producenta, nie mierzone niezależnie).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Co właściwie robi inaczej Breeze TTS 2

Elo trafia na nagłówki, ale deklaracja produktowa jest ciekawsza niż wynik. Breeze TTS 2 opiera się na dwóch koncepcjach, które większość modeli zamiany tekstu na mowę traktuje jako coś pobocznego: projektowanie głosu i kierowanie głosem. Projektowanie głosu działa w trybie zero-shot i bez referencji — opisujesz głos w naturalnym języku („ciepły, około czterdziestoletni lektor z lekkim południowym akcentem i suchym dowcipem”), a model generuje taki głos bez nagrania studyjnego czy klipu referencyjnego. Kierowanie głosem rozdziela barwę głosu od intencji przekazu, więc możesz sprawić, by dana kwestia brzmiała sarkastycznie, szeptem lub pospiesznie, bez ryzyka, że model wpadnie w inną postać. BreezeBlue twierdzi, że ta sama tożsamość mówcy przetrwa taką zmianę, a własny benchmark kierowania głosem podaje podobieństwo mówcy na poziomie 0,67 SPK_SIM (dane producenta).

Te dwie możliwości wskazują na docelowy rynek Breeze TTS 2. Materiały prasowe są jednoznaczne: postacie z gier wideo, cyfrowi towarzysze, narracyjne opowiadanie historii, słuchowiska i wirtualni streamerzy — długie, oparte na rolach nagrania z wieloma postaciami, a nie tylko kolejne API do narracji. Firma dostarcza towarzyszącą bibliotekę głosów o nazwie Voice Galaxy, zawierającą ponad 15 000 głosów postaci stworzonych przez społeczność i studio, a demo BreezeBlue to wielopostaciowe fanowskie słuchowisko radiowe trwające ponad dziesięć minut. We własnych opublikowanych testach porównawczych (raportowanych przez producenta, niezweryfikowanych) Breeze TTS 2 twierdzi, że zajmuje pierwsze miejsce w benchmarku Voice Design dla zamiany tekstu na mowę, z wynikiem Role Fit 78.02 wobec 72.78 dla MiMo-V2.5-TTS oraz złożonym wynikiem Voice Direction 4.25.

Gwiazdka licencji

Zanim fraza „open weights" wykona zbyt dużo pracy marketingowej, przeczytaj kartę modelu. Breeze TTS 2 ma 3B parametrów, safetensors, F32/BF16, a kod źródłowy jest na licencji Apache 2.0 — ale wagi, modele pochodne i samodzielnie hostowane wyniki są licencjonowane wyłącznie do celów badawczych i niekomercyjnych, zgodnie z licencją breezeblue-research-and-non-commercial-license. Oznacza to, że „open weights" w tym przypadku nie znaczy „darmowe dla twojego produktu". Komercyjne hostowanie na własnych serwerach nie jest dozwolone zgodnie z treścią licencji; ścieżka komercyjna to hostowane API w cenie 34 USD za 1 milion znaków. To ten sam wzorzec, co w przypadku kilku innych otwartych wydań z 2026 roku — można je przeglądać i hostować samodzielnie w celach badawczych, ale zastosowania przynoszące dochód są zarezerwowane dla własnego endpointu dostawcy.

Dlaczego router ma znaczenie dla tak młodego modelu

Szczere ryzyko związane z Breeze TTS 2 w tej chwili to nie jakość — to wiek. Model jest dostępny od dziesięciu dni, a wagi od dwóch dni. Żaden zespół produkcyjny nie powinien stawiać pipeline'u głosowego na tak młodym modelu bez możliwości zejścia z niego — i właśnie ten scenariusz awarii ma przejmować warstwa routingu. Jeśli oceniasz Breeze TTS 2 przez bramę, która traktuje endpoint dostawcy jako jedną z wielu tras, dostajesz dzisiejszego lidera Elo, automatyczne przełączenie awaryjne na dostawcę zapasowego, gdy API jest zdegradowane, oraz jednowierszową zmianę, jeśli tygodniowy model wykaże regresję. To ta sama dyscyplina, którą DSL routingu stosuje do każdego modelu: zestawiaj go z alternatywami, utrzymuj stabilny interfejs i pozwól modelowi się sprawdzić, zanim pozwolisz, by stał się elementem nośnym. Żaden z modeli w tej serii nie jest jeszcze routowany przez samego OrcaRouter, więc szczera rada jest taka: podłącz Breeze TTS 2 do bramy, którą już obsługujesz — i utrzymuj obecnego dostawcę w stanie aktywnym równolegle, dopóki Elo nie stanie się starsze i bardziej godne zaufania.

Co obejrzeć dalej

Dzisiejszą historią jest slot #1 open-weights w Provider Voices, ale to słabsza z dwóch aren dla tego modelu. Na arenie Controlled Voice serwisu Artificial Analysis, gdzie wszystkie modele porównywane są na tych samych ustalonych głosach referencyjnych, Breeze TTS 2 zajmuje #3 wśród modeli open-weights z wynikiem 1,002 Elo, za Voxtral od Mistral (1,010) — oraz #16 w ogólnej klasyfikacji na 39 modeli. Ta rozbieżność między wynikiem dla głosów dostawcy (1,215, #1 open) a wynikiem dla głosów kontrolowanych (1,002, #3 open) jest warta uwagi: sugeruje, że przewaga Breeze TTS 2 koncentruje się w głosach, które sam projektuje — i to jest dokładnie twierdzenie produktu, a zarazem twierdzenie, na które niezależny benchmark powinien wywierać ciągłą presję. Obserwujmy, czy Elo dla głosów kontrolowanych zbliży się do wyniku dla głosów dostawcy, czy licencja komercyjna się zaostrzy lub złagodnieje, a przede wszystkim — czy ktokolwiek odtworzy benchmarki projektowania głosu i kierowania głosem poza własnym zestawem BreezeBlue.

Model, który nie istniał miesiąc temu, Breeze TTS 2, zdobył już najbardziej użyteczną rzecz, jaką może zdobyć model zamiany tekstu na mowę: niezależną ocenę, która potwierdza marketing. To, czy stanie się domyślnym głosem w produktach interaktywnych, zależy mniej od kolejnej aktualizacji Elo, a bardziej od tego, jak potoczy się historia licencji i samodzielnego hostingu — ale od tego tygodnia synteza mowy z otwartymi wagami ma nowego lidera — i to dwutygodniowego.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.