
Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: Dwie różne odpowiedzi na „Spraw, aby brzmiało właściwie”
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Jeden punkt Elo dzieli te dwa modele na Artificial Analysis Provider Voice Arena, a osiągają to, rozwiązując zupełnie różne problemy. Qwen-Audio-3.0-TTS-Plus zajmuje 3. miejsce z wynikiem Elo 1 259 na podstawie 1 447 próbek i 15 głosów areny, wydany we wrześniu 2026 r. i wyceniony na 27,60 USD za milion znaków. Gemini 3.8 Flash TTS zajmuje 2. miejsce z wynikiem 1 260 na podstawie 1 999 próbek i 8 głosów areny, wydany 23 września 2026 r. i wyceniony na 33,00 USD za milion znaków. Statystycznie nieodróżnialne, o dwadzieścia procent różniące się ceną i oparte na przeciwstawnych teoriach tego, co czyni mowę syntetyczną dobrą.
Teoria jest ciekawą częścią. Odpowiedzią Qwena jest sterowanie w tekście: 86 tagów realizacji, które rozsypujesz w tekście, żeby model wiedział, gdzie oddychać, gdzie akcentować i kiedy zmienić rejestr. Odpowiedzią Google'a jest warstwa reżyserska: instrukcje linia po linii, inscenizacja dla dwóch mówców i niewielki zestaw sygnałów niewerbalnych. Jeśli masz już zbudowany pipeline, który emituje adnotacje w stylu SSML, jedno z tych podejść będzie pasować, a drugie nie, a ta zgodność liczy się bardziej niż pojedynczy punkt Elo.
Gdzie ta dwójka faktycznie siedzi na planszy
Uczciwe czytanie Provider Voice Arena wymaga patrzenia na przedziały, a nie na rangi.
• Qwen-Audio-3.0-TTS-Plus — 3. miejsce, Elo 1,259, 1 447 próbek, 15 głosów areny, wrzesień 2026, 27,6 USD za 1 mln znaków.
• Gemini 3.8 Flash TTS — 2. miejsce, Elo 1260, 1999 próbek, 8 głosów Arena, wrzesień 2026, 33,0 USD za 1 mln znaków.
• Cartesia Sonic 3.6 — 1. miejsce, Elo 1 273, 1 757 próbek, 8 głosów w arenie, sierpień 2026, 49,0 USD za 1 mln znaków.
Trzy najlepsze pozycje tworzą jedną grupę. Publikowane przedziały dla dwóch najwyżej sklasyfikowanych sięgają siedemnastu punktów w każdą stronę, co jest szersze niż cały rozstęp między pierwszym a trzecim miejscem, więc kolejność wśród nich nie stanowi stabilnego dowodu. To, co jednak ustala zestawienie, to że wszystkie trzy znajdują się w czołówce i że nic poniżej nich nie jest blisko — miejsce 10, Gemini 3.1 Flash TTS, ma 1,199.
Jedyna asymetria warta odnotowania to liczba głosów w arenie. Qwen wystawia 15 głosów wobec 8 w przypadku Gemini, więc wynik Qwen jest średnią z szerszej próby własnego produktu dostawcy. To działa w obie strony: jest to sprawiedliwsze oszacowanie tego, jak ogólnie brzmi katalog Qwen, a jednocześnie daje Qwen więcej okazji, by wystawić słaby głos, który zaniża średnią. Żadna z tych interpretacji nie zmienia wniosku, że oba są na równi.

86 tagów dostawy względem warstwy kierunku
To jest zasadnicza różnica i to ona decyduje o większości integracji.
Qwen-Audio-3.0-TTS jest dostarczany z 86 wbudowanymi znacznikami sposobu wypowiedzi — adnotacjami osadzonymi w tekście, które kontrolują sposób wypowiedzenia danego fragmentu. To podejście oparte na znacznikach: wykonanie jest zawarte w skrypcie. Jest to znajome każdemu, kto pracował z SSML, i dobrze komponuje się z narzędziami, które programowo generują tekst, ponieważ warstwą sterowania jest transformacja ciągu znaków, a nie wywołanie API.
Gemini 3.8 Flash TTS obiera inną drogę. Linię reżyserujesz tak, jak reżyserowałbyś aktora — tempo, nacisk, rejestr emocjonalny — jako osobną instrukcję, a nie jako znacznik wbudowany w tekst. Sceny z dwoma mówcami można zainscenizować w ramach jednego wywołania. A niewielki zestaw sygnałów niewerbalnych jest zapisywany w skrypcie: <laughs>, <sigh>, <gasp> jako wskazówki wbudowane w tekst, a także |mhm| oraz |yeah| dla sygnałów podtrzymujących rozmowę.
Więc oba modele akceptują adnotacje w tekście; różnica polega na rozmiarze słownika i tym, gdzie znajduje się reszta kontroli. Qwen ma szerszy i bardziej płaski zestaw — 86 tagów, wszystkie w tekście. Google ma węższy w tekście i szerszy poza nim, z kierunkiem przekazu i ustawieniem mówców jako parametrami na poziomie wywołania. Jeśli przenosisz system, który już emituje bogate znaczniki w tekście, Qwen to krótszy port. Jeśli i tak budujesz logikę kierunku w kodzie aplikacji, podział Google jest czystszy.

Pokrycie języka versus pokrycie dialektu
Liczby pokrycia nie są porównywalne, a naiwne ich porównywanie jest błędem.
Gemini 3.8 Flash TTS obsługuje 130 języków, automatycznie wykrywanych na podstawie tekstu; Flash-Lite TTS obsługuje 101. To szerokość obejmująca różne rodziny językowe, czego potrzebujesz w przebiegu lokalizacji, który musi dotrzeć do długiego ogona rynków.
Qwen-Audio-3.0-TTS obejmuje 16 języków oraz 20 regionów dialektalnych chińskiego. To głębia w obrębie jednej rodziny językowej. Dwadzieścia regionów dialektalnych nie jest mniejszą liczbą niż 130 języków, choć tak to wygląda — to inny rodzaj twierdzenia, a dla produktu obsługującego użytkowników chińskojęzycznych w regionach Chin kontynentalnych jest to twierdzenie bardziej użyteczne. Model z 130 językami i jednym głosem mandaryńskim nie obsługuje użytkownika w Syczuanie tak, jak robi to model z 20 regionami dialektalnymi.
To, co ma znaczenie, zależy wyłącznie od Twojej publiczności. Jeśli Twoim wymaganiem jest „przynajmniej znośnie na dwudziestu rynkach” — Gemini. Jeśli „naprawdę dobrze na rynku chińskim” — Qwen.
Cena, a co kryje stawka za znak
• Qwen-Audio-3.0-TTS-Plus — 27,60 USD za 1 mln znaków według znormalizowanej podstawy w rankingu; wariant Flash to około 15 USD za 1 mln znaków, z deklarowanym opóźnieniem pierwszego pakietu wynoszącym około 300 ms.
• Gemini 3.8 Flash TTS — $33.00 za 1 mln znormalizowanych znaków; rozliczane przez Google po $0.50 za milion tokenów tekstowych na wejściu i $9.00 za milion tokenów audio na wyjściu do 31 grudnia 2026 r., następnie $1.00 i $18.00.
• Gemini 3.8 Flash-Lite TTS — 22,10 USD za 1 mln znormalizowanych znaków na pozycji 6 z Elo 1 235; rozliczane po 6,00 USD za milion tokenów audio do 31 grudnia 2026.
Obie wartości na znak to normalizacje Artificial Analysis, a nie ceny katalogowe dostawców — Qwen rozlicza się przez Alibaba Cloud Model Studio, a Google rozlicza w tokenach, i żaden z nich nie publikuje stawki za znak dla tych modeli. Użyj ich do obliczenia stosunku, który wynosi około 1,2x na korzyść Qwen, a nie jako oferty cenowe.
Struktury poziomów różnią się kształtem. Qwen dzieli się na Plus i Flash, a wariant Flash poświęca jakość na rzecz deklarowanych ~300 ms do pierwszego pakietu. Google dzieli się na Flash i Flash-Lite, a następnie dodatkowo na Standard, Batch i Flex oraz Priority — 4,50 USD, 9,00 USD i 16,20 USD za milion tokenów audio w Flash TTS. Model Google nagradza klasyfikowanie Twojego obciążenia; model Qwen nagradza wybór poziomu jakości z góry.
Dostępność to druga prawdziwa różnica. Gemini 3.8 Flash TTS jest ogólnie dostępny w Gemini Developer API. Qwen-Audio-3.0-TTS jest zamknięty i dostępny wyłącznie jako usługa hostowana, udostępniany przez Alibaba Cloud Model Studio, bez otwartych wag. Jeśli potrzebujesz uruchomić model samodzielnie, żaden z tych dwóch nie jest dla ciebie — ale jeśli twoja infrastruktura już znajduje się w Alibaba Cloud, model Qwen jest tym, w przypadku którego nie ma żadnej kwestii egressu do rozwiązania.
Twierdzenia dostawców po obu stronach
Żaden z modeli nie ma niezależnego benchmarku poza areną, a obaj dostawcy opublikowali twierdzenia, które należy oznaczyć jako takie.
Google'a, dla Gemini 3.8 Flash TTS: pierwsze miejsce w Hume AI Voice Design Benchmark z wynikiem 71,4, pierwsze miejsce w modelowaniu akcentu z 60,8, pierwsze i drugie miejsce w Hume Overall Quality Index dla Flash i Flash-Lite oraz czołowe miejsca w testach ślepej preferencji deklarowane dla języka japońskiego, brazylijskiego portugalskiego, wietnamskiego, współczesnego standardowego arabskiego, meksykańskiego hiszpańskiego i hindi. Przeprowadzone testy nie są publiczne.
Alibaby, dla Qwen-Audio-3.0-TTS: system dostarczania 86 tagów, 20 regionów dialektowych i wynik ~300 ms dla pierwszego pakietu w wariancie Flash. Także nieodtworzone.
Elo areny to jedyna niezależnie zebrana liczba dotycząca jakości w tym artykule i wskazuje, że oba znajdują się ex aequo na szczycie rankingu.

Co dodaje Gemini, czego nie ma Qwen
Tworzenie głosu to najbardziej widoczna luka. Gemini 3.8 Flash TTS obsługuje projektowanie głosu na podstawie opisu w języku naturalnym oraz replikację głosu z 30-sekundowej próbki, z weryfikacją zgody i znakiem wodnym SynthID oraz poświadczeniami C2PA na wyniku. Niestandardowe głosy występują w dwóch formach: 200 głosów stanowych na projekt z rocznym czasem życia albo głosy bezstanowe adresowane przez identyfikator voicekey_..., które wygasają po siedmiu dniach. Remiksowanie głosu jest wymienione jako funkcja dostępna wkrótce.
Kontrola formatu wyjściowego jest druga. WAV 24 kHz mono 16-bitowy PCM ze znakiem na unarnym punkcie końcowym, PCM bez nagłówka (audio/l16) na strumieniowym punkcie końcowym, a także audio/mulaw i audio/alaw oraz konfigurowalna częstotliwość próbkowania. W zadaniach związanych z telefonią obsługa mulaw eliminuje krok transkodowania.
Do kogo zadzwonić?
Wybierz Qwen-Audio-3.0-TTS, jeśli Twoi użytkownicy mówią po chińsku i wymagane jest pokrycie dialektów, jeśli chcesz mieć bogaty zestaw znaczników śródwierszowych, które Twój generator może tworzyć bezpośrednio, albo jeśli już korzystasz z Alibaba Cloud i chcesz najkrótszą ścieżkę do działającego punktu końcowego. Jest też tańsza z tych dwóch w ujęciu znormalizowanym, a wariant Flash jest jeszcze tańszy, jeśli akceptowalne jest ~300 ms do pierwszego pakietu.
Wybierz Gemini 3.8 Flash TTS, jeśli potrzebujesz szerokiego zakresu wielu języków, a nie głębi w jednym, jeśli potrzebujesz utworzyć lub odtworzyć konkretny głos, jeśli potrzebujesz danych wyjściowych w formacie mulaw lub alaw albo jeśli „ogólnie dostępny, a nie tylko hostowany” jest wymogiem zakupowym.
Żaden z tych wyborów nie jest zły i żaden nie jest wyraźnie lepszy — i na tym właśnie polega istota różnicy jednego punktu Elo. Ta decyzja dotyczy kompatybilności, a nie jakości.
To jest również argument, by na razie nie wiązać się mocno z żadnym z nich. OrcaRouter daje ci ponad 200 modeli za jednym kluczem, w cenie katalogowej dostawcy i bez narzutu, więc zmiana stawek z któregokolwiek laboratorium trafia na twoje rozliczenie jeszcze tego samego dnia, a nie dopiero przy odnowieniu, a automatyczne przełączanie awaryjne sprawia, że punkt końcowy syntezy, który słabnie pod obciążeniem, przechodzi do innego zamiast odrzucać żądanie. Nie hostujemy Qwen-Audio-3.0-TTS — jest on udostępniany przez Alibaba Cloud Model Studio — i nie hostujemy punktów końcowych Gemini 3.8 TTS, które pochodzą z API Google. To, co oferujemy, to warstwa tekstowa i routing nad nią, co pozwala ci uruchomić oba na realnym ruchu przez miesiąc, zanim dokonasz wyboru.
Liczba, na którą warto patrzeć, to następna rewizja areny. Przy 1447 próbkach dla Qwena i 1999 dla Gemini oba przedziały są wciąż wystarczająco szerokie, że jeden miesiąc głosów mógłby je rozdzielić — albo potwierdzić, że remis jest odpowiedzią.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
