Wygenerowana karta hero dla „Gemini 3.8 TTS vs Qwen Audio 3.0 TTS" na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi. Lewa karta „Qwen-Audio-3.0-TTS-Plus" zawiera: Elo 1259, 15 głosów aren, 16 języków + 20 dialektów oraz 27,6 USD za 1 mln znaków; prawa karta „Gemini 3.8 Flash TTS" zawiera: Elo 1260, 8 głosów aren, 130 języków i 33,0 USD za 1 mln znaków. W stopce widnieje wiersz: „Elo według Artificial Analysis Provider Voice Arena, wrzesień 2026". Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Engineering & Research

Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: Dwie różne odpowiedzi na „Spraw, aby brzmiało właściwie”

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeden punkt Elo dzieli te dwa modele na Artificial Analysis Provider Voice Arena, a osiągają to, rozwiązując zupełnie różne problemy. Qwen-Audio-3.0-TTS-Plus zajmuje 3. miejsce z wynikiem Elo 1 259 na podstawie 1 447 próbek i 15 głosów areny, wydany we wrześniu 2026 r. i wyceniony na 27,60 USD za milion znaków. Gemini 3.8 Flash TTS zajmuje 2. miejsce z wynikiem 1 260 na podstawie 1 999 próbek i 8 głosów areny, wydany 23 września 2026 r. i wyceniony na 33,00 USD za milion znaków. Statystycznie nieodróżnialne, o dwadzieścia procent różniące się ceną i oparte na przeciwstawnych teoriach tego, co czyni mowę syntetyczną dobrą.

Teoria jest ciekawą częścią. Odpowiedzią Qwena jest sterowanie w tekście: 86 tagów realizacji, które rozsypujesz w tekście, żeby model wiedział, gdzie oddychać, gdzie akcentować i kiedy zmienić rejestr. Odpowiedzią Google'a jest warstwa reżyserska: instrukcje linia po linii, inscenizacja dla dwóch mówców i niewielki zestaw sygnałów niewerbalnych. Jeśli masz już zbudowany pipeline, który emituje adnotacje w stylu SSML, jedno z tych podejść będzie pasować, a drugie nie, a ta zgodność liczy się bardziej niż pojedynczy punkt Elo.

Gdzie ta dwójka faktycznie siedzi na planszy

Uczciwe czytanie Provider Voice Arena wymaga patrzenia na przedziały, a nie na rangi.

• Qwen-Audio-3.0-TTS-Plus — 3. miejsce, Elo 1,259, 1 447 próbek, 15 głosów areny, wrzesień 2026, 27,6 USD za 1 mln znaków.

• Gemini 3.8 Flash TTS — 2. miejsce, Elo 1260, 1999 próbek, 8 głosów Arena, wrzesień 2026, 33,0 USD za 1 mln znaków.

• Cartesia Sonic 3.6 — 1. miejsce, Elo 1 273, 1 757 próbek, 8 głosów w arenie, sierpień 2026, 49,0 USD za 1 mln znaków.

Trzy najlepsze pozycje tworzą jedną grupę. Publikowane przedziały dla dwóch najwyżej sklasyfikowanych sięgają siedemnastu punktów w każdą stronę, co jest szersze niż cały rozstęp między pierwszym a trzecim miejscem, więc kolejność wśród nich nie stanowi stabilnego dowodu. To, co jednak ustala zestawienie, to że wszystkie trzy znajdują się w czołówce i że nic poniżej nich nie jest blisko — miejsce 10, Gemini 3.1 Flash TTS, ma 1,199.

Jedyna asymetria warta odnotowania to liczba głosów w arenie. Qwen wystawia 15 głosów wobec 8 w przypadku Gemini, więc wynik Qwen jest średnią z szerszej próby własnego produktu dostawcy. To działa w obie strony: jest to sprawiedliwsze oszacowanie tego, jak ogólnie brzmi katalog Qwen, a jednocześnie daje Qwen więcej okazji, by wystawić słaby głos, który zaniża średnią. Żadna z tych interpretacji nie zmienia wniosku, że oba są na równi.

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 tagów dostawy względem warstwy kierunku

To jest zasadnicza różnica i to ona decyduje o większości integracji.

Qwen-Audio-3.0-TTS jest dostarczany z 86 wbudowanymi znacznikami sposobu wypowiedzi — adnotacjami osadzonymi w tekście, które kontrolują sposób wypowiedzenia danego fragmentu. To podejście oparte na znacznikach: wykonanie jest zawarte w skrypcie. Jest to znajome każdemu, kto pracował z SSML, i dobrze komponuje się z narzędziami, które programowo generują tekst, ponieważ warstwą sterowania jest transformacja ciągu znaków, a nie wywołanie API.

Gemini 3.8 Flash TTS obiera inną drogę. Linię reżyserujesz tak, jak reżyserowałbyś aktora — tempo, nacisk, rejestr emocjonalny — jako osobną instrukcję, a nie jako znacznik wbudowany w tekst. Sceny z dwoma mówcami można zainscenizować w ramach jednego wywołania. A niewielki zestaw sygnałów niewerbalnych jest zapisywany w skrypcie: <laughs>, <sigh>, <gasp> jako wskazówki wbudowane w tekst, a także |mhm| oraz |yeah| dla sygnałów podtrzymujących rozmowę.

Więc oba modele akceptują adnotacje w tekście; różnica polega na rozmiarze słownika i tym, gdzie znajduje się reszta kontroli. Qwen ma szerszy i bardziej płaski zestaw — 86 tagów, wszystkie w tekście. Google ma węższy w tekście i szerszy poza nim, z kierunkiem przekazu i ustawieniem mówców jako parametrami na poziomie wywołania. Jeśli przenosisz system, który już emituje bogate znaczniki w tekście, Qwen to krótszy port. Jeśli i tak budujesz logikę kierunku w kodzie aplikacji, podział Google jest czystszy.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Pokrycie języka versus pokrycie dialektu

Liczby pokrycia nie są porównywalne, a naiwne ich porównywanie jest błędem.

Gemini 3.8 Flash TTS obsługuje 130 języków, automatycznie wykrywanych na podstawie tekstu; Flash-Lite TTS obsługuje 101. To szerokość obejmująca różne rodziny językowe, czego potrzebujesz w przebiegu lokalizacji, który musi dotrzeć do długiego ogona rynków.

Qwen-Audio-3.0-TTS obejmuje 16 języków oraz 20 regionów dialektalnych chińskiego. To głębia w obrębie jednej rodziny językowej. Dwadzieścia regionów dialektalnych nie jest mniejszą liczbą niż 130 języków, choć tak to wygląda — to inny rodzaj twierdzenia, a dla produktu obsługującego użytkowników chińskojęzycznych w regionach Chin kontynentalnych jest to twierdzenie bardziej użyteczne. Model z 130 językami i jednym głosem mandaryńskim nie obsługuje użytkownika w Syczuanie tak, jak robi to model z 20 regionami dialektalnymi.

To, co ma znaczenie, zależy wyłącznie od Twojej publiczności. Jeśli Twoim wymaganiem jest „przynajmniej znośnie na dwudziestu rynkach” — Gemini. Jeśli „naprawdę dobrze na rynku chińskim” — Qwen.

Cena, a co kryje stawka za znak

• Qwen-Audio-3.0-TTS-Plus — 27,60 USD za 1 mln znaków według znormalizowanej podstawy w rankingu; wariant Flash to około 15 USD za 1 mln znaków, z deklarowanym opóźnieniem pierwszego pakietu wynoszącym około 300 ms.

• Gemini 3.8 Flash TTS — $33.00 za 1 mln znormalizowanych znaków; rozliczane przez Google po $0.50 za milion tokenów tekstowych na wejściu i $9.00 za milion tokenów audio na wyjściu do 31 grudnia 2026 r., następnie $1.00 i $18.00.

• Gemini 3.8 Flash-Lite TTS — 22,10 USD za 1 mln znormalizowanych znaków na pozycji 6 z Elo 1 235; rozliczane po 6,00 USD za milion tokenów audio do 31 grudnia 2026.

Obie wartości na znak to normalizacje Artificial Analysis, a nie ceny katalogowe dostawców — Qwen rozlicza się przez Alibaba Cloud Model Studio, a Google rozlicza w tokenach, i żaden z nich nie publikuje stawki za znak dla tych modeli. Użyj ich do obliczenia stosunku, który wynosi około 1,2x na korzyść Qwen, a nie jako oferty cenowe.

Struktury poziomów różnią się kształtem. Qwen dzieli się na Plus i Flash, a wariant Flash poświęca jakość na rzecz deklarowanych ~300 ms do pierwszego pakietu. Google dzieli się na Flash i Flash-Lite, a następnie dodatkowo na Standard, Batch i Flex oraz Priority — 4,50 USD, 9,00 USD i 16,20 USD za milion tokenów audio w Flash TTS. Model Google nagradza klasyfikowanie Twojego obciążenia; model Qwen nagradza wybór poziomu jakości z góry.

Dostępność to druga prawdziwa różnica. Gemini 3.8 Flash TTS jest ogólnie dostępny w Gemini Developer API. Qwen-Audio-3.0-TTS jest zamknięty i dostępny wyłącznie jako usługa hostowana, udostępniany przez Alibaba Cloud Model Studio, bez otwartych wag. Jeśli potrzebujesz uruchomić model samodzielnie, żaden z tych dwóch nie jest dla ciebie — ale jeśli twoja infrastruktura już znajduje się w Alibaba Cloud, model Qwen jest tym, w przypadku którego nie ma żadnej kwestii egressu do rozwiązania.

Twierdzenia dostawców po obu stronach

Żaden z modeli nie ma niezależnego benchmarku poza areną, a obaj dostawcy opublikowali twierdzenia, które należy oznaczyć jako takie.

Google'a, dla Gemini 3.8 Flash TTS: pierwsze miejsce w Hume AI Voice Design Benchmark z wynikiem 71,4, pierwsze miejsce w modelowaniu akcentu z 60,8, pierwsze i drugie miejsce w Hume Overall Quality Index dla Flash i Flash-Lite oraz czołowe miejsca w testach ślepej preferencji deklarowane dla języka japońskiego, brazylijskiego portugalskiego, wietnamskiego, współczesnego standardowego arabskiego, meksykańskiego hiszpańskiego i hindi. Przeprowadzone testy nie są publiczne.

Alibaby, dla Qwen-Audio-3.0-TTS: system dostarczania 86 tagów, 20 regionów dialektowych i wynik ~300 ms dla pierwszego pakietu w wariancie Flash. Także nieodtworzone.

Elo areny to jedyna niezależnie zebrana liczba dotycząca jakości w tym artykule i wskazuje, że oba znajdują się ex aequo na szczycie rankingu.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Co dodaje Gemini, czego nie ma Qwen

Tworzenie głosu to najbardziej widoczna luka. Gemini 3.8 Flash TTS obsługuje projektowanie głosu na podstawie opisu w języku naturalnym oraz replikację głosu z 30-sekundowej próbki, z weryfikacją zgody i znakiem wodnym SynthID oraz poświadczeniami C2PA na wyniku. Niestandardowe głosy występują w dwóch formach: 200 głosów stanowych na projekt z rocznym czasem życia albo głosy bezstanowe adresowane przez identyfikator voicekey_..., które wygasają po siedmiu dniach. Remiksowanie głosu jest wymienione jako funkcja dostępna wkrótce.

Kontrola formatu wyjściowego jest druga. WAV 24 kHz mono 16-bitowy PCM ze znakiem na unarnym punkcie końcowym, PCM bez nagłówka (audio/l16) na strumieniowym punkcie końcowym, a także audio/mulaw i audio/alaw oraz konfigurowalna częstotliwość próbkowania. W zadaniach związanych z telefonią obsługa mulaw eliminuje krok transkodowania.

Do kogo zadzwonić?

Wybierz Qwen-Audio-3.0-TTS, jeśli Twoi użytkownicy mówią po chińsku i wymagane jest pokrycie dialektów, jeśli chcesz mieć bogaty zestaw znaczników śródwierszowych, które Twój generator może tworzyć bezpośrednio, albo jeśli już korzystasz z Alibaba Cloud i chcesz najkrótszą ścieżkę do działającego punktu końcowego. Jest też tańsza z tych dwóch w ujęciu znormalizowanym, a wariant Flash jest jeszcze tańszy, jeśli akceptowalne jest ~300 ms do pierwszego pakietu.

Wybierz Gemini 3.8 Flash TTS, jeśli potrzebujesz szerokiego zakresu wielu języków, a nie głębi w jednym, jeśli potrzebujesz utworzyć lub odtworzyć konkretny głos, jeśli potrzebujesz danych wyjściowych w formacie mulaw lub alaw albo jeśli „ogólnie dostępny, a nie tylko hostowany” jest wymogiem zakupowym.

Żaden z tych wyborów nie jest zły i żaden nie jest wyraźnie lepszy — i na tym właśnie polega istota różnicy jednego punktu Elo. Ta decyzja dotyczy kompatybilności, a nie jakości.

To jest również argument, by na razie nie wiązać się mocno z żadnym z nich. OrcaRouter daje ci ponad 200 modeli za jednym kluczem, w cenie katalogowej dostawcy i bez narzutu, więc zmiana stawek z któregokolwiek laboratorium trafia na twoje rozliczenie jeszcze tego samego dnia, a nie dopiero przy odnowieniu, a automatyczne przełączanie awaryjne sprawia, że punkt końcowy syntezy, który słabnie pod obciążeniem, przechodzi do innego zamiast odrzucać żądanie. Nie hostujemy Qwen-Audio-3.0-TTS — jest on udostępniany przez Alibaba Cloud Model Studio — i nie hostujemy punktów końcowych Gemini 3.8 TTS, które pochodzą z API Google. To, co oferujemy, to warstwa tekstowa i routing nad nią, co pozwala ci uruchomić oba na realnym ruchu przez miesiąc, zanim dokonasz wyboru.

Liczba, na którą warto patrzeć, to następna rewizja areny. Przy 1447 próbkach dla Qwena i 1999 dla Gemini oba przedziały są wciąż wystarczająco szerokie, że jeden miesiąc głosów mógłby je rozdzielić — albo potwierdzić, że remis jest odpowiedzią.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie