Wygenerowana karta hero dla „Gemini 3.8 Live vs Qwen-Audio-3.1-TTS" na białym tle z delikatnymi akcentami gradientu w odcieniach błękitu i cyjanu. Dwa panele znajdują się pod nagłówkiem o treści „Dwie połowy, odświeżone w odstępie ośmiu dni". Lewy panel obejmuje „15 września 2026 — Gemini 3.8 Live i Extended Thinking w Live API". Prawy panel obejmuje „23 września 2026 — Qwen-Audio-3.1-TTS w Apsara, synteza skrócona o ~70%". Wiersz stopki głosi: „Spotykają się w środku potoku, a nie przy tym samym zadaniu". Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

Gemini 3.8 Live kontra Qwen-Audio-3.1-TTS: dwie połowy stosu głosowego, ponownie wycenione w odstępie ośmiu dni

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Gemini 3.8 Live to model Google'a konwertujący mowę na mowę, wydany 15 września 2026 r. jako gemini-3.8-live i gemini-3.8-live-extended-thinking w Live API. Qwen-Audio-3.1-TTS to model Alibaby zamieniający tekst na mowę, ogłoszony na konferencji Apsara w Hangzhou 23 września 2026 r., osiem dni później, wraz z obniżką ceny syntezy mowy o około 70%. Ta ośmiodniowa różnica jest powodem, dla którego warto przeczytać to porównanie teraz, a nie w lipcu. Jeśli chodzi o role obu produktów, nic się nie zmieniło — jeden słucha i mówi, drugi czyta tekst na głos — ale obie połowy produkcyjnego pipeline'u głosowego zostały przebudowane lub wycenione na nowo w ciągu jednego dwutygodniowego okresu, a arytmetyka, która dotąd rozstrzygała to starcie, po cichu się przesunęła.

Dwie połowy, odświeżane w odstępie ośmiu dni

Zacznij od tego, co sprawia, że ten duet jest nietypowy: te dwa modele nie konkurują ze sobą. Produkt głosowy ma usta i ma ucho, a każdy z tych modeli pełni jedną z tych ról. Gemini 3.8 Live zamyka pętlę — dźwięk i obraz na wejściu, dźwięk na wyjściu, obsługa przerwań, wywołania narzędzi działające pod spodem rozmowy. Qwen-Audio-3.1-TTS przyjmuje ciąg znaków i głos referencyjny, a zwraca wykonanie. Jest przede wszystkim ustami — lepszymi niż cokolwiek innego — i nie próbuje być uchem.

To, co sprawia, że wrześniowy moment jest interesujący, to fakt, że oba ogłoszenia dotyczą przeciwnych końców tej samej pozycji budżetowej. Wrześniowa premiera Google’a z 15 września była historią o możliwościach, bez żadnej zmiany ceny; ogłoszenie Alibaby z 23 września było w większości historią o marży, a nowe możliwości towarzyszyły jej tylko przy okazji. Zespół, który w sierpniu zbudował hybrydowy potok, w ciągu ośmiu dni otrzymał powód, by ponownie przeanalizować obie części — i tylko jedna z tych części potaniała.

Co faktycznie zmieniło wydanie 3.1 po stronie Qwen

Aliba​ba nie wypuścił 23 września tylko jednego modelu. Generacja 3.1 obejmuje pięć endpointów — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next i Qwen-Audio-3.1-Realtime — a tylko jeden z nich, podstawowy poziom TTS, jest bezpośrednim zamiennikiem dla każdego, kto już wywołuje model TTS 3.0.

Na tym poziomie zmieniły się trzy rzeczy, a jedna z nich to prawdziwy koszt migracji. Kontrola sposobu mówienia przeniosła się ze stałego słownika 86 znaczników wbudowanych na instrukcje w języku naturalnym: opisujesz emocję, tempo i styl, których chcesz, zamiast wstawiać właściwy nawias we właściwym miejscu. Pojawił się transfer barwy głosu między językami, pozwalający jednemu głosowi referencyjnemu zachować swoją tożsamość w języku mandaryńskim, kantońskim, angielskim i japońskim. A model toleruje teraz bezpośrednio zaszumione lub z pogłosem audio referencyjne, bez osobnego etapu odszumiania. Zakres językowy jest niezmieniony i wynosi, według dostawcy, 16 języków plus 20 regionów dialektów chińskich, a — warto to zaznaczyć, bo gdzie indziej jest to wygładzane — materiały samego Alibaby mówią, że poziom 3.1 dodaje siedem języków, co nie zgadza się z 16 wymienionymi w opublikowanym zakresie generacji z lipca. Traktuj oba te liczby jako deklarowane przez dostawcę, dopóki nie sprawdzisz konkretnych języków, których potrzebujesz, w Model Studio.

Prawdziwie nowym produktem w tym wydaniu jest Qwen-Audio-3.1-TTS-Next, który Alibaba nazywa modelem „Audiogen”: jedno przejście generuje razem głos, efekty dźwiękowe i dźwięki tła, do dialogów z wieloma mówcami, montażu podcastów i pracy nad scenami. Jego cena katalogowa to 0,848 USD za milion tokenów wejściowych i 1,696 USD za milion tokenów wyjściowych w węźle pekińskim, z limitem 3000 znaków danych wejściowych, 240 sekund generowanego dźwięku w przypadku podcastów i 120 sekund w pozostałych przypadkach, trzech żądań na sekundę i możliwością przyjęcia maksymalnie trzech klipów referencyjnych po 30 sekund każdy. Obsługuje wyłącznie chiński i angielski. Jeśli twój potok przetwarzania obejmuje tylko jednego narratora czytającego scenariusz, ten produkt jest dla ciebie nieistotny; jeśli obejmuje dwóch prowadzących i podkład muzyczny, to właśnie powód, by w ogóle przyjrzeć się temu wydaniu.

Szew jest tym, co tak naprawdę wybierasz

Ponieważ te dwa modele nie wykonują tej samej pracy, decyzja nie jest testem porównawczym. To pytanie o to, gdzie umieścisz przekazanie, i ile jesteś gotów zapłacić, aby szew był niewidoczny.

Istnieją dwie uczciwe architektury. Pierwsza to jedna sieć: Gemini 3.8 Live obsługuje całą turę, słyszy dzwoniącego, decyduje, co powiedzieć, i mówi to, a ty akceptujesz głos, który ci daje — nie możesz go sklonować ani oznaczyć własną marką. Druga to kaskada: rozpoznawanie, potem rozumowanie, potem Qwen-Audio-3.1-TTS jako usta, dając ci tysiąc głosów, w tym jeden nagrany przez twojego własnego lektora, za cenę opóźnienia na dwóch lub trzech granicach dostawców oraz prozodii, która ginie, gdy zdanie zostaje rozdzielone między wywołania API.

Większość zespołów kończy z oboma i nie jest to bynajmniej dowodem braku odwagi. Model czasu rzeczywistego stosuj tam, gdzie odczuwa się opóźnienie — przerywanie, potwierdzenie, owo „mm-hm”, które mówi dzwoniącemu, że wciąż jesteś na linii — a model syntezy tam, gdzie słychać jakość: długie odczytywanie polisy, numer potwierdzenia czytany w wyważonym tempie, głos marki, który musi być identyczny w każdym pojedynczym połączeniu. Hybryda to właściwa odpowiedź dla dużej klasy produktów. To także miejsce, w którym model kosztów zaczyna się komplikować, bo rozliczasz teraz dwie różne jednostki.

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

Cena za godzinę audio, która jest jedyną jednostką, do której pasują oba.

Google rozlicza Live API za minutę; Alibaba rozlicza poziomy Qwen TTS za znak i za token. Aby je porównać, trzeba wybrać normalizator, a jedynym możliwym do obrony w przypadku głosu jest godzina gotowego audio.

• Rozliczanie na wejściu — Gemini 3.8 Live za minutę dźwięku, 0,005 USD na wejściu i 0,018 USD na wyjściu vs Qwen-Audio-3.1-TTS za milion znaków, przy czym poziom 3.0 Plus zbliża się do 27,60 USD, a poziom Flash do 15 USD przed obniżką, natomiast poziom TTS Flash po niej jest wyceniany na 1,5 juana za milion tokenów wejściowych i 12 juanów za milion tokenów wyjściowych
• Rozliczanie na wyjściu — Gemini 3.8 Live dwukierunkowa rozmowa kosztuje około 1,38 USD za godzinę rozmowy w czasie rzeczywistym według cennika, przed jakimkolwiek buforowaniem, vs Qwen-Audio-3.1-TTS strumień jednokierunkowy, przy czym poziom 3.1-Next wynosi 0,848 USD za milion tokenów wejściowych i 1,696 USD za milion tokenów wyjściowych w węźle pekińskim
• Słyszy rozmówcę — Gemini 3.8 Live tak, natywne wejście audio i wideo vs Qwen-Audio-3.1-TTS nie, tekst na wejściu i dźwięk na wyjściu
• Głosy — Gemini 3.8 Live jeden głos, nieklonowalny, nieprzypisywalny do marki vs Qwen-Audio-3.1-TTS ponad tysiąc, z klonowaniem zero-shot na podstawie zaszumionego dźwięku referencyjnego
• Języki — Gemini 3.8 Live 97 według producenta, zmieniane w trakcie rozmowy vs Qwen-Audio-3.1-TTS 16 według producenta plus 20 regionów dialektów chińskich, z przenoszeniem barwy głosu między mandaryńskim, kantońskim, angielskim i japońskim
• Kontrola sposobu mówienia — Gemini 3.8 Live prompt i kontekst rozmowy vs Qwen-Audio-3.1-TTS instrukcja w języku naturalnym, zastępująca 86 znaczników wbudowanych z generacji 3.0
• Niezależny wynik — Gemini 3.8 Live 82,6 w Artificial Analysis Speech to Speech Index dla wariantu Extended Thinking i 76,0 dla wariantu standardowego vs Qwen-Audio-3.1-TTS brak; najbliższa liczba dla Qwen to 1259 Elo dla poprzedniej generacji poziomu 3.0 Plus w Provider Voice Arena, co jest oceną poprzednika, a nie tego modelu

Obniżka procentowa jest podawana względem stawek, które różnią się w zależności od regionu i poziomu, więc 70% z nagłówka nie jest obietnicą dotyczącą Twojego ruchu, a Alibaba Cloud dodatkowo przestawił transkrypcję w czasie rzeczywistym w węźle singapurskim z rozliczania opartego na czasie trwania na rozliczanie oparte na tokenach — co jest mniej przewidywalną podstawą, ponieważ zarówno cisza, jak i kontekst wielu tur rozmowy zawyżają zużycie tokenów. Zestaw nowy cennik z własnym materiałem audio.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

Czego nie rozstrzyga aktualizacja do wersji 3.1

Oto część, w której łatwo się pomylić w obie strony. Ulepszenia w wersji 3.1 nie czynią z Qwen-Audio-3.1-TTS kandydata do zadania, które wykonuje Gemini 3.8 Live — sterowanie na podstawie instrukcji, transfer barwy głosu i tolerancja zaszumionego wejścia czynią z niego lepsze usta, a żadna z nich nie daje mu ucha. Podobnie pozycja Gemini 3.8 Live w benchmarkach nie mówi nic o tym, czy twój markowy głos przetrwa zdanie po kantońsku.

W dowodach jest też luka, którą obniżka ceny czyni tym bardziej kuszącą do zignorowania. Qwen-Audio-3.1-TTS nie ma niezależnego wyniku. Wynik 1 259 Elo, który pojawia się obok nazwy Qwen na Provider Voice Arena, należy do Qwen-Audio-3.0-TTS-Plus — modelu, który jest zastępowany — zmierzonego na 1 447 próbkach. Własny wiersz następcy w Arena jeszcze nie istnieje. Jeśli Twój proces zatwierdzania wymaga wyniku od strony trzeciej — a w przypadku głosu marki prawdopodobnie powinien — nowszy model jest tym, który go nie ma, a tańsza warstwa jest tą, której jeszcze nie możesz obronić. Jedynym wydarzeniem, które by to rozstrzygnęło, jest pojawienie się Qwen-Audio-3.1-TTS na tablicy odsłuchów w ciemno.

Gdzie jeden klucz pomaga, a gdzie nie

Jedną z konsekwencji wydania 3.1 łatwo przeoczyć, ponieważ wygląda bardziej na szczegół inżynierii podpowiedzi niż infrastruktury. Zastąpienie 86 zakodowanych na sztywno instrukcji swobodnymi poleceniami zamienia twoje wytyczne dotyczące dostarczania w artefakty tekstowe. Teraz generujesz, wersjonujesz i ponownie weryfikujesz każdy z nich względem interpretacji nowego modelu — a trybem awarii jest dryf, nie błąd, ponieważ dwa sformułowania „ciepły, ale nie sentymentalny” nie zadziałają identycznie.

To problem wnioskowania tekstowego opakowany wokół potoku mowy i właśnie tu jesteśmy przydatni. OrcaRouter nie kieruje zapytań do Qwen-Audio-3.1-TTS ani do żadnego modelu Qwen-Audio, a my nie kierujemy zapytań do punktów końcowych Gemini 3.8 Live — żadnej z tych połówek tego stosu nie można wywołać przez nas i nic tutaj nie powinno być odczytywane jako twierdzenie, że tak jest. To, co faktycznie oferujemy, to warstwa, która zapisuje i sprawdza tekst sterujący: qwen/qwen3.8-flash i google/gemini-3.8-flash spośród ponad 200 modeli z jednego klucza w cenie katalogowej dostawcy bez marży, z DSL routingu, który składa kilka modeli w jedno wywołanie i automatyczne przełączanie awaryjne gdy komponent nadrzędny ulegnie degradacji. Gdy masz zamiar ponownie zweryfikować dziesięć tysięcy promptów dostarczania względem modelu, który właśnie zmienił sposób, w jaki je odczytuje, generowanie wariantów i ocenianie ich pod kątem spójności to część, która powinna być jednym kontraktem, a nie czterema.

Co mierzyć przed dokonaniem wyboru

Trzy eksperymenty odpowiadają na więcej pytań niż jakiekolwiek posiedzenie zarządu. Przepuść jeden głos referencyjny i jeden akapit własnego skryptu przez Qwen-Audio-3.1-TTS i posłuchaj, czy sterowanie oparte na instrukcjach daje dwa razy tę samą realizację — to właśnie ryzyko migracji i taniej je zmierzyć, niż planować wokół niego. Przepuść prawdziwe nagranie rozmowy z własnym szumem tła przez Gemini 3.8 Live i sprawdź, czy przechodzenie między mówiącymi się utrzymuje, gdy dzwoniący wchodzi w słowo w połowie wyrazu — to właśnie próbuje skwantyfikować wskaźnik mowy do mowy, a on nie wytrzymuje kontaktu z prawdziwą linią telefoniczną na tyle niezawodnie, by przyjmować go na wiarę. I policz to na własnym wolumenie w godzinach audio, a nie w jednostkach, w których rozliczają się obaj dostawcy, bo w tym konkretnym zestawieniu oczekiwana różnica w cenie między „tanim chińskim TTS” a „flagowym rozwiązaniem Google” nigdy nie była tak duża, jak wygląda, a po 23 września jest jeszcze mniejsza.

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie