
Gemini 3.8 Live kontra Qwen-Audio-3.1-TTS: dwie połowy stosu głosowego, ponownie wycenione w odstępie ośmiu dni
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 36 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 181 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Gemini 3.8 Live to model Google'a konwertujący mowę na mowę, wydany 15 września 2026 r. jako gemini-3.8-live i gemini-3.8-live-extended-thinking w Live API. Qwen-Audio-3.1-TTS to model Alibaby zamieniający tekst na mowę, ogłoszony na konferencji Apsara w Hangzhou 23 września 2026 r., osiem dni później, wraz z obniżką ceny syntezy mowy o około 70%. Ta ośmiodniowa różnica jest powodem, dla którego warto przeczytać to porównanie teraz, a nie w lipcu. Jeśli chodzi o role obu produktów, nic się nie zmieniło — jeden słucha i mówi, drugi czyta tekst na głos — ale obie połowy produkcyjnego pipeline'u głosowego zostały przebudowane lub wycenione na nowo w ciągu jednego dwutygodniowego okresu, a arytmetyka, która dotąd rozstrzygała to starcie, po cichu się przesunęła.
Dwie połowy, odświeżane w odstępie ośmiu dni
Zacznij od tego, co sprawia, że ten duet jest nietypowy: te dwa modele nie konkurują ze sobą. Produkt głosowy ma usta i ma ucho, a każdy z tych modeli pełni jedną z tych ról. Gemini 3.8 Live zamyka pętlę — dźwięk i obraz na wejściu, dźwięk na wyjściu, obsługa przerwań, wywołania narzędzi działające pod spodem rozmowy. Qwen-Audio-3.1-TTS przyjmuje ciąg znaków i głos referencyjny, a zwraca wykonanie. Jest przede wszystkim ustami — lepszymi niż cokolwiek innego — i nie próbuje być uchem.
To, co sprawia, że wrześniowy moment jest interesujący, to fakt, że oba ogłoszenia dotyczą przeciwnych końców tej samej pozycji budżetowej. Wrześniowa premiera Google’a z 15 września była historią o możliwościach, bez żadnej zmiany ceny; ogłoszenie Alibaby z 23 września było w większości historią o marży, a nowe możliwości towarzyszyły jej tylko przy okazji. Zespół, który w sierpniu zbudował hybrydowy potok, w ciągu ośmiu dni otrzymał powód, by ponownie przeanalizować obie części — i tylko jedna z tych części potaniała.
Co faktycznie zmieniło wydanie 3.1 po stronie Qwen
Alibaba nie wypuścił 23 września tylko jednego modelu. Generacja 3.1 obejmuje pięć endpointów — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next i Qwen-Audio-3.1-Realtime — a tylko jeden z nich, podstawowy poziom TTS, jest bezpośrednim zamiennikiem dla każdego, kto już wywołuje model TTS 3.0.
Na tym poziomie zmieniły się trzy rzeczy, a jedna z nich to prawdziwy koszt migracji. Kontrola sposobu mówienia przeniosła się ze stałego słownika 86 znaczników wbudowanych na instrukcje w języku naturalnym: opisujesz emocję, tempo i styl, których chcesz, zamiast wstawiać właściwy nawias we właściwym miejscu. Pojawił się transfer barwy głosu między językami, pozwalający jednemu głosowi referencyjnemu zachować swoją tożsamość w języku mandaryńskim, kantońskim, angielskim i japońskim. A model toleruje teraz bezpośrednio zaszumione lub z pogłosem audio referencyjne, bez osobnego etapu odszumiania. Zakres językowy jest niezmieniony i wynosi, według dostawcy, 16 języków plus 20 regionów dialektów chińskich, a — warto to zaznaczyć, bo gdzie indziej jest to wygładzane — materiały samego Alibaby mówią, że poziom 3.1 dodaje siedem języków, co nie zgadza się z 16 wymienionymi w opublikowanym zakresie generacji z lipca. Traktuj oba te liczby jako deklarowane przez dostawcę, dopóki nie sprawdzisz konkretnych języków, których potrzebujesz, w Model Studio.
Prawdziwie nowym produktem w tym wydaniu jest Qwen-Audio-3.1-TTS-Next, który Alibaba nazywa modelem „Audiogen”: jedno przejście generuje razem głos, efekty dźwiękowe i dźwięki tła, do dialogów z wieloma mówcami, montażu podcastów i pracy nad scenami. Jego cena katalogowa to 0,848 USD za milion tokenów wejściowych i 1,696 USD za milion tokenów wyjściowych w węźle pekińskim, z limitem 3000 znaków danych wejściowych, 240 sekund generowanego dźwięku w przypadku podcastów i 120 sekund w pozostałych przypadkach, trzech żądań na sekundę i możliwością przyjęcia maksymalnie trzech klipów referencyjnych po 30 sekund każdy. Obsługuje wyłącznie chiński i angielski. Jeśli twój potok przetwarzania obejmuje tylko jednego narratora czytającego scenariusz, ten produkt jest dla ciebie nieistotny; jeśli obejmuje dwóch prowadzących i podkład muzyczny, to właśnie powód, by w ogóle przyjrzeć się temu wydaniu.
Szew jest tym, co tak naprawdę wybierasz
Ponieważ te dwa modele nie wykonują tej samej pracy, decyzja nie jest testem porównawczym. To pytanie o to, gdzie umieścisz przekazanie, i ile jesteś gotów zapłacić, aby szew był niewidoczny.
Istnieją dwie uczciwe architektury. Pierwsza to jedna sieć: Gemini 3.8 Live obsługuje całą turę, słyszy dzwoniącego, decyduje, co powiedzieć, i mówi to, a ty akceptujesz głos, który ci daje — nie możesz go sklonować ani oznaczyć własną marką. Druga to kaskada: rozpoznawanie, potem rozumowanie, potem Qwen-Audio-3.1-TTS jako usta, dając ci tysiąc głosów, w tym jeden nagrany przez twojego własnego lektora, za cenę opóźnienia na dwóch lub trzech granicach dostawców oraz prozodii, która ginie, gdy zdanie zostaje rozdzielone między wywołania API.
Większość zespołów kończy z oboma i nie jest to bynajmniej dowodem braku odwagi. Model czasu rzeczywistego stosuj tam, gdzie odczuwa się opóźnienie — przerywanie, potwierdzenie, owo „mm-hm”, które mówi dzwoniącemu, że wciąż jesteś na linii — a model syntezy tam, gdzie słychać jakość: długie odczytywanie polisy, numer potwierdzenia czytany w wyważonym tempie, głos marki, który musi być identyczny w każdym pojedynczym połączeniu. Hybryda to właściwa odpowiedź dla dużej klasy produktów. To także miejsce, w którym model kosztów zaczyna się komplikować, bo rozliczasz teraz dwie różne jednostki.

Cena za godzinę audio, która jest jedyną jednostką, do której pasują oba.
Google rozlicza Live API za minutę; Alibaba rozlicza poziomy Qwen TTS za znak i za token. Aby je porównać, trzeba wybrać normalizator, a jedynym możliwym do obrony w przypadku głosu jest godzina gotowego audio.
• Rozliczanie na wejściu — Gemini 3.8 Live za minutę dźwięku, 0,005 USD na wejściu i 0,018 USD na wyjściu vs Qwen-Audio-3.1-TTS za milion znaków, przy czym poziom 3.0 Plus zbliża się do 27,60 USD, a poziom Flash do 15 USD przed obniżką, natomiast poziom TTS Flash po niej jest wyceniany na 1,5 juana za milion tokenów wejściowych i 12 juanów za milion tokenów wyjściowych
• Rozliczanie na wyjściu — Gemini 3.8 Live dwukierunkowa rozmowa kosztuje około 1,38 USD za godzinę rozmowy w czasie rzeczywistym według cennika, przed jakimkolwiek buforowaniem, vs Qwen-Audio-3.1-TTS strumień jednokierunkowy, przy czym poziom 3.1-Next wynosi 0,848 USD za milion tokenów wejściowych i 1,696 USD za milion tokenów wyjściowych w węźle pekińskim
• Słyszy rozmówcę — Gemini 3.8 Live tak, natywne wejście audio i wideo vs Qwen-Audio-3.1-TTS nie, tekst na wejściu i dźwięk na wyjściu
• Głosy — Gemini 3.8 Live jeden głos, nieklonowalny, nieprzypisywalny do marki vs Qwen-Audio-3.1-TTS ponad tysiąc, z klonowaniem zero-shot na podstawie zaszumionego dźwięku referencyjnego
• Języki — Gemini 3.8 Live 97 według producenta, zmieniane w trakcie rozmowy vs Qwen-Audio-3.1-TTS 16 według producenta plus 20 regionów dialektów chińskich, z przenoszeniem barwy głosu między mandaryńskim, kantońskim, angielskim i japońskim
• Kontrola sposobu mówienia — Gemini 3.8 Live prompt i kontekst rozmowy vs Qwen-Audio-3.1-TTS instrukcja w języku naturalnym, zastępująca 86 znaczników wbudowanych z generacji 3.0
• Niezależny wynik — Gemini 3.8 Live 82,6 w Artificial Analysis Speech to Speech Index dla wariantu Extended Thinking i 76,0 dla wariantu standardowego vs Qwen-Audio-3.1-TTS brak; najbliższa liczba dla Qwen to 1259 Elo dla poprzedniej generacji poziomu 3.0 Plus w Provider Voice Arena, co jest oceną poprzednika, a nie tego modelu
Obniżka procentowa jest podawana względem stawek, które różnią się w zależności od regionu i poziomu, więc 70% z nagłówka nie jest obietnicą dotyczącą Twojego ruchu, a Alibaba Cloud dodatkowo przestawił transkrypcję w czasie rzeczywistym w węźle singapurskim z rozliczania opartego na czasie trwania na rozliczanie oparte na tokenach — co jest mniej przewidywalną podstawą, ponieważ zarówno cisza, jak i kontekst wielu tur rozmowy zawyżają zużycie tokenów. Zestaw nowy cennik z własnym materiałem audio.

Czego nie rozstrzyga aktualizacja do wersji 3.1
Oto część, w której łatwo się pomylić w obie strony. Ulepszenia w wersji 3.1 nie czynią z Qwen-Audio-3.1-TTS kandydata do zadania, które wykonuje Gemini 3.8 Live — sterowanie na podstawie instrukcji, transfer barwy głosu i tolerancja zaszumionego wejścia czynią z niego lepsze usta, a żadna z nich nie daje mu ucha. Podobnie pozycja Gemini 3.8 Live w benchmarkach nie mówi nic o tym, czy twój markowy głos przetrwa zdanie po kantońsku.
W dowodach jest też luka, którą obniżka ceny czyni tym bardziej kuszącą do zignorowania. Qwen-Audio-3.1-TTS nie ma niezależnego wyniku. Wynik 1 259 Elo, który pojawia się obok nazwy Qwen na Provider Voice Arena, należy do Qwen-Audio-3.0-TTS-Plus — modelu, który jest zastępowany — zmierzonego na 1 447 próbkach. Własny wiersz następcy w Arena jeszcze nie istnieje. Jeśli Twój proces zatwierdzania wymaga wyniku od strony trzeciej — a w przypadku głosu marki prawdopodobnie powinien — nowszy model jest tym, który go nie ma, a tańsza warstwa jest tą, której jeszcze nie możesz obronić. Jedynym wydarzeniem, które by to rozstrzygnęło, jest pojawienie się Qwen-Audio-3.1-TTS na tablicy odsłuchów w ciemno.
Gdzie jeden klucz pomaga, a gdzie nie
Jedną z konsekwencji wydania 3.1 łatwo przeoczyć, ponieważ wygląda bardziej na szczegół inżynierii podpowiedzi niż infrastruktury. Zastąpienie 86 zakodowanych na sztywno instrukcji swobodnymi poleceniami zamienia twoje wytyczne dotyczące dostarczania w artefakty tekstowe. Teraz generujesz, wersjonujesz i ponownie weryfikujesz każdy z nich względem interpretacji nowego modelu — a trybem awarii jest dryf, nie błąd, ponieważ dwa sformułowania „ciepły, ale nie sentymentalny” nie zadziałają identycznie.
To problem wnioskowania tekstowego opakowany wokół potoku mowy i właśnie tu jesteśmy przydatni. OrcaRouter nie kieruje zapytań do Qwen-Audio-3.1-TTS ani do żadnego modelu Qwen-Audio, a my nie kierujemy zapytań do punktów końcowych Gemini 3.8 Live — żadnej z tych połówek tego stosu nie można wywołać przez nas i nic tutaj nie powinno być odczytywane jako twierdzenie, że tak jest. To, co faktycznie oferujemy, to warstwa, która zapisuje i sprawdza tekst sterujący: qwen/qwen3.8-flash i google/gemini-3.8-flash spośród ponad 200 modeli z jednego klucza w cenie katalogowej dostawcy bez marży, z DSL routingu, który składa kilka modeli w jedno wywołanie i automatyczne przełączanie awaryjne gdy komponent nadrzędny ulegnie degradacji. Gdy masz zamiar ponownie zweryfikować dziesięć tysięcy promptów dostarczania względem modelu, który właśnie zmienił sposób, w jaki je odczytuje, generowanie wariantów i ocenianie ich pod kątem spójności to część, która powinna być jednym kontraktem, a nie czterema.
Co mierzyć przed dokonaniem wyboru
Trzy eksperymenty odpowiadają na więcej pytań niż jakiekolwiek posiedzenie zarządu. Przepuść jeden głos referencyjny i jeden akapit własnego skryptu przez Qwen-Audio-3.1-TTS i posłuchaj, czy sterowanie oparte na instrukcjach daje dwa razy tę samą realizację — to właśnie ryzyko migracji i taniej je zmierzyć, niż planować wokół niego. Przepuść prawdziwe nagranie rozmowy z własnym szumem tła przez Gemini 3.8 Live i sprawdź, czy przechodzenie między mówiącymi się utrzymuje, gdy dzwoniący wchodzi w słowo w połowie wyrazu — to właśnie próbuje skwantyfikować wskaźnik mowy do mowy, a on nie wytrzymuje kontaktu z prawdziwą linią telefoniczną na tyle niezawodnie, by przyjmować go na wiarę. I policz to na własnym wolumenie w godzinach audio, a nie w jednostkach, w których rozliczają się obaj dostawcy, bo w tym konkretnym zestawieniu oczekiwana różnica w cenie między „tanim chińskim TTS” a „flagowym rozwiązaniem Google” nigdy nie była tak duża, jak wygląda, a po 23 września jest jeszcze mniejsza.

Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
