Wygenerowana karta hero dla „Gemini 3.8 TTS vs Gemini 3.1 Flash TTS” na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi. Lewa karta „Gemini 3.1 Flash TTS” zawiera: Elo 1 199, 3 430 próbek, 7 głosów areny i kwiecień 2026; prawa karta „Gemini 3.8 Flash TTS” zawiera: Elo 1 260, 1 999 próbek, 8 głosów areny i wrzesień 2026. Wiersz stopki brzmi: „Elo per Artificial Analysis Provider Voice Arena, Sept 2026.” Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Engineering & Research

Gemini 3.8 TTS vs Gemini 3.1 Flash TTS: jedyna luka w tej rodzinie, która jest prawdziwa

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Aktualizacja w obrębie jednej rodziny modeli to zwykle łatwa decyzja, a ta ma pewien haczyk, który czyni ją mniej łatwą, niż się wydaje. Gemini 3.1 Flash TTS — wciąż widniejący w API dostawcy jako wersja preview — zajmuje 10. miejsce w Artificial Analysis Provider Voice Arena z wynikiem Elo 1 199 i 12-punktowym przedziałem. Gemini 3.8 Flash TTS, wydany 23 września 2026 r., zajmuje 2. miejsce z wynikiem Elo 1 260 i 17-punktowym przedziałem. To wzrost o 61 punktów i w przeciwieństwie do większości różnic na tej liście wytrzymuje słupki błędów: przedział wersji 3.1 rozciąga się od 1 187 do 1 211, przedział wersji 3.8 od 1 243 do 1 277, a między nimi jest trzydziestodwupunktowa martwa strefa. Skok jakości jest realny. Historia z ceną to miejsce, w którym robi się dziwnie.

A generated two-column scoreboard for Gemini 3.1 Flash TTS and Gemini 3.8 Flash TTS — 3.1 at Arena Elo 1,199, $20.00 per 1M audio tokens, 7 arena voices, 3,430 samples and an April 2026 release; 3.8 at Elo 1,260, $9.00 per 1M audio tokens, 8 arena voices, 1,999 samples and a September 2026 release — over the footer 'Prices per Google; Elo per Artificial Analysis, Sept 2026.'

Cennik samego Google’a podaje, że stawka za wyjście audio spadła z 20,00 USD za milion tokenów w wersji 3.1 do 9,00 USD w wersji 3.8 — obniżka o 55 procent. Artificial Analysis normalizuje te same dwa modele odpowiednio do 18,30 USD i 33,00 USD za milion znaków, co sugeruje coś przeciwnego. Obie liczby są publikowane; żadna nie jest błędna; mierzą różne rzeczy, a ich uzgodnienie jest najużyteczniejszą częścią tego porównania dla każdego, kto planuje migrację.

Co tak naprawdę zmieniła aktualizacja

Generacja 3.8 nie jest zwykłym dostrojeniem. Trzy obszary zmieniły się istotnie.

• Liczba głosów i tworzenie głosów — 3.1 Flash TTS dostarczał gotowy zestaw głosów. 3.8 Flash TTS dostarcza 30 gotowych studyjnych głosów, w tym Kore i Puck, a także projektowanie głosu na podstawie opisu w języku naturalnym oraz replikację głosu z 30-sekundowej próbki z weryfikacją zgody, znakiem wodnym SynthID i poświadczeniami C2PA na wyjściu. Remiksowanie głosów wymieniono jako funkcję dostępną wkrótce, a nie już dostarczoną.

• Kontrola sposobu wypowiedzi — wskazówki reżyserskie linia po linii, inscenizacja scen z dwoma mówcami w ramach jednego wywołania i wskazówki niewerbalne wpisane bezpośrednio w scenariusz jako <śmiech>, <westchnienie>, <wdech>, |mhm| i |no|. Materiały premierowe Google twierdzą, że poprawiono spójność długich form i kontrolę scenariusza z dwoma mówcami konkretnie w porównaniu z 3.1. To twierdzenie dostawcy, za którym nie stoi żaden publiczny test.

• Pokrycie językowe — 130 języków w Flash TTS i 101 w Flash-Lite TTS, wykrywane automatycznie na podstawie tekstu. Publikowane pokrycie 3.1 Flash TTS jest niższe.

Zmiana strukturalna polega na podziale. Nie ma jednego następcy 3.1 Flash TTS; są dwa, a dokumentacja Google określa Flash-Lite TTS jako „zastępcę konia roboczego”. Ma to znaczenie, ponieważ oznacza, że migracja to decyzja o warstwie, a nie podniesienie wersji. Tańsza warstwa nie jest nowszą wersją tego, co masz — to inny punkt na krzywej.

Dlaczego cena spadła, a ranking mówi, że wzrosła

Zacznij od tego, co publikuje Google, ponieważ to właśnie za to faktycznie zostaniesz obciążony.

Gemini 3.1 Flash TTS Preview — 1,00 USD za milion wejściowych tokenów tekstowych, 20,00 USD za milion wyjściowych tokenów audio. W trybie wsadowym: 0,50 USD i 10,00 USD.

• Gemini 3.8 Flash TTS Standard — 0,50 USD i 9,00 USD do 31 grudnia 2026 r., a następnie 1,00 USD i 18,00 USD. Batch i Flex 0,25 USD i 4,50 USD. Priority 0,90 USD i 16,20 USD.

• Gemini 3.8 Flash-Lite TTS Standard — 0,50 USD i 6,00 USD do 31 grudnia 2026 r., następnie 1,00 USD i 12,00 USD. Batch i Flex: 0,25 USD i 3,00 USD. Priority: 0,90 USD i 10,80 USD.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Już sama pozycja wyjścia audio: 3.8 Flash TTS za 9,00 USD w porównaniu z 3.1 za 20,00 USD to obniżka o 55 procent, a 3.8 Flash-Lite TTS za 6,00 USD to obniżka o 70 procent. Nawet po promocji, przy 18,00 USD, Flash TTS nadal jest tańszy niż model, który zastępuje. To liczba, która trafia na fakturę, i jest jednoznaczna.

A teraz ranking. Artificial Analysis publikuje stawkę za milion znaków, dzięki czemu modele rozliczane w różnych jednostkach można uszeregować obok siebie, a dla tej pary podaje 18,30 USD dla 3.1 Flash TTS i 33,00 USD dla 3.8 Flash TTS. Odczytana w izolacji, ta informacja mówi, że aktualizacja niemal podwoiła cenę.

Uzgodnienie polega na tym, że stawka za znak jest przeliczeniem, a nie ceną, a współczynnik przeliczeniowy nie jest taki sam dla obu modeli. Przeliczanie tokenów audio na znaki wymaga założenia zarówno tempa mowy, jak i stosunku tokenów audio — Google rozlicza audio jako 25 tokenów na sekundę danych wyjściowych — oraz wyboru poziomu usługi, względem którego ma nastąpić normalizacja. Jeśli zarząd normalizuje 3,8 przy stawce 18,00 USD po promocji, a jednocześnie normalizuje 3,1 przy własnej stawce 20,00 USD, te dwie wartości są wystarczająco bliskie, że każda różnica w zakładanej liczbie sekund na znak dominuje nad wynikiem. Stawka za znak oparta na hojnym założeniu tempa mowy stawia w korzystnym świetle model, do którego ją zastosowano.

Praktyczna wskazówka jest więc następująca: do budżetowania używaj stawek Google’a za tokeny, a stawek za znak z tabeli wyników używaj wyłącznie do ustalenia stosunku między modelami, które tabela zmierzyła w ten sam sposób. Nie mieszaj ich i nie podawaj zmiany z 18,30 USD na 33,00 USD jako podwyżki ceny — to artefakt normalizacji, której oba modele nie współdzielą.

Prawdziwy koszt migracji jest inny — to okno promocyjne. Oba nowe poziomy są za połowę stawki do 31 grudnia 2026 r., a 1 stycznia stawka się podwaja. Migracja zaplanowana na podstawie wrześniowych liczb i zrealizowana w listopadzie zostanie ponownie wyceniona w pierwszym kwartale. Stawka za Flash TTS od stycznia 2027 r. — 18,00 USD za milion tokenów audio — wciąż jest niższa niż 20,00 USD w wersji 3.1, więc po zakończeniu promocji obniżka jest prawdziwa, tylko znacznie mniejsza, niż wygląda dzisiaj.

Zysk jakościowy i to, co za nim nie stoi

Elo areny to jedyna liczba tutaj zebrana przez kogoś innego niż dostawca i jako jedyna wychodzi poza swoje słupki błędów. Sześćdziesiąt jeden punktów, od 1 199 do 1 260, z 3 430 próbkami dla 3.1 i 1 999 dla 3.8 oraz 7 głosami areny przeciw 8. Liczba próbek dla nowszego modelu jest mniejsza, co poszerza jego przedział, a mimo to zakresy się nie stykają.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing the top rows with Cartesia Sonic 3.6 first at Elo 1,273, Google's Gemini 3.8 Flash TTS second at 1,260, Alibaba's Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google's Gemini 3.1 Flash TTS tenth at 1,199 across 3,430 samples.

Co za tym nie stoi: żaden niezależny benchmark poza areną. Liczby premierowe Google — pierwsze miejsce w Hume AI Voice Design Benchmark z wynikiem 71,4, pierwsze miejsce w modelowaniu akcentu z wynikiem 60,8, pierwsze i drugie miejsce w Hume Overall Quality Index dla Flash i Flash-Lite oraz najwyższe lokaty w testach preferencji w ciemno deklarowane dla języka japońskiego, brazylijskiej odmiany portugalskiego, wietnamskiego, współczesnego standardowego arabskiego, meksykańskiej odmiany hiszpańskiego i hindi — pochodzą od dostawcy cytującego benchmark strony trzeciej. Bazowe przebiegi nie są publiczne. Czytaj je jako twierdzenia idące w tym samym kierunku co wynik areny, ale nie dodające mu niezależnej wagi.

Kwestia deprecjacji i lista kontrolna migracji

Google nie ogłosiło daty wyłączenia Gemini 3.1 Flash TTS Preview. Firma stwierdziła, że Flash-Lite TTS jest pozycjonowany jako jego następca do codziennej pracy, a takie sformułowanie zwykle poprzedza komunikat o wycofaniu, a nie pojawia się po nim. Jeśli nadal korzystasz z modelu w wersji preview, właściwa interpretacja jest taka, że masz do zaplanowania migrację, a nie termin do dotrzymania — a czekanie na ten termin to zła strategia w przypadku modelu, którego następca wyprzedza go już o 61 punktów Elo.

• Sprawdź, jakiego poziomu wymaga Twoje obciążenie. Flash TTS dla 130 języków i pełnego zakresu dostarczania; Flash-Lite TTS dla 101 języków w cenie 6,00 USD za milion tokenów audio. Linią podziału jest lista języków, a nie jakość.

• Przelicz ponownie według stawki ze stycznia 2027 r., a nie według stawki promocyjnej. 18,00 USD za milion tokenów audio w Flash TTS, 12,00 USD w Flash-Lite.

• Zdecyduj, czy zadanie można przetwarzać wsadowo. Batch i Flex o połowę obniżają stawkę za audio na obu poziomach — 4,50 USD i 3,00 USD za milion tokenów. Wszystko, co nie jest interaktywne, nie powinno znajdować się na poziomie Standard.

• Sprawdź ponownie wszystko, co zależało od zestawu głosów. Domyślny katalog to 30 gotowych głosów; głos, którego używałeś w wersji 3.1, może wymagać ponownego utworzenia — albo poprzez projektowanie głosu, albo poprzez 30-sekundową próbkę do replikacji.

• Ponownie sprawdź kształtowanie żądań. W modelach 3.8 nie opublikowano limitu znaków na żądanie, a audio jest rozliczane za sekundę, a nie za znak, więc długa wypowiedź kosztuje więcej, niż sugerowałaby wycena za znak.

• Zaplanuj cykl życia niestandardowego głosu. 200 stanowych głosów na projekt z jednorocznym czasem życia lub bezstanowe voicekey_... uchwyty, które wygasają po siedmiu dniach.

Uruchamiam oba, dopóki nie zdecydujesz

Aktualizacja w obrębie tej samej rodziny modeli, z wygasającą promocją i sporem o normalizację, to dokładnie ten przypadek, w którym nie należy przechodzić na nową wersję w jednym kroku. OrcaRouter kieruje dziś ruch do starszego modelu — models/google/gemini-3.1-flash-tts-previewznajduje się na naszej liście modeli — dzięki czemu możesz uruchomić nowy model obok niego i porównać na własnym ruchu, zanim przeniesiesz ścieżkę produkcyjną. Nie hostujemy punktów końcowych Gemini 3.8 TTS; pochodzą one z własnego API Google. To, co oferujemy, to jeden klucz do ponad 200 modeli w cenie katalogowej dostawcy, bez marży, dzięki czemu zmiana stawek dostawcy trafia na Twoje rozliczenie tego samego dnia, a nie dopiero przy odnowieniu, oraz automatyczne przełączanie awaryjne, dzięki któremu zupełnie nowy model możesz wypróbować, nie stawiając na niego ścieżki widocznej dla klientów.

Najważniejsze, na co trzeba uważać, to czy Google doda datę do 3.1 Flash TTS preview. Ta pojedyncza linijka dokumentacji jest warta więcej dla planu migracji niż którykolwiek z benchmarków w tym artykule, a jeszcze jej nie napisano.