Wygenerowana karta hero dla „Gemini 3.8 TTS: dwa pelikany, dwa modele" na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi. Trzy karty zawierają tekst: „Gemini 3.8 Flash TTS — Elo 1 260, pozycja 2, 8 głosów areny, 9,00 USD za 1 mln tokenów audio", „Gemini 3.8 Flash-Lite TTS — Elo 1 235, pozycja 6, 6,00 USD za 1 mln tokenów audio" oraz „Dialog dwuosobowy — obsługiwany, projektowanie głosu, replikacja 30-sekundowa". W wierszu stopki widnieje tekst: „Elo według Artificial Analysis Provider Voice Arena, wrzesień 2026; ceny katalogowe według Google". Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

Gemini 3.8 TTS: Dwa pelikany, dwa modele i cena, która podwaja się w styczniu

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najszybszym sposobem, by zrozumieć, co dostawca wypuścił 23 września 2026 r., jest obejrzenie demonstracji, która krążyła razem z tym wydaniem: dwa pelikany kłócą się o to, czy przeprowadzić się na Pacifica Pier, jeden głos na ptaka, skryptowana tura po turze. Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS to dwa modele stojące za tą demonstracją, oba ogólnie dostępne w Gemini API, a pelikany nie są sztuczką. To pierwsza rzecz w tej generacji, której poprzednie modele mowy Gemini nie potrafiły zrobić w ogóle: dwóch mówców, jedno generowanie, skrypt kontrolujący, kto co mówi.

Cena to druga połowa tej historii i to tutaj drogi obu modeli się rozchodzą. Flash TTS nalicza $0.50 za milion tokenów tekstowych na wejściu i $9.00 za milion tokenów audio na wyjściu do 31 grudnia 2026 r., a następnie $18.00; Flash-Lite TTS nalicza $0.50 i $6.00 według tego samego harmonogramu, a następnie $12.00. To są własne stawki Google. Przeliczone przez Artificial Analysis na stawkę za milion znaków, aby można je było umieścić w tym samym zestawieniu co wszystkich innych, dają $16.50 i $11.00 — około o jedną trzecią taniej w przypadku modelu Lite i oba są znacznie poniżej stawek czołówki tego zestawienia.

Interesujące pytanie nie brzmi więc, czy modele są dobre. Brzmi: na którym z tych dwóch powinieneś budować, bo różnica między nimi nie jest różnicą, której zgadłbyś na podstawie nazw.

Co tak naprawdę zawiera ogłoszenie z 23 września

Dwa modele, nie jeden, a Google wyraźnie podkreśla, że to podział, a nie mała i duża wersja tego samego. Ogłoszenie wymienia pięć miejsc, w których się pojawiają — Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook i Google Vids — a identyfikatory API są proste: gemini-3.8-flash-tts i gemini-3.8-flash-lite-tts.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

Lista możliwości jest dłuższa, niż sugeruje nagłówek. Z ogłoszenia Google i dokumentacji generowania mowy w Gemini API:

• Projektowanie głosu — opisujesz głos słowami i otrzymujesz własny identyfikator głosu, zamiast wybierać z ustalonej listy.

• Replikacja głosu — 30-sekundowa próbka generuje identyfikator głosu, czyli ścieżkę, z której większość zespołów faktycznie skorzysta w przypadku głosu marki lub narratora.

• Dialog dwuosobowy — przypadek pelikana. Scenariusz zawiera tury mówców zamiast pojedynczego bloku prozy.

• Stylizacja na poziomie tury — dokumentacja opisuje adnotację speech_metadata, która przypisuje wskazówki do konkretnej tury, a nie do całego żądania.

• Gotowe głosy oraz rozszerzona biblioteka głosów dostępna pod adresem GET /v1beta/voices.

• Trzy kodowania audio — domyślnie WAV, z mulaw i alaw dostępnymi dla potoków o profilu telefonicznym.

• Tylko tekst na wejściu, tylko audio na wyjściu. Dokumentacja mówi o tym wprost: modele TTS nie przyjmują żadnego innego rodzaju danych wejściowych i nie generują żadnych innych danych wyjściowych, a istnieje osobna sekcja Ograniczenia, w której wymieniono te restrykcje.

Czego nie ma w ogłoszeniu, to żadnej z liczb potrzebnych osobie planującej moce. Limity szybkości, kwoty i czas przechowywania zaprojektowanego głosu – wszystko to znajduje się w dokumentacji i na stronie z cennikiem, a nie we wpisie o premierze, co jest zwykłym powodem, dla którego tydzień premiery przebiega gładko w przypadku prezentacji, a źle w środowisku produkcyjnym.

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

Pelikany są prawdziwą wiadomością

TTS z pojedynczym mówcą od dwóch lat jest problemem rozwiązanym w wystarczającym stopniu. Brakowało modelu, który utrzymałby dwie tożsamości oddzielone od siebie przez długi skrypt bez dryfowania, i to właśnie testuje to demo — nie to, czy głos brzmi po ludzku, ale czy mówca A po czterech minutach nadal jest mówcą A.

Wynikają z tego dwie rzeczy i to one sprawiają, że ma to znaczenie wykraczające poza podcastowe zabawki.

Po pierwsze, zmienia się jednostka pracy. W modelu z jednym mówcą dwudziestominutowy dialog to dwadzieścia minut dźwięku, który zszywasz z dwóch niezależnych przebiegów, a każde łączenie jest miejscem, w którym prozodia się resetuje. W modelu z dwoma mówcami to jedno wywołanie, jeden kontekst, a model może reagować na poprzedzającą kwestię. To różnica jakościowa, której nie da się nadrobić obróbką końcową.

Drugą rzeczą jest to, że format skryptu staje się interfejsem. Jeśli twoja pipeline już generuje coś w kształcie SSML — adnotację na frazę — ta generacja jest bliska wdrożenia bez zmian. Jeśli twoja pipeline podaje modelowi ścianę tekstu i ma nadzieję, to teraz masz powód, by ją przebudować, ponieważ stylizacja, która kiedyś była niejawna, jest teraz czymś, co musisz wypowiedzieć na głos. To ten sam kompromis, który reszta branży przyjmuje na różne sposoby, i to jest oś, na której te dwa modele Google konkurują ze wszystkim innym na planszy.

Ile kosztuje godzina audio dwóch pelikanów

Kalkulacja tokenów jest warta wykonania raz, ponieważ liczba tokenów audio na milion nie jest liczbą na godzinę, a ta różnica zaskoczyła ludzi.

Tokeny audio są generowane w stałym tempie na sekundę wynikowego dźwięku, więc koszt skaluje się wraz z długością gotowego audio, a nie z długością skryptu. Weź własną stawkę Google dla Flash TTS — 9,00 USD za milion tokenów audio na wyjściu — a arytmetyka dla jednogodzinnego gotowego materiału daje jednocyfrowe kwoty w dolarach w warstwie standardowej, przy czym model Lite to dwie trzecie tej kwoty. Cennik Batch i Flex — 0,25 USD na wejściu i 4,50 USD na wyjściu dla Flash TTS w porównaniu z 0,25 USD i 3,00 USD dla Flash-Lite TTS — obniża to jeszcze bardziej w przypadku wszystkiego, co nie musi być generowane na żądanie. Priority — 0,90 USD i 16,00 USD — jest dla pracy, która musi być generowana na żądanie.

Trzy praktyczne konsekwencje:

• Regenerowanie akapitu jest tanie; regenerowanie serii to decyzja. Przy takich stawkach kosztowną częścią potoku przetwarzania mowy przestaje być wnioskowanie i znów staje się człowiek, który zatwierdza nagranie.

• Stawka za wprowadzanie tekstu to szum. 0,50 USD za milion tokenów tekstowych przy scenariuszu liczącym kilka tysięcy słów to błąd zaokrąglenia w porównaniu ze stroną audio. Nie optymalizuj scenariusza pod kątem długości.

• Klif 31 grudnia jest realny i podwaja stawkę audio. Jeśli planujesz wdrożenie w 2027 roku, zaplanuj budżet na kwotę po promocji, a nie na tę startową — inaczej w styczniu będziesz planować wszystko od nowa.

Liczba, która jest niezależna, oraz te, które nie są.

Jedna liczba w tym premierze pochodzi z miejsca innego niż Google. W Artificial Analysis Provider Voice Arena, z 24 września 2026 r., Gemini 3.8 Flash TTS zajmuje 2. miejsce z Elo 1 260 na podstawie 1 999 próbek i 8 głosów areny, a Gemini 3.8 Flash-Lite TTS zajmuje 6. miejsce z 1 235 na podstawie 2 000 próbek. Oba mieszczą się nawzajem w swoich przedziałach ufności przy ±16 i ±17, więc ranking mówi ci, że pod względem preferencji są statystycznie nieodróżnialne — co jest naprawdę przydatnym wynikiem, ponieważ oznacza, że tańszy model nie jest mierzalnie gorszy dla słuchaczy.

Wszystko inne to twierdzenia samego Google i tak należy je traktować: język ekspresji, liczba języków, jakość replikacji. Arena daje ci ranking preferencji i nic więcej. Nie mówi, jak każdy z modeli radzi sobie z 40-minutowym skryptem bez dryfu, jak zachowuje się wobec nazwy własnej, której nigdy nie widział, ani co dzieje się z zaprojektowanym głosem po tygodniu.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

Model Lite jest również lepszym argumentem za tym, że ta para to prawdziwy podział, a nie warstwa marketingowa. 25-punktowa różnica Elo, mieszcząca się w granicach błędu, w zestawieniu z 33-procentową różnicą w cenie, to kształt decyzji, którą potoki wrażliwe na cenę powinny podejmować na korzyść Lite niemal za każdym razem — oraz kształt decyzji, którą potoki wrażliwe na opóźnienia powinny podejmować w przeciwnym kierunku, ponieważ te dwa modele różnią się zarówno pod względem czasu, jak i rachunku.

Gdzie to uruchomić i szczera wersja tej odpowiedzi

OrcaRouter nie hostuje punktów końcowych Gemini 3.8 TTS. Warto to powiedzieć wprost, zamiast sugerować coś przeciwnego, ponieważ użyteczna rzecz, jaką możemy powiedzieć o tych dwóch modelach, to nie to, że je obsługujemy — nie obsługujemy — ale to, że obniżka ceny przez dostawcę, taka jak zmiana z 31 grudnia, jest dokładnie tym rodzajem zdarzenia, który sprawia, że routing jest wart posiadania.

OrcaRouter udostępnia ponad 200 modeli za jednym kluczem API w cenie listowej dostawcy bez marży, więc cennik dostawcy to kwota, którą płacisz, a jego zmiana jest widoczna po naszej stronie tego samego dnia, a nie dopiero w następnym cyklu rozliczeniowym. W przypadku potoku mowy, który jest w trakcie migracji, warstwa przełączania awaryjnego ma większe znaczenie niż katalog: możesz skierować ścieżkę żądań na model, który jest jeszcze oceniany, nie ryzykując na nim produkcyjnej trasy, ponieważ nieudane wywołanie może przejść do czegoś, co już się sprawdziło. DSL routingu łączy kilka modeli w jedno wywołanie w przypadkach, gdy żaden pojedynczy głos nie jest wystarczająco dobry, a fuzja modeli odpowiada na prompt za pomocą panelu, gdy odpowiedź ma większe znaczenie niż opóźnienie.

Jeśli chodzi o same modele Gemini 3.8 TTS, miejscem, w którym należy je wywoływać, jest własne API Google oraz interfejsy, które Google wymieniło 23 września. To, co ta para robi z twoją architekturą — jedno wywołanie dla dwóch mówców, stylizacja jako adnotacja, głos, który można opisać, a nie wybierać — jest tym, co przetrwa rabat z okazji premiery.

Co obejrzeć dalej

Trzy rzeczy zdecydują, czy ta generacja to skokowa zmiana, czy tylko funkcja.

Po pierwsze: dryf. Nikt nie opublikował obszernej oceny tego, czy ścieżka dwóch mówców zachowuje tożsamość przez pełną godzinę, a dopóki ktoś tego nie zrobi, pelican demo pozostaje demem. Po drugie: czas życia głosu. Zaprojektowany głos, który wygasa w tydzień, to prototyp; głos, który można odtworzyć z zapisanej konfiguracji, to produkt, a odpowiedź zależy od tego, który z dwóch identyfikatorów zachowasz. Po trzecie: to, co stanie się po 31 grudnia, gdy skończy się stawka promocyjna i koszt za godzinę potoku mowy podwoi się z dnia na dzień.

Żadna z tych rzeczy nie jest widoczna w poście o premierze. Wszystkie trzy widać w dokumentacji, i właśnie tam relacja z premiery kończy czytanie.