Wygenerowana karta hero dla „Twórz i wdrażaj niestandardowe audio” z podtytułem „Gemini 3.8 Flash TTS” na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi. Trzy ponumerowane karty głoszą: „1 Zaprojektuj głos na podstawie promptu”, „2 Przechowuj go przez rok lub korzystaj z siedmiodniowego klucza” i „3 Wywołaj /v1/audio/speech”, nad wierszem stopki o treści „Gemini API, 23 września 2026. Dane dostawcy.” Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

Twórz i wdrażaj niestandardowe audio za pomocą Gemini 3.8 Flash TTS: projektowanie głosu, klonowanie i dwa zegary, które decydują

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS pozwalają wymyślić głos na podstawie opisu tekstowego zamiast wybierać go z listy, a oba stały się ogólnie dostępne w Gemini API 23 września 2026 r. Powtarzany przez wszystkich nagłówek to projektowanie głosu. Część, wokół której warto planować, dotyczy tego, co dzieje się później z zaprojektowanym głosem, ponieważ dostawca daje dwa sposoby na jego zachowanie i każdemu przypisuje inny okres ważności. Wybierz niewłaściwy, a głos, od którego zależy twój produkt, wygaśnie w ciągu tygodnia.

To jest luka w dotychczasowym relacjonowaniu premiery. Wpisy ogłaszające wyjaśniają, że można wywołać głos do istnienia, a kilka z nich wspomina o klonowaniu z 30-sekundowej próbki. Żaden z nich nie omawia modelu przechowywania, czyli tego, co decyduje o tym, czy pipeline mowy da się odtworzyć z pliku konfiguracyjnego, czy trzeba go ponownie provisionować według harmonogramu. Ten artykuł obejmuje całą ścieżkę — projektowanie, przechowywanie, wywoływanie i płacenie — wraz z cenami i limitami w takiej postaci, w jakiej publikuje je Google.

Co zostało wydane 23 września

Dwa modele, jeden schemat API. Identyfikatory to gemini-3.8-flash-tts i gemini-3.8-flash-lite-tts, a dokumentacja Google wyraźnie stwierdza, że oba przyjmują „dokładnie ten sam schemat API i format promptów” — przechodzenie między nimi to zmiana jednego parametru, nie przepisywanie.

• Wejście — tylko tekst. Oba modele przyjmują tekst i zwracają dźwięk; nie są multimodalne i nie generują tekstu w odpowiedzi.

• Wyjście — WAV, 24 kHz, mono, 16-bitowy PCM ze znakiem w punkcie końcowym typu unary; PCM bez nagłówka (audio/l16) w punkcie końcowym strumieniowym; audio/mulaw i audio/alaw są akceptowane z konfigurowalną częstotliwością próbkowania.

• Języki — 130 w Flash TTS, 101 w Flash-Lite TTS, wykrywane automatycznie na podstawie tekstu, a nie deklarowane w żądaniu.

• Głosy — 30 wyselekcjonowanych głosów studyjnych wymienionych w dokumentacji (w tym Kore i Puck), Extended Voice Library z „setkami” kolejnych głosów, które można wyszukiwać przez endpoint voices, oraz dwie ścieżki tworzenia opisane poniżej.

• Reżyseria — kontrola wypowiedzi linia po linii, sceny z dwoma mówcami inscenizowane na podstawie jednego scenariusza oraz niewerbalne sygnały, takie jak <laughs>, <sigh> i |mhm|, wpisane bezpośrednio do transkrypcji.

Dwa poziomy istnieją, ponieważ obciążenia się rozeszły. Flash TTS jest pozycjonowany na maksymalną wierność akustyczną i złożoną grę aktorską; Flash-Lite TTS jest opisywany własnymi słowami Google jako „workhorse replacement” dla gemini-3.1-flash-tts-preview, przeznaczony do masowego dubbingu, funkcji czytania na głos i kaskad agentów głosowych. Oba zastępują pojedynczy model podglądowy, który był dostępny w API od kwietnia 2026 r., więc jeśli korzystałeś z podglądu, migracja jest decyzją o poziomie, a nie aktualizacją wersji.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English on 24 September 2026, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) and Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts), and Python sample code that passes a speaker_config with the Kore voice to the interactions endpoint.

Projektowanie głosu to prompt, a to zmienia etap przeglądu

Interfejs tworzenia to naprawdę nowa rzecz w tej generacji. Promptowany głos powstaje na podstawie opisu w języku naturalnym — roli, akcentu, charakteru głosu — i zwraca identyfikator, który można ponownie wykorzystać. W API jest to wywołanie tworzenia głosu z store: true i promptowanym wejściem; w przykładach samego Google opisy sięgają od pełnego energii didżeja z Melbourne po japońskiego smoka. Po utworzeniu ten głos jest przywoływany w żądaniu mowy przez swój identyfikator, a instrukcje stylu dla poszczególnych żądań mogą być wówczas minimalne lub puste, ponieważ charakter jest już wbudowany w głos.

Praktyczną konsekwencją jest zmiana przepływu pracy, a nie tylko nowa funkcja. Casting głosu był kiedyś negocjacją licencji lub rezerwacją studia, co oznaczało, że wybór głosu następował raz, wcześnie, i przechodził weryfikację, ponieważ jego zmiana była kosztowna. Gdy głosem jest akapit tekstu, casting staje się tokenem projektowym — czymś, o co menedżer produktu może poprosić, aby został przelosowany we wtorek. Zespoły, które umieszczają ciąg opisu w kontroli wersji i traktują wygenerowany identyfikator głosu jako artefakt budowania, uzyskają spójne wyniki w różnych środowiskach. Zespoły, które tworzą głosy ręcznie w AI Studio, nie uzyskają spójnych wyników, a błąd będzie wyglądał jak niewytłumaczalna różnica między dźwiękiem w środowisku staging a dźwiękiem produkcyjnym.

Dwa zegary

To sekcja, którą pomijają posty o premierze. Google pozwala utrzymywać zaprojektowany lub zreplikowany głos w jednym z dwóch stanów, a one wygasają w diametralnie różnym tempie.

• Zapisane głosy — utworzone przy włączonym przechowywaniu, znajdują się w Twoim projekcie i podlegają limitowi 200 głosów na projekt z rocznym okresem ważności.

• Klucze bezstanowe — replikacja głosu może zwrócić klucz zarządzany przez klienta (w postaci voicekey_…) zamiast przechowywanego identyfikatora, a klucz ten ma siedmiodniowy okres ważności.

Czytane razem, ta para to instrukcja projektowa. Zapisany głos to zobowiązanie na rok i twardy pułap 200 na projekt — hojny w produkcie o stałej obsadzie, a bezużyteczny w czymkolwiek, co generuje nowy głos dla każdego klienta. Klucz bezstanowy jest przeciwieństwem: brak presji limitu, ale klucz, który trzeba ponownie wygenerowywać co tydzień, co oznacza, że aplikacja potrzebuje ścieżki odświeżania, a infrastruktura musi przechowywać poświadczenia podlegające rotacji. Żaden nie jest zły. Wybór bez zauważenia, którego się dokonało, sprawia, że agent głosowy milknie ósmego dnia.

Z replikacją wiążą się jeszcze dwie właściwości, które warto znać, zanim cokolwiek obiecasz zespołowi prawnemu. Utworzenie zreplikowanego głosu wymaga nagrania ustnej zgody właściciela głosu, które musi odpowiadać mówcy referencyjnemu — weryfikacja głosowa, a nie zaznaczenie pola. A wynik niesie ze sobą proweniencję: każdy klip jest opatrzony znakiem wodnym SynthID, a zreplikowane głosy dodatkowo mają poświadczenia treści C2PA. Ścieżka projektowa jest celowo trudniejsza do nadużycia, a obie bariery mają charakter strukturalny, a nie stanowią deklaracji polityki.

Jedna rozbieżność warta odnotowania, a nie rozstrzygnięcia. Tabela obsługiwanych modeli Google wymienia projektowanie głosu i replikację głosu jako dostępne w obu modelach 3.8 TTS. Większość relacji z premiery opisuje replikację jako część narracji dotyczącej konkretnie Flash TTS. Jeśli replikacja ma znaczenie dla Twojej decyzji między poziomami, zweryfikuj ją w dokumentacji poziomu, który zamierzasz wdrożyć, zamiast ufać któremukolwiek z tych podsumowań.

Ile kosztuje godzina audio

Google rozlicza mowę w tokenach, a nie w znakach czy sekundach, a przelicznik jest publikowany: dźwięk jest rozliczany według 25 tokenów za sekundę wyjścia audio, co daje 90 000 tokenów na godzinę. To sprawia, że arytmetyka jest wyjątkowo przejrzysta, i to właśnie tę liczbę należy wpisać do budżetu, a nie stawkę za milion.

• Flash TTS standard — 0,50 USD za milion tokenów tekstowych na wejściu, 9,00 USD za milion tokenów audio na wyjściu do 31 grudnia 2026 r., a następnie 1,00 USD i 18,00 USD. Batch i Flex wynoszą 0,25 USD i 4,50 USD; Priority wynosi 0,90 USD i 16,20 USD.

• Flash-Lite TTS standard — 0,50 USD i 6,00 USD do tej samej daty, następnie 1,00 USD i 12,00 USD. Batch i Flex 0,25 USD i 3,00 USD; Priority 0,90 USD i 10,80 USD.

• W sekundach — Flash TTS wynosi około 0,81 USD za godzinę wygenerowanego audio w okresie promocyjnym i około 1,62 USD po jego zakończeniu; Flash-Lite TTS to około 0,54 USD, a następnie 1,08 USD.

• W porównaniu z modelem, który zastępuje — gemini-3.1-flash-tts-previewjest wyceniany na 1,00 USD i 20,00 USD za milion, więc pozycja dotycząca wyjścia audio spadła o 55 procent w przypadku Flash TTS i o 70 procent w przypadku Flash-Lite TTS.

Nie planuj w oparciu o promocyjną liczbę. Google publikuje obie kolumny w tej samej tabeli, co oznacza, że styczniowa stawka nie jest pogłoską, którą odkryje się później — jest na karcie już dziś, a każdy szacunek za tysiąc minut oparty na 0,81 USD musi przetrwać podwojenie.

Jedna niezależna liczba i kilka, które takie nie są

Ogłoszenie Google zaczyna się od wyników benchmarków i należy je czytać dokładnie tak, jakimi są. Firma podaje, że Flash TTS zajął pierwsze miejsce w Voice Design Benchmark firmy Hume AI z wynikiem 71,4, przodował w modelowaniu akcentu z wynikiem 60,8, a Flash TTS i Flash-Lite TTS uplasowały się odpowiednio na pierwszym i drugim miejscu w Overall Quality Index firmy Hume, z mocnymi pozycjami w ślepych preferencjach w Voice Arena dla języka japońskiego, portugalskiego brazylijskiego, wietnamskiego, współczesnego standardowego arabskiego, hiszpańskiego meksykańskiego i hindi. Wszystko raportowane przez dostawcę; żaden z przebiegów nie jest publiczny.

Warto zauważyć pewien szczegół na tej liście. Alan Cowen, wymieniony jako autor ogłoszenia Google, jest założycielem Hume AI — laboratorium, którego Voice Design Benchmark dostarcza liczbę z nagłówka. To nie czyni tej liczby błędną, a benchmark Hume’a jest prawdziwy, ale te dwie rzeczy nie są od siebie niezależne, a czytelnik rozważający 71,4 powinien o tym wiedzieć, zanim powtórzy ją jako walidację strony trzeciej.

Niezależnie zebrany wynik znajduje się w Provider Voice Arena Artificial Analysis, zarejestrowany na potrzeby tego artykułu 24 września 2026 r.: Gemini 3.8 Flash TTS zajmuje drugie miejsce z Elo 1 260 i 17-punktowym przedziałem na podstawie 1 999 próbek, za Cartesia Sonic 3.6 z wynikiem 1 273. Gemini 3.8 Flash-Lite TTS jest szósty z wynikiem 1 235. Zastępowany model, Gemini 3.1 Flash TTS, jest dziesiąty z wynikiem 1 199 na podstawie 3 430 próbek. Preferencja słuchaczy w ślepym teście, a nie własna ewaluacja laboratorium — i jedyny wskaźnik jakości, którego Google tu nie zleciło.

A generated scoreboard card titled 'Gemini 3.8 Flash TTS — the scoreboard' with six rows: Arena Elo 1,260 at rank 2 over 1,999 samples; audio out $9.00 per 1M tokens to 31 December 2026; 130 languages on Flash TTS against 101 on Flash-Lite TTS; 30 studio voices plus prompt-based design; stored voices capped at 200 per project with a one-year lifetime; and a stateless voicekey with a seven-day lifetime. The footer reads 'Elo per Artificial Analysis, 24 Sept 2026; price and quotas per Google. Google's Hume AI results are vendor-reported.'

Gdzie można to uruchomić, a gdzie jeszcze nie

Oba modele są już dziś dostępne w Gemini API i Google AI Studio, bez listy oczekujących. Powierzchnie dla konsumentów i przedsiębiorstw są raczej przygotowywane niż wdrożone: Flash TTS trafi do Gemini Notebook, a Flash-Lite TTS do Google Vids, dostęp do Gemini Enterprise jest opisywany jako „wkrótce”, a remiksowanie głosu — dostosowywanie barwy, wysokości, tempa i akcentu istniejącego głosu — jest wymieniane jako funkcja przyszła, a nie obecna. Jeśli Twój plan opiera się na remiksowaniu, to ono jeszcze nie istnieje.

Po naszej stronie, szczerość przede wszystkim: punkty końcowe Gemini 3.8 TTS nie znajdują się w tabeli routingu OrcaRouter. Generacja, którą zastępują, to — google/gemini-3.1-flash-tts-preview znajduje się w katalogu w tej samej cenie 1,00 USD i 20,00 USD za milion tokenów, jaką publikuje Google, ponieważ cena katalogowa dostawcy jest przekazywana bez marży, i odpowiada na tym samym /v1/audio/speech punkcie końcowym, na który Twoje SDK zgodne z OpenAI już celuje. To ma większe znaczenie, niż się wydaje w przypadku obciążenia związanego z mową, ponieważ to, co w rzeczywistości kupujesz, to stabilny punkt końcowy, który Twoja aplikacja może wywoływać, podczas gdy modele za nim się zmieniają. Twój kod przechowuje ciąg modelu; katalog przechowuje routing. Gdy okno promocyjne Google zamknie się 31 grudnia, a Flash TTS podwoi cenę, cena modelu z routingiem zmienia się tego samego dnia, a nie przy następnym odnowieniu umowy — a model, który ulegnie awarii, przełączy się awaryjnie, zamiast pociągnąć za sobą Twoją kolejkę narracji.

A screenshot of the OrcaRouter model page for google/gemini-3.1-flash-tts-preview, captured in English on 24 September 2026, showing the model described as Google's text-to-speech model accessed via OrcaRouter, an input price of $1.00 and output price of $20.00 per 1M tokens, a p50 time-to-first-token of 6.61 seconds and p95 of 10.00 seconds over seven days, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, and a /v1/audio/speech endpoint.

Jeśli oceniasz tę generację przed podjęciem decyzji, tanim eksperymentem jest eksperyment dwupoziomowy. Przepuść ten sam skrypt przez Flash TTS i Flash-Lite TTS, ponieważ schemat jest identyczny, a różnica to jeden parametr — potem zdecyduj na podstawie własnego audio, a nie wykresu z benchmarku, i sprawdź w Artificial Analysis, czy różnica w jakości przetrwa swoje przedziały błędów, zanim dopłacisz. W przypadku dużego projektu narracyjnego dopłata to prawdziwe pieniądze; w przypadku bota wsparcia czytającego na głos numer telefonu nie kupuje ci ona w oczywisty sposób niczego, co słuchacz mógłby usłyszeć.