
Twórz i wdrażaj niestandardowe audio za pomocą Gemini 3.8 Flash TTS: projektowanie głosu, klonowanie i dwa zegary, które decydują
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 506 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 184 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS pozwalają wymyślić głos na podstawie opisu tekstowego zamiast wybierać go z listy, a oba stały się ogólnie dostępne w Gemini API 23 września 2026 r. Powtarzany przez wszystkich nagłówek to projektowanie głosu. Część, wokół której warto planować, dotyczy tego, co dzieje się później z zaprojektowanym głosem, ponieważ dostawca daje dwa sposoby na jego zachowanie i każdemu przypisuje inny okres ważności. Wybierz niewłaściwy, a głos, od którego zależy twój produkt, wygaśnie w ciągu tygodnia.
To jest luka w dotychczasowym relacjonowaniu premiery. Wpisy ogłaszające wyjaśniają, że można wywołać głos do istnienia, a kilka z nich wspomina o klonowaniu z 30-sekundowej próbki. Żaden z nich nie omawia modelu przechowywania, czyli tego, co decyduje o tym, czy pipeline mowy da się odtworzyć z pliku konfiguracyjnego, czy trzeba go ponownie provisionować według harmonogramu. Ten artykuł obejmuje całą ścieżkę — projektowanie, przechowywanie, wywoływanie i płacenie — wraz z cenami i limitami w takiej postaci, w jakiej publikuje je Google.
Co zostało wydane 23 września
Dwa modele, jeden schemat API. Identyfikatory to gemini-3.8-flash-tts i gemini-3.8-flash-lite-tts, a dokumentacja Google wyraźnie stwierdza, że oba przyjmują „dokładnie ten sam schemat API i format promptów” — przechodzenie między nimi to zmiana jednego parametru, nie przepisywanie.
• Wejście — tylko tekst. Oba modele przyjmują tekst i zwracają dźwięk; nie są multimodalne i nie generują tekstu w odpowiedzi.
• Wyjście — WAV, 24 kHz, mono, 16-bitowy PCM ze znakiem w punkcie końcowym typu unary; PCM bez nagłówka (audio/l16) w punkcie końcowym strumieniowym; audio/mulaw i audio/alaw są akceptowane z konfigurowalną częstotliwością próbkowania.
• Języki — 130 w Flash TTS, 101 w Flash-Lite TTS, wykrywane automatycznie na podstawie tekstu, a nie deklarowane w żądaniu.
• Głosy — 30 wyselekcjonowanych głosów studyjnych wymienionych w dokumentacji (w tym Kore i Puck), Extended Voice Library z „setkami” kolejnych głosów, które można wyszukiwać przez endpoint voices, oraz dwie ścieżki tworzenia opisane poniżej.
• Reżyseria — kontrola wypowiedzi linia po linii, sceny z dwoma mówcami inscenizowane na podstawie jednego scenariusza oraz niewerbalne sygnały, takie jak <laughs>, <sigh> i |mhm|, wpisane bezpośrednio do transkrypcji.
Dwa poziomy istnieją, ponieważ obciążenia się rozeszły. Flash TTS jest pozycjonowany na maksymalną wierność akustyczną i złożoną grę aktorską; Flash-Lite TTS jest opisywany własnymi słowami Google jako „workhorse replacement” dla gemini-3.1-flash-tts-preview, przeznaczony do masowego dubbingu, funkcji czytania na głos i kaskad agentów głosowych. Oba zastępują pojedynczy model podglądowy, który był dostępny w API od kwietnia 2026 r., więc jeśli korzystałeś z podglądu, migracja jest decyzją o poziomie, a nie aktualizacją wersji.

Projektowanie głosu to prompt, a to zmienia etap przeglądu
Interfejs tworzenia to naprawdę nowa rzecz w tej generacji. Promptowany głos powstaje na podstawie opisu w języku naturalnym — roli, akcentu, charakteru głosu — i zwraca identyfikator, który można ponownie wykorzystać. W API jest to wywołanie tworzenia głosu z store: true i promptowanym wejściem; w przykładach samego Google opisy sięgają od pełnego energii didżeja z Melbourne po japońskiego smoka. Po utworzeniu ten głos jest przywoływany w żądaniu mowy przez swój identyfikator, a instrukcje stylu dla poszczególnych żądań mogą być wówczas minimalne lub puste, ponieważ charakter jest już wbudowany w głos.
Praktyczną konsekwencją jest zmiana przepływu pracy, a nie tylko nowa funkcja. Casting głosu był kiedyś negocjacją licencji lub rezerwacją studia, co oznaczało, że wybór głosu następował raz, wcześnie, i przechodził weryfikację, ponieważ jego zmiana była kosztowna. Gdy głosem jest akapit tekstu, casting staje się tokenem projektowym — czymś, o co menedżer produktu może poprosić, aby został przelosowany we wtorek. Zespoły, które umieszczają ciąg opisu w kontroli wersji i traktują wygenerowany identyfikator głosu jako artefakt budowania, uzyskają spójne wyniki w różnych środowiskach. Zespoły, które tworzą głosy ręcznie w AI Studio, nie uzyskają spójnych wyników, a błąd będzie wyglądał jak niewytłumaczalna różnica między dźwiękiem w środowisku staging a dźwiękiem produkcyjnym.
Dwa zegary
To sekcja, którą pomijają posty o premierze. Google pozwala utrzymywać zaprojektowany lub zreplikowany głos w jednym z dwóch stanów, a one wygasają w diametralnie różnym tempie.
• Zapisane głosy — utworzone przy włączonym przechowywaniu, znajdują się w Twoim projekcie i podlegają limitowi 200 głosów na projekt z rocznym okresem ważności.
• Klucze bezstanowe — replikacja głosu może zwrócić klucz zarządzany przez klienta (w postaci voicekey_…) zamiast przechowywanego identyfikatora, a klucz ten ma siedmiodniowy okres ważności.
Czytane razem, ta para to instrukcja projektowa. Zapisany głos to zobowiązanie na rok i twardy pułap 200 na projekt — hojny w produkcie o stałej obsadzie, a bezużyteczny w czymkolwiek, co generuje nowy głos dla każdego klienta. Klucz bezstanowy jest przeciwieństwem: brak presji limitu, ale klucz, który trzeba ponownie wygenerowywać co tydzień, co oznacza, że aplikacja potrzebuje ścieżki odświeżania, a infrastruktura musi przechowywać poświadczenia podlegające rotacji. Żaden nie jest zły. Wybór bez zauważenia, którego się dokonało, sprawia, że agent głosowy milknie ósmego dnia.
Z replikacją wiążą się jeszcze dwie właściwości, które warto znać, zanim cokolwiek obiecasz zespołowi prawnemu. Utworzenie zreplikowanego głosu wymaga nagrania ustnej zgody właściciela głosu, które musi odpowiadać mówcy referencyjnemu — weryfikacja głosowa, a nie zaznaczenie pola. A wynik niesie ze sobą proweniencję: każdy klip jest opatrzony znakiem wodnym SynthID, a zreplikowane głosy dodatkowo mają poświadczenia treści C2PA. Ścieżka projektowa jest celowo trudniejsza do nadużycia, a obie bariery mają charakter strukturalny, a nie stanowią deklaracji polityki.
Jedna rozbieżność warta odnotowania, a nie rozstrzygnięcia. Tabela obsługiwanych modeli Google wymienia projektowanie głosu i replikację głosu jako dostępne w obu modelach 3.8 TTS. Większość relacji z premiery opisuje replikację jako część narracji dotyczącej konkretnie Flash TTS. Jeśli replikacja ma znaczenie dla Twojej decyzji między poziomami, zweryfikuj ją w dokumentacji poziomu, który zamierzasz wdrożyć, zamiast ufać któremukolwiek z tych podsumowań.
Ile kosztuje godzina audio
Google rozlicza mowę w tokenach, a nie w znakach czy sekundach, a przelicznik jest publikowany: dźwięk jest rozliczany według 25 tokenów za sekundę wyjścia audio, co daje 90 000 tokenów na godzinę. To sprawia, że arytmetyka jest wyjątkowo przejrzysta, i to właśnie tę liczbę należy wpisać do budżetu, a nie stawkę za milion.
• Flash TTS standard — 0,50 USD za milion tokenów tekstowych na wejściu, 9,00 USD za milion tokenów audio na wyjściu do 31 grudnia 2026 r., a następnie 1,00 USD i 18,00 USD. Batch i Flex wynoszą 0,25 USD i 4,50 USD; Priority wynosi 0,90 USD i 16,20 USD.
• Flash-Lite TTS standard — 0,50 USD i 6,00 USD do tej samej daty, następnie 1,00 USD i 12,00 USD. Batch i Flex 0,25 USD i 3,00 USD; Priority 0,90 USD i 10,80 USD.
• W sekundach — Flash TTS wynosi około 0,81 USD za godzinę wygenerowanego audio w okresie promocyjnym i około 1,62 USD po jego zakończeniu; Flash-Lite TTS to około 0,54 USD, a następnie 1,08 USD.
• W porównaniu z modelem, który zastępuje — gemini-3.1-flash-tts-previewjest wyceniany na 1,00 USD i 20,00 USD za milion, więc pozycja dotycząca wyjścia audio spadła o 55 procent w przypadku Flash TTS i o 70 procent w przypadku Flash-Lite TTS.
Nie planuj w oparciu o promocyjną liczbę. Google publikuje obie kolumny w tej samej tabeli, co oznacza, że styczniowa stawka nie jest pogłoską, którą odkryje się później — jest na karcie już dziś, a każdy szacunek za tysiąc minut oparty na 0,81 USD musi przetrwać podwojenie.
Jedna niezależna liczba i kilka, które takie nie są
Ogłoszenie Google zaczyna się od wyników benchmarków i należy je czytać dokładnie tak, jakimi są. Firma podaje, że Flash TTS zajął pierwsze miejsce w Voice Design Benchmark firmy Hume AI z wynikiem 71,4, przodował w modelowaniu akcentu z wynikiem 60,8, a Flash TTS i Flash-Lite TTS uplasowały się odpowiednio na pierwszym i drugim miejscu w Overall Quality Index firmy Hume, z mocnymi pozycjami w ślepych preferencjach w Voice Arena dla języka japońskiego, portugalskiego brazylijskiego, wietnamskiego, współczesnego standardowego arabskiego, hiszpańskiego meksykańskiego i hindi. Wszystko raportowane przez dostawcę; żaden z przebiegów nie jest publiczny.
Warto zauważyć pewien szczegół na tej liście. Alan Cowen, wymieniony jako autor ogłoszenia Google, jest założycielem Hume AI — laboratorium, którego Voice Design Benchmark dostarcza liczbę z nagłówka. To nie czyni tej liczby błędną, a benchmark Hume’a jest prawdziwy, ale te dwie rzeczy nie są od siebie niezależne, a czytelnik rozważający 71,4 powinien o tym wiedzieć, zanim powtórzy ją jako walidację strony trzeciej.
Niezależnie zebrany wynik znajduje się w Provider Voice Arena Artificial Analysis, zarejestrowany na potrzeby tego artykułu 24 września 2026 r.: Gemini 3.8 Flash TTS zajmuje drugie miejsce z Elo 1 260 i 17-punktowym przedziałem na podstawie 1 999 próbek, za Cartesia Sonic 3.6 z wynikiem 1 273. Gemini 3.8 Flash-Lite TTS jest szósty z wynikiem 1 235. Zastępowany model, Gemini 3.1 Flash TTS, jest dziesiąty z wynikiem 1 199 na podstawie 3 430 próbek. Preferencja słuchaczy w ślepym teście, a nie własna ewaluacja laboratorium — i jedyny wskaźnik jakości, którego Google tu nie zleciło.

Gdzie można to uruchomić, a gdzie jeszcze nie
Oba modele są już dziś dostępne w Gemini API i Google AI Studio, bez listy oczekujących. Powierzchnie dla konsumentów i przedsiębiorstw są raczej przygotowywane niż wdrożone: Flash TTS trafi do Gemini Notebook, a Flash-Lite TTS do Google Vids, dostęp do Gemini Enterprise jest opisywany jako „wkrótce”, a remiksowanie głosu — dostosowywanie barwy, wysokości, tempa i akcentu istniejącego głosu — jest wymieniane jako funkcja przyszła, a nie obecna. Jeśli Twój plan opiera się na remiksowaniu, to ono jeszcze nie istnieje.
Po naszej stronie, szczerość przede wszystkim: punkty końcowe Gemini 3.8 TTS nie znajdują się w tabeli routingu OrcaRouter. Generacja, którą zastępują, to — google/gemini-3.1-flash-tts-preview znajduje się w katalogu w tej samej cenie 1,00 USD i 20,00 USD za milion tokenów, jaką publikuje Google, ponieważ cena katalogowa dostawcy jest przekazywana bez marży, i odpowiada na tym samym /v1/audio/speech punkcie końcowym, na który Twoje SDK zgodne z OpenAI już celuje. To ma większe znaczenie, niż się wydaje w przypadku obciążenia związanego z mową, ponieważ to, co w rzeczywistości kupujesz, to stabilny punkt końcowy, który Twoja aplikacja może wywoływać, podczas gdy modele za nim się zmieniają. Twój kod przechowuje ciąg modelu; katalog przechowuje routing. Gdy okno promocyjne Google zamknie się 31 grudnia, a Flash TTS podwoi cenę, cena modelu z routingiem zmienia się tego samego dnia, a nie przy następnym odnowieniu umowy — a model, który ulegnie awarii, przełączy się awaryjnie, zamiast pociągnąć za sobą Twoją kolejkę narracji.

Jeśli oceniasz tę generację przed podjęciem decyzji, tanim eksperymentem jest eksperyment dwupoziomowy. Przepuść ten sam skrypt przez Flash TTS i Flash-Lite TTS, ponieważ schemat jest identyczny, a różnica to jeden parametr — potem zdecyduj na podstawie własnego audio, a nie wykresu z benchmarku, i sprawdź w Artificial Analysis, czy różnica w jakości przetrwa swoje przedziały błędów, zanim dopłacisz. W przypadku dużego projektu narracyjnego dopłata to prawdziwe pieniądze; w przypadku bota wsparcia czytającego na głos numer telefonu nie kupuje ci ona w oczywisty sposób niczego, co słuchacz mógłby usłyszeć.
