
Gemini 3.8 Flash TTS wita się: Google dzieli swoją linię syntezy mowy na dwie części i obniża cenę
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Dostawca wypuścił dwa modele mowy 23 września 2026 r., a ogłoszenie napisano tak, jakby sensacją była jakość głosu. Nie jest. Gemini 3.8 Flash TTSi Gemini 3.8 Flash-Lite TTSto pierwsze modele zamiany tekstu na mowę, jakie dostawca udostępnił w Gemini Developer API w cenie niższej niż model w wersji preview, który zastępują — a dla każdego, kto gdzie indziej płacił za znak, właśnie to zmienia pozycję w budżecie. Stawka za wygenerowane audio w Gemini 3.8 Flash TTS wynosi 9,00 USD za milion tokenów do końca 2026 r. Audio rozlicza się po 25 tokenów na sekundę, co daje około 0,02 centa za sekundę wygenerowanej mowy. Model, który zastępuje, Gemini 3.1 Flash TTS Preview, był wyceniony na 20,00 USD za milion tokenów audio.
Druga połowa tej historii jest taka, że są teraz dwa modele, a nie jeden. Google podzieliło tę linię: Flash TTS obsługuje pełny zestaw języków i ma wyższą stawkę za audio, a Flash-Lite TTS obsługuje krótszą listę języków i ma niższą stawkę. To odmienny kształt od rozwiązania z pojedynczym modelem w wersji zapoznawczej, które jest dostępne w API od kwietnia, i pokazuje, jak według Google wygląda rynek — niewielka liczba aplikacji, które potrzebują 130 języków i klonowania głosu, oraz znacznie większa liczba takich, które potrzebują jedynie sprawnego angielskiego głosu do bota wsparcia i niczego więcej.
Co faktycznie zostało wydane 23 września?
Oba modele są ogólnie dostępne w Gemini API i w AI Studio od momentu ogłoszenia, a nie za listą oczekujących. Nazwy w API to gemini-3.8-flash-tts oraz gemini-3.8-flash-lite-tts.
• Flash TTS — 130 języków, język automatycznie wykrywany z tekstu, 30 gotowych głosów studyjnych, w tym Kore i Puck.
• Flash-Lite TTS — 101 języków, ten sam interfejs projektowania głosu, pozycjonowany jako warstwa o dużym wolumenie.
• Oba — projektowanie głosu na podstawie opisu w języku naturalnym, wskazówki interpretacyjne dla każdej kwestii, inscenizacja scen z dwoma rozmówcami oraz sygnały niewerbalne zapisane bezpośrednio w scenariuszu.
• Wyjście — WAV 24 kHz mono 16-bitowy PCM ze znakiem na punkcie końcowym typu unary; PCM bez nagłówka (audio/l16) na punkcie końcowym strumieniowym; audio/mulaw i audio/alaw również obsługiwane, z konfigurowalną częstotliwością próbkowania.
Cennik, za milion tokenów, warto przeczytać w całości, ponieważ poziomy różnią się czymś więcej niż tylko liczbą z nagłówka:
• Flash TTS Standard — 0,50 USD za tekst wejściowy / 9,00 USD za dźwięk wyjściowy, a od 1 stycznia 2027 r. wzrost do 1,00 USD / 18,00 USD.
• Flash TTS Batch i Flex — $0.25 / $4.50.
• Flash TTS Priorytet — $0,90 / $16,20.
Flash-Lite TTS Standard — $0,50 / $6,00, wzrost do $1,00 / $12,00 po 31 grudnia 2026 r.
• Flash-Lite TTS Batch i Flex — 0,25 USD / 3,00 USD.
• Flash-Lite TTS Priority — $0,90 / $10,80.
• Gemini 3.1 Flash TTS Preview, dla porównania — 1,00 USD / 20,00 USD, wsadowo 0,50 USD / 10,00 USD.
Na uwagę zasługuje okres promocyjny. Google wyceniło oba nowe modele na połowę stawki do końca roku i opublikowało dane po zakończeniu promocji w tej samej tabeli. Każdy, kto modeluje koszt na tysiąc minut, powinien użyć styczniowej wartości, a nie wrześniowej.

Projektowanie głosu to naprawdę nowa możliwość
Gotowe głosy to warunek konieczny. To, co Google dodało w wersji 3.8, to sposób na opisanie głosu słowami i otrzymanie go oraz sposób na sklonowanie go z krótkiej próbki z dołączoną weryfikacją zgody.
Voice design przyjmuje prompt w języku naturalnym — tempo, barwę, akcent, coś, na przesłuchiwanie czego normalnie spędziłbyś całe popołudnie — i zwraca gotowy do użycia głos bez nagrania referencyjnego. Voice replication działa w drugą stronę: dostarczasz 30-sekundową próbkę, system weryfikuje zgodę, a wynikowy głos jest oznaczony znakiem wodnym SynthID i poświadczeniami C2PA w wygenerowanym dźwięku. Voice remixing, który pozwala łączyć lub modyfikować istniejący głos niestandardowy, widnieje jako funkcja zapowiedziana na wkrótce, a nie już udostępniona.
Głosy niestandardowe występują w dwóch wariantach i zachowują się na tyle różnie, że rozróżnienie ma znaczenie w środowisku produkcyjnym. Stanowe głosy niestandardowe są przechowywane w projekcie, z limitem 200 na projekt, z czasem życia wynoszącym jeden rok. Głosy bezstanowe są identyfikowane przez voicekey_... uchwyt i wygasają po siedmiu dniach. Jeśli Twoja aplikacja przydziela głos dla każdego klienta, limit i TTL to dwie liczby, które decydują, czy potrzebujesz własnej warstwy przechowywania.
Kontrola sposobu wypowiedzi to druga połowa tego, co „nowe". Możesz poprowadzić kwestię tak, jak reżyserowałbyś aktora — tempo, akcent, rejestr emocjonalny — zamiast jedynie wybierać głos i liczyć na szczęście. Sceny z dwoma mówcami można zainscenizować w ramach jednego wywołania. A wokalizacje niewerbalne to pełnoprawne elementy scenariusza: <laughs>, <sigh> i <gasp> jako wskazówki w tekście, a do tego |mhm| i |yeah| na te drobne odgłosy podtrzymujące rozmowę, dzięki którym syntetyczna konwersacja brzmi jak rozmowa. Czytanie długich tekstów ma podobno zachowywać tożsamość mówcy przy minimalnym dryfie, a to właśnie ten tryb awarii ujawnia się najpierw, gdy generujesz 40-minutowy rozdział audiobooka.
Benchmarki i kto je przeprowadził
Materiały premierowe Google opierają się na dwóch zewnętrznych ewaluacjach i zestawie miejsc w rankingach Arena. Wszystkie one są raportowane przez dostawcę — Google je cytuje, a same przebiegi nie są publicznie dostępne — więc traktuj je jako twierdzenia, a nie pomiary.

• Benchmark projektowania głosu Hume AI — Gemini 3.8 Flash TTS zajął pierwsze miejsce z wynikiem 71,4 oraz pierwsze w modelowaniu akcentu z wynikiem 60,8.
• Wskaźnik ogólnej jakości Hume — Flash TTS na pierwszym miejscu, Flash-Lite TTS na drugim.
• Ślepa preferencja w Speech Arena — czołowe miejsca zdobyte w językach: japońskim, portugalskim brazylijskim, wietnamskim, współczesnym standardowym arabskim, hiszpańskim meksykańskim i hindi.
• W porównaniu z Gemini 3.1 Flash TTS — Google twierdzi, że zyskuje pod względem spójności długich form i kontroli nad scenariuszem z dwoma mówcami, czyli dokładnie w tych dwóch obszarach, dla których zaprojektowano funkcje kierowania sposobem wypowiedzi.
Jedną udokumentowaną rozbieżność warto zaznaczyć, ponieważ zdezorientuje każdego, kto porównuje źródła. W poście na blogu opisano bibliotekę ponad 2000 głosów gotowych do użycia produkcyjnego. Dokumentacja dla programistów opisuje „setki” głosów w Extended Voice Library obok 30 wstępnie przygotowanych głosów studyjnych. Publikacje zewnętrzne podawały liczby jeszcze o rząd wielkości wyższe. Tych danych nie da się uzgodnić z zewnątrz — uczciwa interpretacja jest taka, że domyślnie otrzymywany zestaw wstępnie przygotowany liczy 30 pozycji, Extended Voice Library jest większa i opisana ogólnikowo, a duże liczby dotyczą katalogu obejmującego głosy tworzone przez użytkowników. Jeśli liczba głosów ma kluczowe znaczenie dla twojej decyzji, przetestuj konkretny głos, którego potrzebujesz, zamiast ufać którejkolwiek z tych trzech liczb.
Co to znaczy, jeśli na tym budujesz
Praktyczna zmiana polega na tym, że synteza mowy przeniosła się ze specjalistycznej pozycji kosztowej do czegoś, co można umieścić w tym samym modelu kosztów co tokeny językowe. Przy 25 tokenach na sekundę godzina wygenerowanego dźwięku to 90 000 tokenów audio, co przy promocyjnej stawce Flash-Lite wynosi około 54 centów. To jest tak tanie, że ciekawe pytanie przestaje brzmieć „czy stać nas na syntetyczny głos”, a zaczyna brzmieć „którego z dwóch poziomów potrzebuje ten obszar”.
Druga praktyczna zmiana polega na tym, że zupełnie nowy model TTS to dokładnie coś, co chcesz wypróbować, nie stawiając na nim swojej produkcyjnej ścieżki. To argument za umieszczeniem nowego modelu za routerem, a nie podłączaniem go bezpośrednio: OrcaRouter udostępnia 200+ modeli pod jednym kluczem w cenie katalogowej dostawcy, bez marży, a jego automatyczne przełączanie awaryjne sprawia, że nowy endpoint mowy, który się chwieje pod obciążeniem, przechodzi na model, któremu już ufasz, zamiast porzucać wywołanie. Nie hostujemy endpointów Gemini 3.8 TTS — pochodzą one z własnego API Google — ale warstwa tekstowa pod głosem oraz ścieżka awaryjna, gdy wywołanie syntezy się nie powiedzie, to właśnie te elementy, do których router tak naprawdę służy.
Czego jeszcze brakuje?
W premierze brakuje trzech rzeczy i każda z nich jest prawdziwym ograniczeniem, a nie czepianiem się szczegółów.
Nie istnieje żadna opublikowana niezależna ocena. Liczby Google dotyczące Hume'a to dostawca cytujący benchmark strony trzeciej, co jest lepsze niż nic i gorsze niż audyt. Dopóki Artificial Analysis lub odpowiednik nie opublikuje własnego przebiegu na tych samych modelach, każde twierdzenie o jakości w tym artykule należy czytać jako twierdzenie.
Nie ma opcji z otwartymi wagami. Oba modele są zamknięte i dostępne wyłącznie przez API, co stawia je w innej kategorii niż otwarte modele mowy, które ostatnio pojawiały się w tej samej arenie. Jeśli Twoje wdrożenie wymaga samodzielnego uruchamiania modelu, ta premiera nie odpowiada na Twoje potrzeby.
A promocyjne ceny się kończą. Stawka za Flash TTS na styczeń 2027 r. jest dwukrotnie wyższa niż stawka wrześniowa, a każdy biznesplan oparty na liczbach z premiery będzie wymagał przerobienia w pierwszym kwartale. To nie krytyka — publikowanie obu liczb z góry jest uczciwsze niż u większości — ale to liczba, która powinna trafić do arkusza kalkulacyjnego.
Google nie ogłosił, czy Gemini 3.1 Flash TTS Preview zostanie wycofany, a jedynie, że Flash-Lite TTS jest pozycjonowany jako jego podstawowy zamiennik. Każdy, kto nadal korzysta z modelu w wersji preview, powinien zaplanować migrację, zamiast czekać na powiadomienie o wyłączeniu.

