Wygenerowana karta hero dla „Gemini 3.8 Live vs Gemini 3.8 TTS" na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi. Lewa kolumna z nagłówkiem „Dostępne w Live API" zawiera pozycje „gemini-3.8-live", „słyszy i mówi", „dźwięk na wejściu, dźwięk na wyjściu"; prawa kolumna z nagłówkiem „Dostępne w punktach końcowych TTS" zawiera pozycje „gemini-3.8-flash-tts", „czyta zapisany tekst", „tekst na wejściu, dźwięk na wyjściu". W stopce widnieje zdanie: „Żaden z nich nie nazywa się Gemini 3.8 TTS." Logo OrcaRouter jest nałożone w prawym dolnym narożniku.
Guides & Insights

Gemini 3.8 Live vs Gemini 3.8 TTS: Pętla konwersacyjna i głos czytający dzielą nazwę generacji

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Gemini 3.8 Live to model zamiany mowy na mowę, który zadebiutował 15 września 2026 r. jako gemini-3.8-live i gemini-3.8-live-extended-thinking. „Gemini 3.8 TTS” nie jest w ogóle modelem — to termin zbiorczy, którego materiały z premiery, w tym sam tytuł wpisu Goog​le’a, używają na określenie pary endpointów zamiany tekstu na mowę, które pojawiły się 23 września 2026 r. jako gemini-3.8-flash-tts i gemini-3.8-flash-lite-tts. Nie jest to więc typowa strona porównawcza, na której dwa produkty walczą o jedno zadanie. To strona o dwóch zadaniach, które dzielą ten sam numer generacji, oraz o konkretnym błędzie, jaki popełniają ludzie, gdy traktują słowa „Live” i „TTS” jako dwa warianty tego samego.

Fork ukrywany przez współdzielony numer generacji

Dokumentacja Google dotycząca generowania mowy sama wyznacza granicę, a to zdanie łatwo przeoczyć: „Funkcja TTS różni się od generowania mowy udostępnianego przez Live API”. Ten sam fragment wyjaśnia dlaczego, a powód jest strukturalny, a nie wynika z jakości. Live API powstało z myślą o „interaktywnym, nieustrukturyzowanym dźwięku oraz multimodalnych danych wejściowych i wyjściowych”. TTS przez Gemini API „jest dostosowane do scenariuszy wymagających dokładnego odczytywania tekstu z precyzyjną kontrolą”. Późniejsza uwaga wprost określa kształt danych wejściowych: modele TTS przyjmują wyłącznie tekst i zwracają wyłącznie dźwięk.

To jedno ograniczenie — tekst na wejściu, dźwięk na wyjściu, brak wejścia audio — to całe porównanie. Model Gemini 3.8 Live słyszy osobę, która do niego mówi. Model Gemini 3.8 Flash TTS lub Flash-Lite TTS nigdy nikogo nie słyszy; odczytuje ciąg znaków i wykonuje go. Wszystko inne wynika z tego: benchmarki, które istnieją dla jednego, są bez znaczenia dla drugiego, ceny są rozliczane w różnych jednostkach, a tryby awarii nie są w ogóle porównywalne.

To ma znaczenie, ponieważ te dwa przypadki użycia wyglądają identycznie z zewnątrz. Zarówno agent głosowy, jak i potok narracji ostatecznie emitują mowę brzmiącą jak ludzka. Tylko jeden z nich można przerwać.

Dokąd faktycznie prowadzi „Gemini 3.8 TTS”

Otwórz tabelę obsługiwanych modeli dla generowania mowy przez API Gemini, a znajdziesz cztery wpisy TTS i żadnego wpisu o nazwie Gemini 3.8 TTS. Dwa z nich należą do tej generacji: Gemini 3.8 Flash TTS, identyfikator modelu gemini-3.8-flash-tts, obsługujący 130 języków, oraz Gemini 3.8 Flash-Lite TTS, identyfikator modelu gemini-3.8-flash-lite-tts, obsługujący 101 języków. Pozostałe dwa — Gemini 3.1 Flash TTS Preview i Gemini 2.5 Pro Preview TTS — to generacja preview, którą zastępuje Flash-Lite.

Więc kiedy ktoś mówi „Gemini 3.8 TTS”, zwykle ma na myśli poziom Flash, ponieważ to ten, od którego zaczyna się wpis o premierze, i ten, który ranking Arena stawia najwyżej. Kiedy mówi tak o działającym agencie głosowym, nie wskazuje na nic, ponieważ to, czego chce, znajduje się w innym punkcie końcowym, o innej nazwie i z inną umową wejściową.

Jest trzecia kolizja, którą warto nazwać, ponieważ prowadzi do najgorszych rad. Gemini 3.8 Live nie jest modelem zamiany tekstu na mowę z dodatkowymi funkcjami. Jest modelem zamiany mowy na mowę, a powód, dla którego kosztuje więcej za jednostkę, jest taki, że wykonuje więcej pracy na jednostkę: słucha, rozumuje w trakcie wypowiedzi, obsługuje przerwania, a w wariancie Extended Thinking namyśla się przed udzieleniem odpowiedzi.

Jedyna liczba, która naprawdę może się równać

Oceny jakości nie przenoszą się między tymi dwiema rodzinami; nie ma jednej tablicy, która ocenia narratora i rozmówcę na tej samej osi. Pieniądze owszem się przenoszą, gdy uczciwie wybierzesz jednostkę, a uczciwą jednostką dla wszystkiego, co głosowe, jest godzina audio.

• Rozliczanie na wejściu — Gemini 3.8 Live rozlicza się za minutę dźwięku: 0,005 USD za minutę na wejściu i 0,018 USD za minutę na wyjściu, podczas gdy Gemini 3.8 Flash TTS rozlicza się za milion tokenów audio: 9,00 USD do 31 grudnia 2026 r. i 18,00 USD po tej dacie
• Rozliczanie na wyjściu — dwukierunkowe audio w Gemini 3.8 Live kosztuje około 1,38 USD za godzinę jednoczesnego wejścia i wyjścia według cennika, przed jakimkolwiek buforowaniem promptów, podczas gdy Gemini 3.8 Flash TTS to strumień jednokierunkowy, a milion znaków gotowej narracji to 16,5 USD według normalizacji Artificial Analysis
• Wejście tekstowe — Gemini 3.8 Live rozlicza tekst i dźwięk w osobnych pozycjach: 0,75 USD za milion tokenów tekstu na wejściu i 4,50 USD na wyjściu, podczas gdy punkty końcowe TTS rozliczają wejście tekstowe po 0,50 USD za milion tokenów
• Poziom Flash-Lite — Gemini 3.8 Live nie ma tańszego odpowiednika; wybór to Live albo Extended Thinking, podczas gdy Gemini 3.8 Flash-Lite TTS jest wyceniany na 6,00 USD, a następnie 12,00 USD za milion tokenów audio, przy czym Artificial Analysis podaje 11,0 USD za milion znaków
• Format wejścia — Gemini 3.8 Live: dźwięk, wideo i tekst na wejściu, dźwięk na wyjściu, podczas gdy punkty końcowe TTS: tekst na wejściu, dźwięk na wyjściu

Wartość Live to nasze wyliczenie na podstawie publikowanych przez Google stawek za minutę, a nie publikowana przez Google wartość godzinowa. Wartości dla znaków to normalizacja Artificial Analysis i to je należy podawać, gdy porównujesz poziomy syntezy. Należy zauważyć, że własna tablica Speech to Speech Artificial Analysis zawiera osobną kolumnę kosztu na godzinę wejściowego audio dla modeli Live — około 3,50 USD dla Gemini 3.8 Live i 0,84 USD dla wariantu Extended Thinking — co stanowi jeszcze inną normalizację i nie należy tego zestawiać z cennikiem stawek za minutę tak, jakby oba były tym samym pomiarem.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

Co się psuje, gdy wybierzesz nie to, co trzeba?

Tryby awarii są pouczające, ponieważ tak bardzo się od siebie różnią.

Wywołujesz punkt końcowy TTS, gdy potrzebowałeś pętli konwersacji, a nic nie zwraca błędów. Żądanie zwraca prawidłowe audio. Otrzymujesz płynną, dobrze odczytaną odpowiedź na stały ciąg znaków, a potem ciszę — ponieważ nigdy nic nie słuchało. Zespoły odkrywają to, gdy tworzą swój pierwszy test barge-in i stwierdzają, że "użytkownik" musi poczekać, aż cały klip się skończy, zanim rozpocznie się następna tura. Przystosowanie punktu końcowego syntezy do konwersacji oznacza dodanie rozpoznawania mowy, polityki przechodzenia tur i mechanizmu przerwania wokół niego, w którym to momencie odbudowujesz kaskadę i płacisz za dwa modele zamiast za jeden.

Wywołujesz punkt końcowy Live, gdy potrzebujesz narracji, i płacisz za funkcję, której nie używasz. Model Live jest rozliczany w obu kierunkach, ponieważ oczekuje obu kierunków. W przypadku audiobooka lub lektora do filmu szkoleniowego strona wejściowa to skrypt, który nigdy się nie zmienia, a model nie musi niczego słyszeć. Kupujesz pętlę konwersacyjną, aby przeczytać dokument na głos.

Jedyny przypadek, w którym wybór jest naprawdę trudny, to kaskada: rozpoznawanie, potem rozumowanie, potem synteza. Ta architektura nie jest przestarzała i w wielu systemach produkcyjnych nadal jest właściwym rozwiązaniem, ponieważ pozwala niezależnie wymieniać każdy etap i wybierać innego dostawcę dla każdego z nich. Płacisz za to opóźnieniem i tracisz prozodię, którą pojedynczy model end-to-end zachowuje przy przejściu między turami. Ten kompromis jest realny w obie strony.

Tam, gdzie trasa już istnieje

OrcaRouter nie oferuje punktów końcowych Gemini 3.8 Live ani punktów końcowych 3.8 TTS, i warto to powiedzieć przed czymkolwiek innym na temat routingu, ponieważ przy tak szerokim katalogu łatwo założyć coś przeciwnego. To, co katalog rzeczywiście zawiera, to reszta rodziny — google/gemini-3.8-flash wśród 28 modeli Google i ponad 200 modeli łącznie, z jednego klucza w cenie katalogowej dostawcy bez marży.

To ma szczególne znaczenie w przypadku kaskady. Jeśli Twoja architektura to rozpoznawanie, potem rozumowanie, a następnie synteza, etap rozumowania jest tym, na którym opłaca się mieć jeden klucz do wielu dostawców, ponieważ to etap, który najczęściej podmieniasz, i etap, na którym obniżka ceny u dostawcy powinna trafić na Twój rachunek tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. To także etap, na którym automatyczne przełączanie awaryjne się opłaca: kaskada ma trzy miejsca, w których może się zepsuć, a środkowe najtaniej jest objąć redundancją.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

Krótka reguła decyzyjna

Jeśli model ma odpowiadać na coś, czego wcześniej nie miał w formie tekstu, potrzebujesz Gemini 3.8 Live, a budżet powinieneś planować na podstawie stawek Google za minutę audio i liczyć się z tym, że będziesz musiał zastanowić się, który z dwóch wariantów jest ci potrzebny. Jeśli tekst jest już napisany, a zadaniem jest jego wygłoszenie, potrzebujesz Gemini 3.8 Flash TTS lub Flash-Lite TTS, a budżet powinieneś planować na milion znaków i wybrać poziom na podstawie pokrycia językowego oraz tego, czy różnica w jakości jest warta różnicy w cenie.

A jeśli ktoś prosi cię o porównanie „Gemini 3.8 Live i Gemini 3.8 TTS” tak, jakby to były dwa produkty, pierwszą użyteczną rzeczą, jaką możesz zrobić, jest zapytanie: który endpoint? Nazwa z briefu nie wskazuje jednego, a odpowiedź zmienia architekturę, a nie tylko fakturę.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.