
Gemini 3.8 Live vs Gemini 3.8 TTS: Pętla konwersacyjna i głos czytający dzielą nazwę generacji
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 36 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 181 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Gemini 3.8 Live to model zamiany mowy na mowę, który zadebiutował 15 września 2026 r. jako gemini-3.8-live i gemini-3.8-live-extended-thinking. „Gemini 3.8 TTS” nie jest w ogóle modelem — to termin zbiorczy, którego materiały z premiery, w tym sam tytuł wpisu Google’a, używają na określenie pary endpointów zamiany tekstu na mowę, które pojawiły się 23 września 2026 r. jako gemini-3.8-flash-tts i gemini-3.8-flash-lite-tts. Nie jest to więc typowa strona porównawcza, na której dwa produkty walczą o jedno zadanie. To strona o dwóch zadaniach, które dzielą ten sam numer generacji, oraz o konkretnym błędzie, jaki popełniają ludzie, gdy traktują słowa „Live” i „TTS” jako dwa warianty tego samego.
Fork ukrywany przez współdzielony numer generacji
Dokumentacja Google dotycząca generowania mowy sama wyznacza granicę, a to zdanie łatwo przeoczyć: „Funkcja TTS różni się od generowania mowy udostępnianego przez Live API”. Ten sam fragment wyjaśnia dlaczego, a powód jest strukturalny, a nie wynika z jakości. Live API powstało z myślą o „interaktywnym, nieustrukturyzowanym dźwięku oraz multimodalnych danych wejściowych i wyjściowych”. TTS przez Gemini API „jest dostosowane do scenariuszy wymagających dokładnego odczytywania tekstu z precyzyjną kontrolą”. Późniejsza uwaga wprost określa kształt danych wejściowych: modele TTS przyjmują wyłącznie tekst i zwracają wyłącznie dźwięk.
To jedno ograniczenie — tekst na wejściu, dźwięk na wyjściu, brak wejścia audio — to całe porównanie. Model Gemini 3.8 Live słyszy osobę, która do niego mówi. Model Gemini 3.8 Flash TTS lub Flash-Lite TTS nigdy nikogo nie słyszy; odczytuje ciąg znaków i wykonuje go. Wszystko inne wynika z tego: benchmarki, które istnieją dla jednego, są bez znaczenia dla drugiego, ceny są rozliczane w różnych jednostkach, a tryby awarii nie są w ogóle porównywalne.
To ma znaczenie, ponieważ te dwa przypadki użycia wyglądają identycznie z zewnątrz. Zarówno agent głosowy, jak i potok narracji ostatecznie emitują mowę brzmiącą jak ludzka. Tylko jeden z nich można przerwać.
Dokąd faktycznie prowadzi „Gemini 3.8 TTS”
Otwórz tabelę obsługiwanych modeli dla generowania mowy przez API Gemini, a znajdziesz cztery wpisy TTS i żadnego wpisu o nazwie Gemini 3.8 TTS. Dwa z nich należą do tej generacji: Gemini 3.8 Flash TTS, identyfikator modelu gemini-3.8-flash-tts, obsługujący 130 języków, oraz Gemini 3.8 Flash-Lite TTS, identyfikator modelu gemini-3.8-flash-lite-tts, obsługujący 101 języków. Pozostałe dwa — Gemini 3.1 Flash TTS Preview i Gemini 2.5 Pro Preview TTS — to generacja preview, którą zastępuje Flash-Lite.
Więc kiedy ktoś mówi „Gemini 3.8 TTS”, zwykle ma na myśli poziom Flash, ponieważ to ten, od którego zaczyna się wpis o premierze, i ten, który ranking Arena stawia najwyżej. Kiedy mówi tak o działającym agencie głosowym, nie wskazuje na nic, ponieważ to, czego chce, znajduje się w innym punkcie końcowym, o innej nazwie i z inną umową wejściową.
Jest trzecia kolizja, którą warto nazwać, ponieważ prowadzi do najgorszych rad. Gemini 3.8 Live nie jest modelem zamiany tekstu na mowę z dodatkowymi funkcjami. Jest modelem zamiany mowy na mowę, a powód, dla którego kosztuje więcej za jednostkę, jest taki, że wykonuje więcej pracy na jednostkę: słucha, rozumuje w trakcie wypowiedzi, obsługuje przerwania, a w wariancie Extended Thinking namyśla się przed udzieleniem odpowiedzi.
Jedyna liczba, która naprawdę może się równać
Oceny jakości nie przenoszą się między tymi dwiema rodzinami; nie ma jednej tablicy, która ocenia narratora i rozmówcę na tej samej osi. Pieniądze owszem się przenoszą, gdy uczciwie wybierzesz jednostkę, a uczciwą jednostką dla wszystkiego, co głosowe, jest godzina audio.
• Rozliczanie na wejściu — Gemini 3.8 Live rozlicza się za minutę dźwięku: 0,005 USD za minutę na wejściu i 0,018 USD za minutę na wyjściu, podczas gdy Gemini 3.8 Flash TTS rozlicza się za milion tokenów audio: 9,00 USD do 31 grudnia 2026 r. i 18,00 USD po tej dacie
• Rozliczanie na wyjściu — dwukierunkowe audio w Gemini 3.8 Live kosztuje około 1,38 USD za godzinę jednoczesnego wejścia i wyjścia według cennika, przed jakimkolwiek buforowaniem promptów, podczas gdy Gemini 3.8 Flash TTS to strumień jednokierunkowy, a milion znaków gotowej narracji to 16,5 USD według normalizacji Artificial Analysis
• Wejście tekstowe — Gemini 3.8 Live rozlicza tekst i dźwięk w osobnych pozycjach: 0,75 USD za milion tokenów tekstu na wejściu i 4,50 USD na wyjściu, podczas gdy punkty końcowe TTS rozliczają wejście tekstowe po 0,50 USD za milion tokenów
• Poziom Flash-Lite — Gemini 3.8 Live nie ma tańszego odpowiednika; wybór to Live albo Extended Thinking, podczas gdy Gemini 3.8 Flash-Lite TTS jest wyceniany na 6,00 USD, a następnie 12,00 USD za milion tokenów audio, przy czym Artificial Analysis podaje 11,0 USD za milion znaków
• Format wejścia — Gemini 3.8 Live: dźwięk, wideo i tekst na wejściu, dźwięk na wyjściu, podczas gdy punkty końcowe TTS: tekst na wejściu, dźwięk na wyjściu
Wartość Live to nasze wyliczenie na podstawie publikowanych przez Google stawek za minutę, a nie publikowana przez Google wartość godzinowa. Wartości dla znaków to normalizacja Artificial Analysis i to je należy podawać, gdy porównujesz poziomy syntezy. Należy zauważyć, że własna tablica Speech to Speech Artificial Analysis zawiera osobną kolumnę kosztu na godzinę wejściowego audio dla modeli Live — około 3,50 USD dla Gemini 3.8 Live i 0,84 USD dla wariantu Extended Thinking — co stanowi jeszcze inną normalizację i nie należy tego zestawiać z cennikiem stawek za minutę tak, jakby oba były tym samym pomiarem.

Co się psuje, gdy wybierzesz nie to, co trzeba?
Tryby awarii są pouczające, ponieważ tak bardzo się od siebie różnią.
Wywołujesz punkt końcowy TTS, gdy potrzebowałeś pętli konwersacji, a nic nie zwraca błędów. Żądanie zwraca prawidłowe audio. Otrzymujesz płynną, dobrze odczytaną odpowiedź na stały ciąg znaków, a potem ciszę — ponieważ nigdy nic nie słuchało. Zespoły odkrywają to, gdy tworzą swój pierwszy test barge-in i stwierdzają, że "użytkownik" musi poczekać, aż cały klip się skończy, zanim rozpocznie się następna tura. Przystosowanie punktu końcowego syntezy do konwersacji oznacza dodanie rozpoznawania mowy, polityki przechodzenia tur i mechanizmu przerwania wokół niego, w którym to momencie odbudowujesz kaskadę i płacisz za dwa modele zamiast za jeden.
Wywołujesz punkt końcowy Live, gdy potrzebujesz narracji, i płacisz za funkcję, której nie używasz. Model Live jest rozliczany w obu kierunkach, ponieważ oczekuje obu kierunków. W przypadku audiobooka lub lektora do filmu szkoleniowego strona wejściowa to skrypt, który nigdy się nie zmienia, a model nie musi niczego słyszeć. Kupujesz pętlę konwersacyjną, aby przeczytać dokument na głos.
Jedyny przypadek, w którym wybór jest naprawdę trudny, to kaskada: rozpoznawanie, potem rozumowanie, potem synteza. Ta architektura nie jest przestarzała i w wielu systemach produkcyjnych nadal jest właściwym rozwiązaniem, ponieważ pozwala niezależnie wymieniać każdy etap i wybierać innego dostawcę dla każdego z nich. Płacisz za to opóźnieniem i tracisz prozodię, którą pojedynczy model end-to-end zachowuje przy przejściu między turami. Ten kompromis jest realny w obie strony.
Tam, gdzie trasa już istnieje
OrcaRouter nie oferuje punktów końcowych Gemini 3.8 Live ani punktów końcowych 3.8 TTS, i warto to powiedzieć przed czymkolwiek innym na temat routingu, ponieważ przy tak szerokim katalogu łatwo założyć coś przeciwnego. To, co katalog rzeczywiście zawiera, to reszta rodziny — google/gemini-3.8-flash wśród 28 modeli Google i ponad 200 modeli łącznie, z jednego klucza w cenie katalogowej dostawcy bez marży.
To ma szczególne znaczenie w przypadku kaskady. Jeśli Twoja architektura to rozpoznawanie, potem rozumowanie, a następnie synteza, etap rozumowania jest tym, na którym opłaca się mieć jeden klucz do wielu dostawców, ponieważ to etap, który najczęściej podmieniasz, i etap, na którym obniżka ceny u dostawcy powinna trafić na Twój rachunek tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. To także etap, na którym automatyczne przełączanie awaryjne się opłaca: kaskada ma trzy miejsca, w których może się zepsuć, a środkowe najtaniej jest objąć redundancją.

Krótka reguła decyzyjna
Jeśli model ma odpowiadać na coś, czego wcześniej nie miał w formie tekstu, potrzebujesz Gemini 3.8 Live, a budżet powinieneś planować na podstawie stawek Google za minutę audio i liczyć się z tym, że będziesz musiał zastanowić się, który z dwóch wariantów jest ci potrzebny. Jeśli tekst jest już napisany, a zadaniem jest jego wygłoszenie, potrzebujesz Gemini 3.8 Flash TTS lub Flash-Lite TTS, a budżet powinieneś planować na milion znaków i wybrać poziom na podstawie pokrycia językowego oraz tego, czy różnica w jakości jest warta różnicy w cenie.
A jeśli ktoś prosi cię o porównanie „Gemini 3.8 Live i Gemini 3.8 TTS” tak, jakby to były dwa produkty, pierwszą użyteczną rzeczą, jaką możesz zrobić, jest zapytanie: który endpoint? Nazwa z briefu nie wskazuje jednego, a odpowiedź zmienia architekturę, a nie tylko fakturę.

