Een gegenereerde hero-kaart voor 'Gemini 3.8 Live vs Gemini 3.8 TTS' op een witte achtergrond met zachte blauw-cyaan gradiëntaccenten. Een linkerkolom met als kop 'Beschikbaar via de Live API' somt 'gemini-3.8-live', 'hoort en spreekt', 'audio in, audio uit' op; een rechterkolom met als kop 'Beschikbaar via de TTS-endpoints' somt 'gemini-3.8-flash-tts', 'leest geschreven tekst', 'tekst in, audio uit' op. Een voettekstregel luidt: 'Geen van beide heet Gemini 3.8 TTS.' Het OrcaRouter-logo is gecompositeerd in de rechteronderhoek.
Guides & Insights

Gemini 3.8 Live vs Gemini 3.8 TTS: een gesprekslus en een voorleesstem delen een generatienaam

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Gemini 3.8 Live is een spraak-naar-spraakmodel dat op 15 september 2026 werd uitgebracht als gemini-3.8-live en gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" is helemaal geen model — het is de parapluterm die de berichtgeving over de lancering, inclusief de titel van Googles eigen bericht, gebruikt voor het paar tekst-naar-spraak-eindpunten dat op 23 september 2026 verscheen als gemini-3.8-flash-tts en gemini-3.8-flash-lite-tts. Het is dus geen gebruikelijke versus-pagina, waarop twee producten om één taak strijden. Het is een pagina over twee taken die een generatienummer delen, en over de specifieke fout die mensen maken wanneer ze de woorden "Live" en "TTS" als twee varianten van hetzelfde ding beschouwen.

De fork die het gedeelde generatienummer verbergt

Google's documentatie over spraakgeneratie trekt zelf de grens, en de zin is gemakkelijk te missen: "De TTS-capaciteit verschilt van spraakgeneratie die via de Live API wordt geleverd." Dezelfde passage legt uit waarom, en de reden is structureel, niet een kwestie van kwaliteit. De Live API is gebouwd voor "interactieve, ongestructureerde audio en multimodale inputs en outputs." TTS via de Gemini API "is toegesneden op scenario's die het exact voorlezen van tekst met fijnmazige controle vereisen." Een latere opmerking maakt de vorm van de input expliciet: de TTS-modellen nemen alleen tekst aan en retourneren alleen audio.

Die ene beperking — tekst in, audio uit, geen audio-invoer — is de hele vergelijking. Een Gemini 3.8 Live-model hoort de persoon die ertegen praat. Een Gemini 3.8 Flash TTS- of Flash-Lite TTS-model hoort nooit iemand; het leest een string en voert die uit. Al het andere volgt daaruit: de benchmarks die voor het ene bestaan, zijn zinloos voor het andere, de prijsstelling wordt in verschillende eenheden gemeten, en de faalmodi zijn helemaal niet te vergelijken.

Dit is belangrijk omdat de twee gebruiksscenario's er van buitenaf identiek uitzien. Een voice-agent en een narratiepijplijn produceren uiteindelijk allebei menselijk klinkende spraak. Slechts één van de twee kan worden onderbroken.

Waar "Gemini 3.8 TTS" daadwerkelijk resolveert

Open de tabel met ondersteunde modellen voor spraakgeneratie van de Gemini API en je vindt vier TTS-vermeldingen en geen vermelding met de naam Gemini 3.8 TTS. Twee ervan behoren tot deze generatie: Gemini 3.8 Flash TTS, model-ID gemini-3.8-flash-tts, met 130 talen, en Gemini 3.8 Flash-Lite TTS, model-ID gemini-3.8-flash-lite-tts, met 101 talen. De andere twee — Gemini 3.1 Flash TTS Preview en Gemini 2.5 Pro Preview TTS — zijn de preview-generatie die Flash-Lite vervangt.

Dus als iemand "Gemini 3.8 TTS" zegt, verwijst diegene meestal naar de Flash-tier, want dat is degene waarmee het lanceringsbericht opent en die het Arena-board het hoogst rangschikt. Als ze het zeggen over een live voice-agent, verwijzen ze naar niets, want het ding dat ze willen zit op een ander endpoint met een andere naam en een ander inputcontract.

Er is een derde botsing die het benoemen waard is, omdat die het slechtste advies oplevert. Gemini 3.8 Live is geen tekst-naar-spraakmodel met extra functies. Het is een spraak-naar-spraakmodel, en de reden dat het per eenheid meer kost, is dat het per eenheid meer werk verricht: luisteren, redeneren tijdens het spreken, omgaan met onderbrekingen en, in de Extended Thinking-variant, beraadslagen voordat het antwoordt.

Het enige nummer dat echt vergelijkt

Kwaliteitsscores worden niet overgedragen tussen deze twee families; er is geen enkele board die een verteller en een gespreksgenoot op dezelfde as beoordeelt. Geld wordt wél overgedragen, zodra je de eenheid eerlijk kiest, en de eerlijke eenheid voor alles wat met stem te maken heeft, is het audio-uur.

• Afgerekend op invoer — Gemini 3.8 Live factureert per minuut audio, $ 0,005 per minuut in en $ 0,018 per minuut uit, tegenover Gemini 3.8 Flash TTS dat per miljoen audiotokens factureert, $ 9,00 tot en met 31 december 2026 en $ 18,00 daarna
• Afgerekend op uitvoer — Gemini 3.8 Live tweerichtingsaudio kost tegen listprijs ongeveer $ 1,38 voor een uur gelijktijdige invoer en uitvoer, vóór eventuele prompt-caching, tegenover Gemini 3.8 Flash TTS, dat een eenrichtingsstream is, waarbij één miljoen tekens afgewerkte narratie op $ 16.5 uitkomt volgens de normalisatie van Artificial Analysis
• Tekstinvoer — Gemini 3.8 Live factureert tekst en audio op aparte regels, $ 0,75 per miljoen teksttokens in en $ 4,50 uit, tegenover de TTS-endpoints die tekstinvoer factureren tegen $ 0,50 per miljoen tokens
• Flash-Lite-tier — Gemini 3.8 Live heeft geen goedkopere tegenhanger; de keuze is Live of Extended Thinking, tegenover Gemini 3.8 Flash-Lite TTS met een listprijs van $ 6,00 en daarna $ 12,00 per miljoen audiotokens, met Artificial Analysis op $ 11.0 per miljoen tekens
• Vorm van de invoer — Gemini 3.8 Live audio, video en tekst in, audio uit, tegenover de TTS-endpoints tekst in, audio uit

Het Live-cijfer is onze berekening op basis van de door Goog​le gepubliceerde tarieven per minuut, niet een door Goog​le gepubliceerd uurtarief. De cijfers per teken zijn de normalisatie van Artificial Analysis en zijn de cijfers die je moet citeren wanneer je syntheseniveaus met elkaar vergelijkt. Let op: het eigen Speech to Speech-overzicht van Artificial Analysis bevat een aparte kolom voor kosten per uur aan invoeraudio voor de Live-modellen — ongeveer $3,50 voor Gemini 3.8 Live en $0,84 voor de Extended Thinking-variant — wat weer een andere normalisatie is en niet naast de tariefkaart per minuut mag worden gelegd alsof het om dezelfde meting gaat.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

Wat gaat er mis als je de verkeerde kiest

De faalmodi zijn leerzaam omdat ze zo verschillend zijn.

Roep een TTS-endpoint aan wanneer je een gesprekslus nodig hebt en er niets misgaat. Het verzoek retourneert geldige audio. Je krijgt een vloeiend, goed voorgelezen antwoord op een vaste string, en dan stilte — omdat er nooit iets aan het luisteren was. Teams ontdekken dit wanneer ze hun eerste barge-in-test bouwen en merken dat de "gebruiker" moet wachten tot de volledige clip is afgelopen voordat de volgende beurt kan beginnen. Het achteraf een gesprek bouwen op een synthese-endpoint betekent spraakherkenning, een beurtwisselingsbeleid en een onderbrekingsmechanisme eromheen toevoegen, op welk punt je een cascade opnieuw hebt gebouwd en je voor twee modellen betaalt in plaats van één.

Als je een Live-endpoint aanroept terwijl je alleen narratie nodig had, betaal je voor mogelijkheden die je niet gebruikt. Een Live-model wordt in beide richtingen afgerekend, omdat het beide richtingen verwacht. Voor een audioboek of een voice-over voor een trainingsvideo is de invoerkant een script dat nooit verandert, en het model hoeft nooit iets te horen. Je koopt een gesprekslus om een document hardop voor te lezen.

De enige situatie waarin de keuze echt moeilijk is, is de cascade: eerst herkenning, dan redeneren, dan synthese. Die architectuur is niet achterhaald, en voor veel productiesystemen is ze nog steeds de juiste, omdat je elke fase onafhankelijk kunt vervangen en voor elke fase een andere leverancier kunt kiezen. Het kost je latentie en het kost je de prosodie die een enkel end-to-endmodel behoudt over een beurtgrens heen. De afweging is reëel in beide richtingen.

Waar de route al bestaat

OrcaRouter ondersteunt de Gemini 3.8 Live-endpoints of de 3.8 TTS-endpoints niet, en dat is het vermelden waard voordat we iets anders over routing zeggen, want het tegenovergestelde is makkelijk aan te nemen bij een catalogus van deze omvang. Wat de catalogus wél bevat, is de rest van de familie — google/gemini-3.8-flash onder 28 Goog​le-modellen en meer dan 200 modellen in totaal, met één sleutel tegen de lijstprijs van de provider, zonder opslag.

Dat is specifiek van belang voor de cascade. Als je architectuur bestaat uit herkenning, dan redenering en dan synthese, is de redeneerfase de fase waarin één sleutel bij meerdere leveranciers loont, omdat het de fase is die je het vaakst vervangt en de fase waarin een prijsverlaging van een leverancier dezelfde dag op je factuur zou moeten terechtkomen in plaats van bij de volgende contractverlenging. Het is ook de fase waarin automatische failover zich terugverdient: een cascade heeft drie plekken waar iets kan breken, en de middelste is het goedkoopst om redundant te maken.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

Een korte beslisregel

Als het model moet reageren op iets wat het nog niet als tekst had, dan wil je Gemini 3.8 Live, en dan moet je rekenen met Googles tarieven per minuut voor audio en erop voorbereid zijn dat je nadenkt over welke van de twee varianten je nodig hebt. Als de tekst al geschreven is en de taak is om die uit te voeren, dan wil je Gemini 3.8 Flash TTS of Flash-Lite TTS, en dan moet je budgetteren per miljoen tekens en het niveau kiezen op basis van taaldekking en op basis van of het kwaliteitsverschil het prijsverschil waard is.

En als je wordt gevraagd om "Gemini 3.8 Live en Gemini 3.8 TTS" te vergelijken alsof het twee producten zijn, is het eerste nuttige dat je kunt doen, vragen welk endpoint. De naam in de opdracht verwijst niet naar één endpoint, en het antwoord verandert de architectuur, niet alleen de factuur.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.